
Reinforcement learning
Post-Training an Open MoE Model to Extract Drug-Protein Relations
Bojan Jakimovski, Petar Kalinovski · February 23, 2026
An ablation-driven study of GRPO-style reinforcement learning with LoRA on Trinity Mini for biomedical relation extraction, covering the training choices that materially changed performance.