ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
Paper • 2607.13124 • Published • 19
None defined yet.
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards