Revisiting Complete Reasoning Traces for Post-Training Paper • 2609.07103 • Published 6 days ago • 17
Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation Paper • 2609.08798 • Published 5 days ago • 90
Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs Paper • 2609.04753 • Published 9 days ago • 16
On-Policy Delta Distillation for Multilingual Math Reasoning Paper • 2608.05802 • Published Aug 6 • 32
On-Policy Delta Distillation for Multilingual Math Reasoning Paper • 2608.05802 • Published Aug 6 • 32
On-Policy Delta Distillation for Multilingual Math Reasoning Paper • 2608.05802 • Published Aug 6 • 32
MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model Paper • 2602.06393 • Published Feb 6 • 5
MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model Paper • 2602.06393 • Published Feb 6 • 5
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published Jul 8 • 150
Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time Paper • 2606.15631 • Published Jun 14 • 17