Stealing Reasoning Traces from Proprietary LLM APIs Paper • 2608.09867 • Published 5 days ago • 99
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning Paper • 2607.07508 • Published Jul 8 • 30
Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization Paper • 2607.22334 • Published 22 days ago