Stealing Reasoning Traces from Proprietary LLM APIs Paper • 2608.09867 • Published Aug 10 • 122
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning Paper • 2607.07508 • Published Jul 8 • 34
Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization Paper • 2607.22334 • Published Jul 24