Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers Paper • 2607.21594 • Published 18 days ago • 16
electricsheepafrica/africa-ghana-annual-distribution-of-casualties-a4dfb40a Viewer • Updated 23 days ago • 160 • 47 • 1
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget Paper • 2607.14952 • Published 25 days ago • 212
Shiki42/robotwin_blocks_ranking_rgb_hybrid_200_dynFcam Viewer • Updated 25 days ago • 97.1k • 365 • 1
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning Paper • 2606.29526 • Published Jun 28 • 170
Reflective Prompt Tuning through Language Model Function-Calling Paper • 2605.21781 • Published May 20 • 9
CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation Paper • 2605.25378 • Published May 25 • 62