ParaTempo: Efficient Parallel Reasoning via Temporal Confidence Paper • 2608.16425 • Published Aug 17 • 41
Useful Memories Become Faulty When Continuously Updated by LLMs Paper • 2605.12978 • Published May 13 • 19
Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning Paper • 2602.01058 • Published Feb 1 • 45