Representation-Space MMD for Diffusion Language Models Paper • 2610.06648 • Published 2 days ago • 23
LANTERN: Illuminating Hidden Mathematical Knowledge in Language Models Paper • 2609.32264 • Published 11 days ago • 49
Disaggregated Quantization: Specializing LLM Prefill and Decode Paper • 2609.26333 • Published 15 days ago • 93
One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining Paper • 2606.30634 • Published Jun 29 • 24
One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining Paper • 2606.30634 • Published Jun 29 • 24
Reasoning Shift: How Context Silently Shortens LLM Reasoning Paper • 2604.01161 • Published Apr 1 • 32