UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation Paper • 2609.12397 • Published 13 days ago • 46
Negative Self-Distillation: Learning to Reason by Avoiding Flaws Paper • 2609.11699 • Published 20 days ago • 36
DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training Paper • 2609.04094 • Published 27 days ago • 26
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests Paper • 2608.27831 • Published about 1 month ago • 33