RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models Paper • 2608.26832 • Published Aug 27 • 1
LongCrafter: Towards Diverse Long-Context Understanding via Evidence-Graph-Guided Instruction Synthesis Paper • 2607.06160 • Published Jul 7 • 15
RedAct: Redacting Agent Capability Traces for Procedural Skill Protection Paper • 2606.10813 • Published Jun 10 • 25
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios Paper • 2604.25914 • Published Apr 28 • 43
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning Paper • 2603.02024 • Published Mar 2 • 47