Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation Paper • 2609.38024 • Published 8 days ago • 63
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents Paper • 2609.40325 • Published 7 days ago • 102
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models Paper • 2609.32607 • Published 11 days ago • 154
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR Paper • 2609.37868 • Published 8 days ago • 63
Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation Paper • 2609.35347 • Published 9 days ago • 180
Not All Ranks Are Equal: Budget-Aware LoRA Merging Across Tasks Paper • 2609.22237 • Published Sep 3 • 9
The Past Frames the Future: Memory for Autoregressive Video Generation Paper • 2609.28466 • Published 14 days ago • 64
FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection Paper • 2609.18766 • Published 21 days ago • 7
OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue Paper • 2609.21465 • Published 19 days ago • 151
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs Paper • 2609.26796 • Published 15 days ago • 37
Harness-Zero: Harness Distillation via Agent-as-Harness Paper • 2609.24974 • Published 16 days ago • 37
MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads Paper • 2609.09206 • Published Sep 5 • 11
When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation Paper • 2609.20511 • Published 20 days ago • 115
Gaze as Evidence for Common Grounding: A Cross-Corpus Analysis of MapTask and MUNDEX Paper • 2609.18011 • Published 21 days ago • 30
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents Paper • 2609.17523 • Published 22 days ago • 31
ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs Paper • 2609.10895 • Published 28 days ago • 54
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation Paper • 2609.11115 • Published 27 days ago • 174