VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control Paper • 2609.19554 • Published 12 days ago • 42
Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening Paper • 2609.18708 • Published 13 days ago • 82
Continual Learning Mechanisms Compose for Long-Horizon Memorization Paper • 2609.06986 • Published 22 days ago • 375
IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications Paper • 2609.10539 • Published 20 days ago • 25
Scaling Automatic Research Agents via World Models Paper • 2608.12564 • Published about 1 month ago • 482
Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy Paper • 2609.07470 • Published 22 days ago • 23
Using Grounded Theory for Agent Behavior Analysis at Scale Paper • 2608.30391 • Published 29 days ago • 19
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published Aug 14 • 286
Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus Paper • 2608.12149 • Published Aug 12 • 30
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 265
Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution Paper • 2608.07645 • Published Aug 7 • 27
Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains Paper • 2608.05138 • Published Aug 5 • 32
QQWorld: Quantile-Quantile Matching for World Model Regularization Paper • 2607.28415 • Published Jul 30 • 32