Skill-based Agentic Evaluation for Real-time Data Science Tasks Paper • 2609.16487 • Published 23 days ago • 2
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds Paper • 2609.30199 • Published 14 days ago • 30
JEPA-Anything: Learning Predictive Models across Different Worlds Paper • 2609.20800 • Published 21 days ago • 77
Language Models that Play Chess and Explain Their Moves Paper • 2610.03695 • Published 6 days ago • 35
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research Paper • 2610.02202 • Published 7 days ago • 13
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs Paper • 2609.31590 • Published 13 days ago • 13
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning Paper • 2609.38147 • Published 9 days ago • 1
Finetuning with Sampling: SFT Learns Better Than You Think Paper • 2610.02140 • Published 7 days ago • 3
From cacophony to hierarchy: a principled framework for assessing AI consciousness Paper • 2609.35618 • Published 9 days ago • 1
How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text Paper • 2609.40295 • Published 8 days ago • 4
Invent a Dataset: Measuring dataset generation abilities with zero seed Paper • 2610.01674 • Published 7 days ago • 1
Improving Test-Time Scaling with Adaptive Looped Transformers Paper • 2609.35748 • Published 10 days ago • 59
Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents Paper • 2609.27334 • Published 15 days ago • 56
Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model Paper • 2609.40358 • Published 8 days ago • 19
KITE: KV-Invariant Transformer Expansion for Efficient Agentic LLM Scaling Paper • 2609.27294 • Published 15 days ago • 2