Dockerless: Environment-Free Program Verifier for Coding Agents Paper • 2606.28436 • Published Jun 26 • 115
Program-as-Weights: A Programming Paradigm for Fuzzy Functions Paper • 2607.02512 • Published Jul 2 • 309
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments Paper • 2607.02440 • Published Jul 2 • 51
Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks Paper • 2606.29082 • Published Jun 27 • 42
SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History Paper • 2606.08671 • Published Jun 23 • 47
AgenticDataBench: A Comprehensive Benchmark for Data Agents Paper • 2607.01647 • Published Jul 2 • 37
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Paper • 2606.32032 • Published Jun 30 • 29
EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning Paper • 2601.02163 • Published Jan 5 • 15
Tucker Attention: A generalization of approximate attention mechanisms Paper • 2603.30033 • Published Mar 31