Agents in the Large: Perception-Centered Architecture for Persistent Agents Paper • 2608.30478 • Published Aug 31 • 12
AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments Paper • 2607.05174 • Published Jul 6 • 1
AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning Paper • 2606.24526 • Published Jun 23 • 6
AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning Paper • 2606.24526 • Published Jun 23 • 6
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents Paper • 2602.12984 • Published Feb 13 • 7
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development Paper • 2601.11077 • Published Jan 16 • 67
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development Paper • 2601.11077 • Published Jan 16 • 67
OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding Paper • 2601.10343 • Published Jan 15 • 2
Better Process Supervision with Bi-directional Rewarding Signals Paper • 2503.04618 • Published Mar 6, 2025
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Paper • 2509.08755 • Published Sep 10, 2025 • 56
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping Paper • 2510.18927 • Published Oct 21, 2025 • 86
Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction Paper • 2512.04987 • Published Dec 4, 2025 • 86
Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction Paper • 2512.04987 • Published Dec 4, 2025 • 86