A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning Paper • 2510.01132 • Published Oct 1, 2025 • 6
Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges Paper • 2604.13602 • Published Apr 15 • 31
GLEE: A Unified Framework and Benchmark for Language-based Economic Environments Paper • 2410.05254 • Published Oct 7, 2024 • 85