Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization Paper • 2608.23311 • Published Aug 24 • 17
A^3-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation Paper • 2601.09274 • Published Jan 14 • 83