RRSI: Regularized Recursive Self-Improvement of Agent Harnesses Paper • 2609.24972 • Published 10 days ago • 219
Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation Paper • 2609.20758 • Published 14 days ago • 4