WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents Paper • 2609.27490 • Published 1 day ago • 8
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge Paper • 2504.10342 • Published Apr 14, 2025 • 11
Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests Paper • 2601.17617 • Published Jan 24 • 4