-
PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems
Paper • 2606.22388 • Published • 96 -
DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks
Paper • 2606.12871 • Published • 16 -
Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark
Paper • 2606.18648 • Published • 16
🔄 In a Training Loop
Octavi Grau
octavigrau
AI & ML interests
AI & ML
Recent Activity
liked a dataset 10 days ago
Spatial1ntelligence/synthetic-bedroom-layouts updated a model 29 days ago
octavigrau/museumscat-trocr-glyph-scorer published a model 29 days ago
octavigrau/museumscat-trocr-glyph-scorer