DataPrep-Bench: Benchmarking LLMs as Training Data Preparators Paper • 2607.20465 • Published May 19 • 53
K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs Paper • 2605.09635 • Published 9 days ago • 63
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines Paper • 2607.16617 • Published 14 days ago • 137
OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios Paper • 2607.14989 • Published 16 days ago
DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models Paper • 2603.26164 • Published Mar 27 • 365
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation Paper • 2603.09821 • Published Mar 10 • 11
DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI Paper • 2512.16676 • Published Dec 18, 2025 • 226
FlipVQA-Miner: Cross-Page Visual Question-Answer Mining from Textbooks Paper • 2511.16216 • Published Nov 20, 2025 • 2
Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions Paper • 2506.07527 • Published Jun 9, 2025 • 3
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines Paper • 2607.16617 • Published 14 days ago • 137
DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models Paper • 2603.26164 • Published Mar 27 • 365