TAP4LLM: Table Provider on Sampling, Augmenting, and Packing Semi-structured Data for Large Language Model Reasoning Paper • 2312.09039 • Published Dec 14, 2023
MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark Paper • 2506.05587 • Published Jun 5, 2025
Bingo: Boosting Efficient Reasoning of LLMs via Dynamic and Significance-based Reinforcement Learning Paper • 2506.08125 • Published Jun 9, 2025
GUI-360: A Comprehensive Dataset and Benchmark for Computer-Using Agents Paper • 2511.04307 • Published Nov 6, 2025 • 17
Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search Paper • 2509.09245 • Published Sep 11, 2025
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models Paper • 2605.12374 • Published May 25
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models Paper • 2603.16253 • Published Mar 17
Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models Paper • 2603.16600 • Published Mar 18
MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination Paper • 2603.24579 • Published Mar 25 • 1
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills Paper • 2603.25158 • Published Mar 26 • 53
SheetBrain: A Neuro-Symbolic Agent for Accurate Reasoning over Complex and Large Spreadsheets Paper • 2510.19247 • Published Oct 22, 2025
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation Paper • 2603.29902 • Published Mar 31
Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill Paper • 2606.03980 • Published Jun 2 • 13
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric Paper • 2602.14069 • Published Feb 15 • 1
GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization Paper • 2606.16771 • Published Jun 15 • 13
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills Paper • 2607.22529 • Published Jul 24 • 48
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published Aug 4 • 9
SpreadsheetLLM: Encoding Spreadsheets for Large Language Models Paper • 2407.09025 • Published Jul 12, 2024 • 139
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills Paper • 2603.25158 • Published Mar 26 • 53