Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models Paper • 2509.26165 • Published Sep 30, 2025
aiXiv: A Next-Generation Open Access Ecosystem for Scientific Discovery Generated by AI Scientists Paper • 2508.15126 • Published Aug 20, 2025 • 20
EyeVQA: Benchmarking Ophthalmic Vision-Language Models from Recognition to Spatial Grounding Paper • 2609.32352 • Published 4 days ago
RelBench v2: A Large-Scale Benchmark and Repository for Relational Data Paper • 2602.12606 • Published May 9
MemTransfer: Benchmarking Memory Beyond Matched Experience in Embodied Decision-Making Paper • 2609.32313 • Published 4 days ago