Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models Paper • 2606.05531 • Published Jun 4 • 8
ADAM: A Diverse Archive of Mankind for Evaluating and Enhancing LLMs in Biographical Reasoning Paper • 2509.22991 • Published Sep 26, 2025 • 2
The Touché23-ValueEval Dataset for Identifying Human Values behind Arguments Paper • 2301.13771 • Published Jan 31, 2023
MEENA (PersianMMMU): Multimodal-Multilingual Educational Exams for N-level Assessment Paper • 2508.17290 • Published Aug 24, 2025 • 8