Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation Paper • 2610.01092 • Published 5 days ago • 27
Anthropogenic Regional Adaptation in Multimodal Vision-Language Model Paper • 2604.11490 • Published Apr 13 • 16
Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation Paper • 2610.01092 • Published 5 days ago • 27
Seeing Culture: A Benchmark for Visual Reasoning and Grounding Paper • 2509.16517 • Published Sep 20, 2025 • 3
Can Large Language Models Understand, Reason About, and Generate Code-Switched Text? Paper • 2601.07153 • Published Jan 12
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG Paper • 2512.05959 • Published Dec 5, 2025
LinguDistill: Recovering Linguistic Ability in Vision- Language Models via Selective Cross-Modal Distillation Paper • 2604.00829 • Published Apr 1 • 5
LinguDistill: Recovering Linguistic Ability in Vision- Language Models via Selective Cross-Modal Distillation Paper • 2604.00829 • Published Apr 1 • 5
Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability Paper • 2506.01789 • Published Jun 2, 2025 • 15