Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models Paper • 2511.17487 • Published Nov 21, 2025 • 12
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration Paper • 2412.13180 • Published Dec 17, 2024 • 13
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation Paper • 2501.03225 • Published Jan 6, 2025 • 7
Open World Object Detection in the Era of Foundation Models Paper • 2312.05745 • Published Dec 10, 2023 • 1
μ-Bench: A Vision-Language Benchmark for Microscopy Understanding Paper • 2407.01791 • Published Jul 1, 2024 • 6
Motion Question Answering via Modular Motion Programs Paper • 2305.08953 • Published May 15, 2023