-
Token-Efficient Long Video Understanding for Multimodal LLMs
Paper • 2503.04130 • Published • 97 -
Temporal Preference Optimization for Long-Form Video Understanding
Paper • 2501.13919 • Published • 22 -
MM-Eureka: Exploring Visual Aha Moment with Rule-based Large-scale Reinforcement Learning
Paper • 2503.07365 • Published • 61
Zhang Yuanhan
ZhangYuanhan
AI & ML interests
None yet
Organizations
Vision Language General
Vision Language General
-
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
Paper • 2410.10563 • Published • 37 -
Latent Action Pretraining from Videos
Paper • 2410.11758 • Published • 2 -
TVBench: Redesigning Video-Language Evaluation
Paper • 2410.07752 • Published • 5 -
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
Paper • 2501.03225 • Published • 7
LMM RL
-
Token-Efficient Long Video Understanding for Multimodal LLMs
Paper • 2503.04130 • Published • 97 -
Temporal Preference Optimization for Long-Form Video Understanding
Paper • 2501.13919 • Published • 22 -
MM-Eureka: Exploring Visual Aha Moment with Rule-based Large-scale Reinforcement Learning
Paper • 2503.07365 • Published • 61
good papers
Vision Language General
Vision Language General
-
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
Paper • 2410.10563 • Published • 37 -
Latent Action Pretraining from Videos
Paper • 2410.11758 • Published • 2 -
TVBench: Redesigning Video-Language Evaluation
Paper • 2410.07752 • Published • 5 -
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
Paper • 2501.03225 • Published • 7