Probing Perceptual Constancy in Large Vision Language Models Paper • 2502.10273 • Published Feb 14, 2025
Core Knowledge Deficits in Multi-Modal Language Models Paper • 2410.10855 • Published Oct 6, 2024 • 4
Vision Language Models See What You Want but not What You See Paper • 2410.00324 • Published Oct 1, 2024
Probing Mechanical Reasoning in Large Vision Language Models Paper • 2410.00318 • Published Oct 1, 2024
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning Paper • 2608.26105 • Published Aug 26 • 191
PhyGround: Benchmarking Physical Reasoning in Generative World Models Paper • 2605.10806 • Published May 11 • 3
Vision Language Models Cannot Reason About Physical Transformation Paper • 2603.07109 • Published Mar 7 • 2
Can Vision Language Models Infer Human Gaze Direction? A Controlled Study Paper • 2506.05412 • Published Jun 4, 2025 • 5
The Mechanistic Emergence of Symbol Grounding in Language Models Paper • 2510.13796 • Published Jun 3
PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation Paper • 2605.14269 • Published May 14 • 7
Planning with Sketch-Guided Verification for Physics-Aware Video Generation Paper • 2511.17450 • Published Nov 21, 2025 • 4
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences Paper • 2406.03008 • Published Jun 5, 2024
CycleNet: Rethinking Cycle Consistency in Text-Guided Diffusion for Image Manipulation Paper • 2310.13165 • Published Oct 19, 2023