How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining Paper โข 2609.35457 โข Published 8 days ago โข 66
Revisiting Multimodal Positional Encoding in Vision-Language Models Paper โข 2510.23095 โข Published Oct 27, 2025 โข 23