AViLA: Asynchronous Vision-Language Agent for Streaming Multimodal Data Interaction Paper • 2506.18472 • Published Jun 23, 2025
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding Paper • 2511.11313 • Published Nov 14, 2025
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos Paper • 2411.14901 • Published Nov 22, 2024