OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction Paper • 2610.01762 • Published 1 day ago • 129
A New Role for Relevance: Guiding Corpus Interaction in Agentic Search Paper • 2607.24223 • Published Jul 27 • 97
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs Paper • 2607.17423 • Published Jul 19 • 101
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding Paper • 2607.14935 • Published Jul 16 • 122
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration Paper • 2607.15257 • Published Jul 16 • 71
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence Paper • 2606.14777 • Published Jun 10 • 218
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence Paper • 2606.14777 • Published Jun 10 • 218
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence Paper • 2606.14777 • Published Jun 10 • 218
Online Self-Calibration Against Hallucination in Vision-Language Models Paper • 2605.00323 • Published May 1 • 3
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding Paper • 2605.00642 • Published May 5 • 5