MonkeyOCRv2: A Visual-Text Foundation Model for Document AI Paper • 2607.11562 • Published 16 days ago • 76
JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation Paper • 2606.03168 • Published Jun 2 • 47
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation Paper • 2505.20292 • Published May 26, 2025 • 53