Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos Paper • 2607.16107 • Published 16 days ago • 11
nvidia/nemotron-labs-audio-visual-flamingo-hf Video-Text-to-Text • 9B • Updated 12 days ago • 1.36k • 10
Running on A100 Agents 8 Nemotron-Labs-Audio-Visual Flamingo 🎬 8 Analyze videos and answer questions about their content
Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos Paper • 2607.16107 • Published 16 days ago • 11
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning Paper • 2510.12000 • Published Oct 13, 2025 • 1
Do Audio-Visual Large Language Models Really See and Hear? Paper • 2604.02605 • Published Apr 3 • 7
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music Paper • 2604.10905 • Published Apr 13 • 29
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music Paper • 2604.10905 • Published Apr 13 • 29
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music Paper • 2604.10905 • Published Apr 13 • 29
MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos Paper • 2603.14145 • Published Mar 14 • 15
MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos Paper • 2603.14145 • Published Mar 14 • 15
Running on Zero Agents 200 Music Flamingo 🎵 200 Answer questions about any song from audio or YouTube
Music Flamingo: Scaling Music Understanding in Audio Language Models Paper • 2511.10289 • Published Nov 13, 2025 • 20
Music Flamingo: Scaling Music Understanding in Audio Language Models Paper • 2511.10289 • Published Nov 13, 2025 • 20 • 2
Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding Paper • 2508.11818 • Published Aug 15, 2025
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM Paper • 2510.15870 • Published Oct 17, 2025 • 93