OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper ⢠2607.23855 ⢠Published 6 days ago ⢠26
FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation Paper ⢠2601.23182 ⢠Published Jan 30 ⢠21
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm Paper ⢠2511.04570 ⢠Published Nov 6, 2025 ⢠242
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper ⢠2607.23855 ⢠Published 6 days ago ⢠26
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper ⢠2607.23855 ⢠Published 6 days ago ⢠26
OpenMOSS-Team/MOSS-Transcribe-Diarize Audio-Text-to-Text ⢠0.9B ⢠Updated about 10 hours ago ⢠205k ⢠349
Running on Zero MCP 1 MOSS-VL-Instruct-0708 š§ 1 Image and video understanding with MOSS-VL multimodal model
Running on Zero Agents 6 MOSS-Music-8B-Instruct šµ 6 Analyze uploaded music and get detailed textual insights
Running on Zero Agents 6 MOSS-Music-8B-Instruct šµ 6 Analyze uploaded music and get detailed textual insights