Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model Paper • 2512.06999 • Published Dec 7, 2025
WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation Paper • 2509.03959 • Published Sep 4, 2025
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing Paper • 2601.09385 • Published Jan 14
AutoMV: An Automatic Multi-Agent System for Music Video Generation Paper • 2512.12196 • Published Dec 13, 2025 • 7
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice Paper • 2509.21144 • Published Sep 25, 2025 • 1
KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation Paper • 2505.14552 • Published May 20, 2025
SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision Paper • 2510.02797 • Published Oct 3, 2025 • 1
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix Paper • 2505.13032 • Published May 19, 2025 • 4
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing Paper • 2604.10708 • Published Apr 12 • 33
AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation Paper • 2606.12555 • Published Jun 10 • 2
A Self-Evolving Framework for Efficient Terminal Agents via Observational Context Compression Paper • 2604.19572 • Published Apr 21 • 25
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction Paper • 2603.00610 • Published Feb 28 • 36
ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships Paper • 2607.14681 • Published Jul 16
Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence Paper • 2608.31075 • Published Aug 31 • 30
SongEval: A Benchmark Dataset for Song Aesthetics Evaluation Paper • 2505.10793 • Published May 16, 2025
MARBLE: Music Audio Representation Benchmark for Universal Evaluation Paper • 2306.10548 • Published Jun 18, 2023
AudioX: Diffusion Transformer for Anything-to-Audio Generation Paper • 2503.10522 • Published Mar 13, 2025 • 29