Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens Paper β’ 2503.01710 β’ Published Mar 3, 2025 β’ 6
DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis Paper β’ 2507.14988 β’ Published Jul 20, 2025 β’ 8