view article Article Scaling Real-Time Voice Agents with Cache-Aware Streaming ASR nvidia β’ Jan 5 β’ 92
nvidia/magpie_tts_multilingual_357m Text-to-Speech β’ 0.3B β’ Updated 25 days ago β’ 7.94k β’ 225
nvidia/nemotron-speech-streaming-en-0.6b Automatic Speech Recognition β’ 0.6B β’ Updated Aug 5 β’ 319k β’ 633
nvidia/Frame_VAD_Multilingual_MarbleNet_v2.0 Voice Activity Detection β’ Updated May 14, 2025 β’ 2.99k β’ 47
Running on Zero Agents Featured 482 Parakeet-TDT-0.6b-V2 Β 482 Transcribe audio files with timestamps and downloadable subtitles
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment Paper β’ 2405.01481 β’ Published May 2, 2024 β’ 30
RULER: What's the Real Context Size of Your Long-Context Language Models? Paper β’ 2404.06654 β’ Published Apr 9, 2024 β’ 42