Shtorm-PocketTTS-RU v2 «версия 2, 01.10.2026»

Русская модель для pocket-tts (Kyutai), заточенная под чтение книг: ровная книжная подача, живая интонация, клонирование голоса по короткому рефу.

  • архитектура оригинального pocket-tts: 6 слоёв, ~100M параметров — быстро и на CPU;
  • токенизатор SentencePiece на русском корпусе (4000 токенов), общий для обеих моделей.

Две модели: fast и slow

Разница в подаче, а не в качестве:

  • fast (config_fast.yaml, он же config.yaml) — бодрее и живее: шире интонация, медленные голоса не тянут. На быстрых голосах может строчить.
  • slow (config_slow.yaml) — спокойнее: свободнее паузы, ровнее тон. На медленных голосах может тянуть.

На одной и той же главе разница около 7% по времени (11:01 против 11:48). Какая лучше — зависит от голоса и вкуса, попробуйте обе.

Предыдущие версии

v1 (26.09.2026) — первая версия: спокойная, размеренная книжная подача. Подача спокойнее и ровнее, чем у v2, но на медленных голосах и длинных фразах может «тянуть» и затухать к концу куска. Если она вам нравилась больше — она никуда не делась:

  • файлы в папке v1/, запуск через v1/config.yaml;
  • или целиком прежнее состояние репозитория по тегу v1.

Токенизатор у v1 и v2 одинаковый.

Цифры

7 голосов x 5 сидов, книжный абзац / диалог:

CER (разборчивость) UTMOS (качество звука) обрывы
1.6% / 4.0% 3.64 / 3.52 0 из 70

Запуск

from pocket_tts import TTSModel
import scipy.io.wavfile

model = TTSModel.load_model(config="hf://ArtShtorm/Shtorm-PocketTTS-RU/config.yaml")
voice = model.get_state_for_audio_prompt("my_voice.wav")
audio = model.generate_audio(voice, "Се́рое не́бо висе́ло над го́родом.")
scipy.io.wavfile.write("out.wav", model.sample_rate, audio.numpy())

Советы:

  • ударения — знаком акута (U+0301), как в примере: модель училась на размеченном тексте;
  • реф — 5 с чистой речи, законченная фраза: модель копирует из него тембр, темп и полосу;
  • куски до ~120-180 знаков: на длинных громкость к концу проседает.
  • Латиница пока не поддерживается — английские слова и цифры перед синтезом нужно нормализовать (записать по-русски). Поддержка латиницы — в планах.

Ограничения

  • паузы на знаках препинания местами длинноваты;
  • на длинных кусках — затухание громкости (лечится выравниванием громкости на выходе).

Лицензия и использование

CC-BY-4.0. Основа — Kyutai pocket-tts © Kyutai Labs. Клонирование голоса — только с явного согласия его владельца; не использовать для выдачи себя за другого человека, дезинформации и иного вредного или незаконного использования.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ArtShtorm/Shtorm-PocketTTS-RU

Finetuned
(28)
this model

Space using ArtShtorm/Shtorm-PocketTTS-RU 1