Shtorm_PocketTTS_RU v1 «версия 1, 26.09.2026»

Русская модель для pocket-tts (Kyutai), заточенная под чтение книг: ровная книжная подача, живая интонация, клонирование голоса по короткому рефу.

  • архитектура оригинального pocket-tts: 6 слоёв, ~100M параметров — быстро и на CPU;
  • своя цепочка: учитель 24 слоя (от английской 24L Kyutai) -> дистилляция в 6 слоёв с запечённым guidance — без двойного прохода при генерации;
  • токенизатор SentencePiece на русском корпусе (4000 токенов).

Цифры

7 голосов x 5 сидов, книжный абзац / диалог:

CER (разборчивость) UTMOS (качество звука) обрывы
1.6% / 4.0% 3.64 / 3.52 0 из 70

Запуск

from pocket_tts import TTSModel
import scipy.io.wavfile

model = TTSModel.load_model(config="hf://ArtShtorm/Shtorm_PocketTTS_RU/config.yaml")
voice = model.get_state_for_audio_prompt("my_voice.wav")
audio = model.generate_audio(voice, "Се́рое не́бо висе́ло над го́родом.")
scipy.io.wavfile.write("out.wav", model.sample_rate, audio.numpy())

Советы:

  • ударения — знаком акута (U+0301), как в примере: модель училась на размеченном тексте;
  • реф — 5 с чистой речи, законченная фраза: модель копирует из него тембр, темп и полосу;
  • куски до ~180 знаков: на длинных громкость к концу проседает.

Ограничения

  • паузы на знаках препинания местами длинноваты;
  • на длинных кусках — затухание громкости (лечится выравниванием громкости на выходе).

Лицензия и использование

CC-BY-4.0. Основа — Kyutai pocket-tts © Kyutai Labs. Клонирование голоса — только с явного согласия его владельца; не использовать для выдачи себя за другого человека, дезинформации и иного вредного или незаконного использования.

Downloads last month
-
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ArtShtorm/Shtorm_PocketTTS_RU

Finetuned
(22)
this model