Instructions to use ArtShtorm/Shtorm_PocketTTS_RU with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Pocket-TTS
How to use ArtShtorm/Shtorm_PocketTTS_RU with Pocket-TTS:
from pocket_tts import TTSModel import scipy.io.wavfile tts_model = TTSModel.load_model("ArtShtorm/Shtorm_PocketTTS_RU") voice_state = tts_model.get_state_for_audio_prompt( "hf://kyutai/tts-voices/alba-mackenna/casual.wav" ) audio = tts_model.generate_audio(voice_state, "Hello world, this is a test.") # Audio is a 1D torch tensor containing PCM data. scipy.io.wavfile.write("output.wav", tts_model.sample_rate, audio.numpy()) - Notebooks
- Google Colab
- Kaggle
Shtorm_PocketTTS_RU v1 «версия 1, 26.09.2026»
Русская модель для pocket-tts (Kyutai), заточенная под чтение книг: ровная книжная подача, живая интонация, клонирование голоса по короткому рефу.
- архитектура оригинального pocket-tts: 6 слоёв, ~100M параметров — быстро и на CPU;
- своя цепочка: учитель 24 слоя (от английской 24L Kyutai) -> дистилляция в 6 слоёв с запечённым guidance — без двойного прохода при генерации;
- токенизатор SentencePiece на русском корпусе (4000 токенов).
Цифры
7 голосов x 5 сидов, книжный абзац / диалог:
| CER (разборчивость) | UTMOS (качество звука) | обрывы |
|---|---|---|
| 1.6% / 4.0% | 3.64 / 3.52 | 0 из 70 |
Запуск
from pocket_tts import TTSModel
import scipy.io.wavfile
model = TTSModel.load_model(config="hf://ArtShtorm/Shtorm_PocketTTS_RU/config.yaml")
voice = model.get_state_for_audio_prompt("my_voice.wav")
audio = model.generate_audio(voice, "Се́рое не́бо висе́ло над го́родом.")
scipy.io.wavfile.write("out.wav", model.sample_rate, audio.numpy())
Советы:
- ударения — знаком акута (U+0301), как в примере: модель училась на размеченном тексте;
- реф — 5 с чистой речи, законченная фраза: модель копирует из него тембр, темп и полосу;
- куски до ~180 знаков: на длинных громкость к концу проседает.
Ограничения
- паузы на знаках препинания местами длинноваты;
- на длинных кусках — затухание громкости (лечится выравниванием громкости на выходе).
Лицензия и использование
CC-BY-4.0. Основа — Kyutai pocket-tts © Kyutai Labs. Клонирование голоса — только с явного согласия его владельца; не использовать для выдачи себя за другого человека, дезинформации и иного вредного или незаконного использования.
- Downloads last month
- -
Model tree for ArtShtorm/Shtorm_PocketTTS_RU
Base model
kyutai/pocket-tts