VoXtream2-RU — потоковый русский TTS с клонированием голоса

Русский файнтюн VoXtream2 (KTH Royal Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi (12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по 3–10 секундам записи.

Демо: самодостаточный код Gradio-демо лежит в этом репозитории в папке demo/ — запуск локально описан ниже. Страница модели с примерами синтеза (разные голоса, look-ahead, темп, типы текста) — HF Space.

Статьи о том, как это делалось (разбор VoXtream, подготовка данных, MFA, ошибки): Habr (RU) · Medium (EN).

Автор: Telegram-канал @decent_researcher — там новости о модели и разборы.

Лицензия и условия использования

Модель публикуется в научных и исследовательских целях под лицензией OpenRAIL-M (Responsible AI License — открытая лицензия с ограничениями использования). Базовая модель herimor/voxtream2 распространяется под MIT; её условия сохраняются.

Запрещено использовать модель и производные от неё:

  • для любых противоправных действий, обмана, мошенничества, выдачи себя за другое лицо;
  • для создания дипфейков и синтеза голоса реальных людей без их явного согласия;
  • для дезинформации, домогательств, дискриминации, вреда людям и группам;
  • в системах, принимающих юридически значимые решения о людях без надзора человека.

Клонирование голоса допускается только для собственного голоса или с явного разрешения владельца голоса. Полный текст ограничений — в файле LICENSE.

Атрибуция. Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM) — Apache-2.0 (см. demo/LICENSE-MIT, demo/LICENSE-APACHE, demo/NOTICE). Веса базовой модели обучены на Emilia и HiFiTTS-2 (обе CC BY 4.0) — при использовании и распространении этих весов и производных от них требуется указывать авторов датасетов. Русские данные дообучения — открытые наборы русской речи (~1870 ч после фильтрации).

Метрики (бытовые записи незнакомых дикторов, GigaAM-v3)

CER Переключения голоса Темп (слог/с) Паузы (медиана)
v10-DPO (эта модель) ~0.01 0–2% 5.1–5.2 0.4–0.5 с

Использование

Модель требует модифицированный пакет voxtream и русский инференс-стек (фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр) — всё это лежит в папке demo/ этого репозитория (самодостаточна, с GitHub ничего ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11:

git lfs install && git clone https://huggingface.co/simba9/voxtream2-ru
cd voxtream2-ru/demo
sudo apt install espeak-ng            # см. packages.txt
pip install -r requirements.txt
python app.py --model-dir ..          # Gradio на http://127.0.0.1:7860
# без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py
Downloads last month
-
Safetensors
Model size
0.5B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for simba9/voxtream2-ru

Finetuned
(2)
this model

Space using simba9/voxtream2-ru 1

Paper for simba9/voxtream2-ru