VoXtream2-RU — потоковый русский TTS с клонированием голоса
Русский файнтюн VoXtream2 (KTH Royal Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi (12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по 3–10 секундам записи.
Демо: самодостаточный код Gradio-демо лежит в этом репозитории в папке
demo/ — запуск локально
описан ниже. Страница модели с примерами синтеза
(разные голоса, look-ahead, темп, типы текста) — HF Space.
Статьи о том, как это делалось (разбор VoXtream, подготовка данных, MFA, ошибки): Habr (RU) · Medium (EN).
Автор: Telegram-канал @decent_researcher — там новости о модели и разборы.
Лицензия и условия использования
Модель публикуется в научных и исследовательских целях под лицензией OpenRAIL-M (Responsible AI License — открытая лицензия с ограничениями использования). Базовая модель herimor/voxtream2 распространяется под MIT; её условия сохраняются.
Запрещено использовать модель и производные от неё:
- для любых противоправных действий, обмана, мошенничества, выдачи себя за другое лицо;
- для создания дипфейков и синтеза голоса реальных людей без их явного согласия;
- для дезинформации, домогательств, дискриминации, вреда людям и группам;
- в системах, принимающих юридически значимые решения о людях без надзора человека.
Клонирование голоса допускается только для собственного голоса или с явного разрешения владельца голоса. Полный текст ограничений — в файле LICENSE.
Атрибуция. Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM)
— Apache-2.0 (см. demo/LICENSE-MIT, demo/LICENSE-APACHE, demo/NOTICE). Веса
базовой модели обучены на Emilia
и HiFiTTS-2 (обе CC BY 4.0) — при
использовании и распространении этих весов и производных от них требуется указывать
авторов датасетов. Русские данные дообучения — открытые наборы русской речи
(~1870 ч после фильтрации).
Метрики (бытовые записи незнакомых дикторов, GigaAM-v3)
| CER | Переключения голоса | Темп (слог/с) | Паузы (медиана) | |
|---|---|---|---|---|
| v10-DPO (эта модель) | ~0.01 | 0–2% | 5.1–5.2 | 0.4–0.5 с |
Использование
Модель требует модифицированный пакет voxtream и русский инференс-стек
(фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр)
— всё это лежит в папке demo/ этого репозитория (самодостаточна, с GitHub ничего
ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11:
git lfs install && git clone https://huggingface.co/simba9/voxtream2-ru
cd voxtream2-ru/demo
sudo apt install espeak-ng # см. packages.txt
pip install -r requirements.txt
python app.py --model-dir .. # Gradio на http://127.0.0.1:7860
# без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py
- Downloads last month
- -
Model tree for simba9/voxtream2-ru
Base model
herimor/voxtream2