🎙 OpenVoice V2 — Voice Cloning & Design
OpenVoice V2 by MyShell — MIT License, free for commercial use.
Features
- 🎤 Voice Clone: Upload reference audio (10s–3min) + text → cloned speech in multiple languages
- 🎨 Voice Design: Choose gender, age, pitch → novel voice without reference audio
- 🌍 Multilingual: EN, ZH, JA, KO, FR, DE, ES, PT, RU, AR, HI, IT, NL, TR, PL, VI
- ⚡ CPU Optimized: Runs on HF Spaces free tier (cpu-basic), no GPU required
How it works
OpenVoice V2 uses a two-stage approach:
- Base TTS (VITS-based) generates speech from text using a base speaker
- Tone Color Converter transfers the timbre from reference audio to the generated speech
Usage
- Select Voice Clone or Voice Design tab
- For Clone: upload reference audio, enter text, choose language/speed
- For Design: enter text, choose characteristics, generate
- Wait for processing (CPU inference takes 30–120s depending on length)
Models
- Base speakers:
checkpoints_v2/base_speakers/{EN,ZH,JP,KR,FR,DE,ES,PT}/ - Converter:
checkpoints_v2/converter/ - Auto-downloaded from
myshell-ai/OpenVoiceV2on first run
License
MIT License — free for commercial and research use. See LICENSE.
Credits
- Zengyi Qin @ MIT
- Wenliang Zhao @ Tsinghua
- Xumin Yu @ Tsinghua
- Ethan Sun @ MyShell
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support