facebook/voxpopuli
Viewer • Updated • 1.26M • 84k • 162
How to use AKIlukas/speecht5-german-lora with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("text-to-speech", model="AKIlukas/speecht5-german-lora") # Load model directly
from transformers import AutoProcessor, AutoModelForTextToSpectrogram
processor = AutoProcessor.from_pretrained("AKIlukas/speecht5-german-lora")
model = AutoModelForTextToSpectrogram.from_pretrained("AKIlukas/speecht5-german-lora", device_map="auto")How to use AKIlukas/speecht5-german-lora with PEFT:
Task type is invalid.
German text-to-speech model: microsoft/speecht5_tts fine-tuned with LoRA (PEFT) on German data from facebook/voxpopuli (config de, CC-0 license).
Demo: demo_german.wav — "Hallo! Ich bin ein deutschsprachiges Sprachmodell. Danke, dass Sie zuhoeren."
de train (~20k raw utterances), CC-0 licenseq_proj/k_proj/v_proj/out_proj/fc1/fc2 → 2.36M trainable params (1.6% of 146.8M)SpeechT5ForTextToSpeech checkpoint, no adapter neededModel MIT · Dataset CC-0-1.0 · Speaker model Apache-2.0 · Vocoder microsoft/speecht5_hifigan MIT
import io, torch, soundfile as sf
from transformers import SpeechT5Processor, SpeechT5ForTextToSpeech, SpeechT5HifiGan
device = "cuda" if torch.cuda.is_available() else "cpu"
processor = SpeechT5Processor.from_pretrained("AKIlukas/speecht5-german-lora")
model = SpeechT5ForTextToSpeech.from_pretrained("AKIlukas/speecht5-german-lora").to(device)
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan").to(device)
# 512-d x-vector speaker embedding from any German speaker clip:
# EncoderClassifier.from_hparams("speechbrain/spkrec-xvect-voxceleb")
# emb = normalize(model.encode_batch(waveform), dim=2).reshape(1, 512).to(device)
speaker_embedding = torch.load("speaker_embedding.pt", map_location=device) # [1, 512]
text = "Hallo! Ich bin ein deutschsprachiges Sprachmodell."
inputs = processor(text=text, return_tensors="pt").to(device)
with torch.no_grad():
speech = model.generate_speech(inputs["input_ids"], speaker_embedding, vocoder=vocoder)
sf.write("out.wav", speech.cpu().numpy(), samplerate=16000)
Notes:
Base model
microsoft/speecht5_tts