Configuration Parsing Warning:In adapter_config.json: "peft.task_type" must be a string

Whisper Small + LoRA — Pulaar

Adaptateur LoRA pour la reconnaissance automatique de la parole en pulaar, langue absente des 112 langues couvertes par Whisper.

Utilisation

from transformers import WhisperProcessor, WhisperForConditionalGeneration
from peft import PeftModel
import librosa

processor = WhisperProcessor.from_pretrained("openai/whisper-small")
base = WhisperForConditionalGeneration.from_pretrained("openai/whisper-small")
model = PeftModel.from_pretrained(base, "REMPLACER_PAR_VOTRE_REPO").eval()

y, _ = librosa.load("audio.wav", sr=16000)
feats = processor(y, sampling_rate=16000, return_tensors="pt").input_features
ids = model.generate(feats, language="ha", task="transcribe", max_new_tokens=128)
print(processor.batch_decode(ids, skip_special_tokens=True)[0])

Le token de langue ha est requis : il a été retenu empiriquement parmi 11 configurations testées, le pulaar n'ayant pas de token dédié.

Données

28,4 h de parole pulaar après nettoyage (3 643 fichiers WAV vides écartés, déduplication entre sous-corpus, splits construits sans fuite de locuteur ni de transcription).

Limites

Environ 10 locuteurs distincts dans le corpus d'entraînement. La généralisation à des voix nouvelles est mesurée séparément.

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for morlayecis0003/whisper-pulaar-lora-v4

Adapter
(1)
this model