YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
Direct Speech-to-Text Translation Fine-tuning
This repository contains scripts and resources for fine-tuning direct speech-to-text (S2T) translation models for English to Indian languages (Hindi, Gujarati, and Telugu) without intermediate text generation.
π Repository Structure
.
βββ finetune_scripts/
β βββ data_collect_clean.py # Data collection and cleaning
β βββ dataset_making.py # Dataset preparation for fine-tuning
β βββ finetune.py # Model fine-tuning script
β βββ mt_eval.py # Evaluation and comparison script
β βββ eval_finetuned/ # Evaluation results and predictions
β βββ final-data/ # Processed datasets (language-wise)
βββfinetuned_models/ # Fine-tuned model checkpoints (.pt files)
π― Translation Tasks
- Hindi β English (hin-eng)
- Gujarati β English (guj-eng)
- Telugu β English (tel-eng)
Note: All translations are performed using direct speech-to-text without intermediate text generation.
π Pipeline Overview
1. Data Collection and Cleaning (data_collect_clean.py)
Downloads and cleans audio data from five AI4Bharat datasets:
ai4bharat/IndicVoices-STai4bharat/NPTELai4bharat/WordProjectai4bharat/Spoken-Tutorialai4bharat/Mann-ki-Baat
Output: Cleaned dataset saved to Kaushalb11/multi-lang-s2t-dataset
2. Dataset Preparation (dataset_making.py)
Processes and structures the cleaned data for fine-tuning purposes.
Output: Language-wise datasets saved in final-data/ directory
3. Model Fine-tuning (finetune.py)
Fine-tunes the speech-to-text translation models for each target language.
Output: Model checkpoints saved as .pt files in finetuned_models/ directory
4. Evaluation (mt_eval.py)
Evaluates model performance by:
- Generating baseline metrics (BLEU and chrF scores)
- Loading fine-tuned model weights from
.ptfiles - Comparing baseline vs fine-tuned model performance
- Generating predictions
Output: Evaluation metrics and predictions saved in eval_finetuned/ directory
π Evaluation Metrics
- BLEU Score: Measures translation quality based on n-gram precision
- chrF Score: Character-level F-score for translation evaluation
π€ Dataset
The cleaned dataset is available on Hugging Face:
Kaushalb11/multi-lang-s2t-dataset
π Output Files
final-data/
Contains processed datasets organized by target language:
- Hindi (hin)
- Gujarati (guj)
- Telugu (tel)
finetuned_models/
Contains trained model checkpoints in PyTorch format (.pt files)
eval_finetuned/
Contains:
- Baseline evaluation metrics
- Fine-tuned model evaluation metrics
- Comparison results
- Translation predictions
π¬ Model Architecture
Direct speech-to-text translation without intermediate text generation, enabling:
- Faster inference
- Reduced error propagation
- End-to-end optimization
π Acknowledgments
- LTRC, IIIT Hyderabad for providing GPU facilities and mentorship
- AI4Bharat for providing the Indic language datasets