YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

Direct Speech-to-Text Translation Fine-tuning

This repository contains scripts and resources for fine-tuning direct speech-to-text (S2T) translation models for English to Indian languages (Hindi, Gujarati, and Telugu) without intermediate text generation.

πŸ“ Repository Structure

.
β”œβ”€β”€ finetune_scripts/
β”‚   β”œβ”€β”€ data_collect_clean.py      # Data collection and cleaning
β”‚   β”œβ”€β”€ dataset_making.py           # Dataset preparation for fine-tuning
β”‚   β”œβ”€β”€ finetune.py                 # Model fine-tuning script
β”‚   β”œβ”€β”€ mt_eval.py                  # Evaluation and comparison script
β”‚   β”œβ”€β”€ eval_finetuned/             # Evaluation results and predictions
β”‚   β”œβ”€β”€ final-data/                 # Processed datasets (language-wise)
β”œβ”€β”€finetuned_models/           # Fine-tuned model checkpoints (.pt files)

🎯 Translation Tasks

  • Hindi β†’ English (hin-eng)
  • Gujarati β†’ English (guj-eng)
  • Telugu β†’ English (tel-eng)

Note: All translations are performed using direct speech-to-text without intermediate text generation.

πŸš€ Pipeline Overview

1. Data Collection and Cleaning (data_collect_clean.py)

Downloads and cleans audio data from five AI4Bharat datasets:

  • ai4bharat/IndicVoices-ST
  • ai4bharat/NPTEL
  • ai4bharat/WordProject
  • ai4bharat/Spoken-Tutorial
  • ai4bharat/Mann-ki-Baat

Output: Cleaned dataset saved to Kaushalb11/multi-lang-s2t-dataset

2. Dataset Preparation (dataset_making.py)

Processes and structures the cleaned data for fine-tuning purposes.

Output: Language-wise datasets saved in final-data/ directory

3. Model Fine-tuning (finetune.py)

Fine-tunes the speech-to-text translation models for each target language.

Output: Model checkpoints saved as .pt files in finetuned_models/ directory

4. Evaluation (mt_eval.py)

Evaluates model performance by:

  • Generating baseline metrics (BLEU and chrF scores)
  • Loading fine-tuned model weights from .pt files
  • Comparing baseline vs fine-tuned model performance
  • Generating predictions

Output: Evaluation metrics and predictions saved in eval_finetuned/ directory

πŸ“Š Evaluation Metrics

  • BLEU Score: Measures translation quality based on n-gram precision
  • chrF Score: Character-level F-score for translation evaluation

πŸ€— Dataset

The cleaned dataset is available on Hugging Face:
Kaushalb11/multi-lang-s2t-dataset

πŸ“„ Output Files

final-data/

Contains processed datasets organized by target language:

  • Hindi (hin)
  • Gujarati (guj)
  • Telugu (tel)

finetuned_models/

Contains trained model checkpoints in PyTorch format (.pt files)

eval_finetuned/

Contains:

  • Baseline evaluation metrics
  • Fine-tuned model evaluation metrics
  • Comparison results
  • Translation predictions

πŸ”¬ Model Architecture

Direct speech-to-text translation without intermediate text generation, enabling:

  • Faster inference
  • Reduced error propagation
  • End-to-end optimization

πŸ™ Acknowledgments

  • LTRC, IIIT Hyderabad for providing GPU facilities and mentorship
  • AI4Bharat for providing the Indic language datasets
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support