mT5-small fine-tuned для суммаризации казахского текста

Описание

Модель mT5-small дообученная на задачу монолингвальной суммаризации казахского текста (kk→kk). Обучена на корпусе из 257 470 казахских статей из трёх источников: Wikipedia, Tengrinews.kz, Turkestan.kz.

Результаты

Метрика Значение
ROUGE-1 0.778
ROUGE-2 0.670
ROUGE-L 0.778

Тест-сет: 2 000 пар · Прирост ROUGE-1 в 58 раз по сравнению с zero-shot (0.013 → 0.778)

Использование

from transformers import AutoTokenizer, AutoModelForSeq2SeqLM

tokenizer = AutoTokenizer.from_pretrained("v-25/mt5-kaz-summarization")
model = AutoModelForSeq2SeqLM.from_pretrained("v-25/mt5-kaz-summarization")

text = "Қазақстанда... (казахская статья)"
inputs = tokenizer(
    "summarize: " + text,
    return_tensors="pt",
    max_length=512,
    truncation=True
)
output = model.generate(**inputs, max_new_tokens=84, num_beams=4)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Корпус

Источник Статей
Wikipedia (kk) 164 007
Tengrinews.kz 50 858
Turkestan.kz 42 605
Итого 257 470

Параметры обучения

Параметр Значение
Базовая модель google/mt5-small
Параметры 300М
Learning rate 5e-4
Batch size 8
Epochs 3
Max input tokens 512
Max target tokens 84
GPU NVIDIA RTX PRO 6000 Blackwell

Live Demo

huggingface.co/spaces/v-25/kazakh-summarization-demo

Ссылки

Цитирование

@mastersthesis{kazakh-summarization-2026,
  title={Исследование задачи суммаризации для казахского языка},
  year={2026}
}
Downloads last month
46
Safetensors
Model size
0.6B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train v-25/mt5-kaz-summarization

Space using v-25/mt5-kaz-summarization 1