legacy-datasets/wikipedia
Updated • 50.5k • 675
Модель mT5-small дообученная на задачу монолингвальной суммаризации казахского текста (kk→kk). Обучена на корпусе из 257 470 казахских статей из трёх источников: Wikipedia, Tengrinews.kz, Turkestan.kz.
| Метрика | Значение |
|---|---|
| ROUGE-1 | 0.778 |
| ROUGE-2 | 0.670 |
| ROUGE-L | 0.778 |
Тест-сет: 2 000 пар · Прирост ROUGE-1 в 58 раз по сравнению с zero-shot (0.013 → 0.778)
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("v-25/mt5-kaz-summarization")
model = AutoModelForSeq2SeqLM.from_pretrained("v-25/mt5-kaz-summarization")
text = "Қазақстанда... (казахская статья)"
inputs = tokenizer(
"summarize: " + text,
return_tensors="pt",
max_length=512,
truncation=True
)
output = model.generate(**inputs, max_new_tokens=84, num_beams=4)
print(tokenizer.decode(output[0], skip_special_tokens=True))
| Источник | Статей |
|---|---|
| Wikipedia (kk) | 164 007 |
| Tengrinews.kz | 50 858 |
| Turkestan.kz | 42 605 |
| Итого | 257 470 |
| Параметр | Значение |
|---|---|
| Базовая модель | google/mt5-small |
| Параметры | 300М |
| Learning rate | 5e-4 |
| Batch size | 8 |
| Epochs | 3 |
| Max input tokens | 512 |
| Max target tokens | 84 |
| GPU | NVIDIA RTX PRO 6000 Blackwell |
huggingface.co/spaces/v-25/kazakh-summarization-demo
@mastersthesis{kazakh-summarization-2026,
title={Исследование задачи суммаризации для казахского языка},
year={2026}
}