kk-bert-small-morph-bpe-kaznerd
BERT-Small finetuned on KazNERD (Kazakh Named Entity Recognition) starting from
Abzalbek89/kk-bert-small-morph-bpe — pretrained with the morphbpe tokenizer.
Part of a comparative study of subword tokenizers for Kazakh small language models.
Test set results
| metric | value |
|---|---|
| F1 (span-level, seqeval) | 87.37 |
| Precision | 85.68 |
| Recall | 89.13 |
| Token accuracy | 97.59 |
Training
| Base model | Abzalbek89/kk-bert-small-morph-bpe |
| Dataset | IS2AI/KazNERD (IOB2, 25 entity types) |
| Epochs | 5 |
| Batch size | 16 |
| Learning rate | 5e-5 (warmup 10%, weight decay 0.01) |
| Precision | fp16 |
| Hardware | RTX A4000 |
| Time | 8.2 min |
| Seed | 42 |
Usage
from transformers import AutoTokenizer, AutoModelForTokenClassification, pipeline
tok = AutoTokenizer.from_pretrained("Abzalbek89/kk-bert-small-morph-bpe-kaznerd")
model = AutoModelForTokenClassification.from_pretrained("Abzalbek89/kk-bert-small-morph-bpe-kaznerd")
ner = pipeline("ner", model=model, tokenizer=tok, aggregation_strategy="simple")
ner("Қазақстан Республикасының Президенті Қасым-Жомарт Тоқаев Алматыға барды.")
Companion artifacts
- Pretrained base:
Abzalbek89/kk-bert-small-morph-bpe - Aggregate metrics:
Abzalbek89/kk-tokenizer-fertility-baseline
- Downloads last month
- 9
Model tree for Abzalbek89/kk-bert-small-morph-bpe-kaznerd
Base model
Abzalbek89/kk-bert-small-morph-bpe