YAML Metadata Warning:The pipeline tag "text2text-generation" is not in the official list: text-classification, token-classification, table-question-answering, question-answering, zero-shot-classification, translation, summarization, feature-extraction, text-generation, fill-mask, sentence-similarity, text-to-speech, text-to-audio, automatic-speech-recognition, audio-to-audio, audio-classification, audio-text-to-text, voice-activity-detection, depth-estimation, image-classification, object-detection, image-segmentation, text-to-image, image-to-text, image-to-image, image-to-video, unconditional-image-generation, video-classification, reinforcement-learning, robotics, tabular-classification, tabular-regression, tabular-to-text, table-to-text, multiple-choice, text-ranking, text-retrieval, time-series-forecasting, text-to-video, image-text-to-text, image-text-to-image, image-text-to-video, visual-question-answering, document-question-answering, zero-shot-image-classification, graph-ml, mask-generation, zero-shot-object-detection, text-to-3d, image-to-3d, image-feature-extraction, video-text-to-text, keypoint-detection, visual-document-retrieval, any-to-any, video-to-video, other
Sōtēr Megas (ΣΩΤΗΡ ΜΕΓΑΣ) — lemmatiseur de grec ancien
Sōtēr Megas est un lemmatiseur contextuel du grec ancien (ByT5-base, 581M paramètres), entraîné par distillation d'un LLM généraliste (DeepSeek V4-Flash) sur 2,26M de tokens d'annotations propres couvrant tout le spectre du grec (épopée, tragédie, prose classique, Koinè, Septante, patristique). Le nom reprend la légende ΣΩΤΗΡ ΜΕΓΑΣ des monnaies kouchanes — c'est le « grand frère » de Sôtêr, notre modèle de 9,5M qui tourne dans le navigateur.
Usage
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tok = AutoTokenizer.from_pretrained("Zual/soter-megas")
model = AutoModelForSeq2SeqLM.from_pretrained("Zual/soter-megas")
# Entrée : <tb_X> forme-épelée <sep> contexte-gauche <tgt> forme </tgt> contexte-droit
# Conventions : <tb_perseus> (AGDT), <tb_proiel>, <tb_ptnk> (Septante)
phrase = "Ἀλέξανδρος ἐγένετο βασιλεύς".split()
i = 1 # lemmatiser ἐγένετο
inp = f"<tb_perseus> {' '.join(phrase[i])} <sep> {' '.join(phrase[:i])} <tgt> {phrase[i]} </tgt> {' '.join(phrase[i+1:])}"
out = model.generate(**tok(inp, return_tensors="pt"), max_length=48)
print(tok.decode(out[0], skip_special_tokens=True)) # γίγνομαι
Résultats (dev UD, 100 premières phrases ; « corrigé » = gold dont les erreurs
d'annotation adjugées philologiquement sont corrigées)
| Système | PROIEL | Perseus | PTNK |
|---|---|---|---|
| Eulexis (dictionnaire) | 87,3 / 88,2 | 89,1 / 90,4 | 86,4 / 86,7 |
| Stanza | 95,5 / 96,0 | 92,0 / 92,8 | 82,8 / 83,5 |
| GreTa+dict (223M) | 97,0 / 97,5 | 94,4 / 94,9 | 97,4 / 97,4 |
| Sōtēr Megas (581M) | 95,6 / 97,1 | 95,3 / 98,4 | 98,4 / 98,9 |
Hors domaine (grec byzantin non édité, gold DBBE de Swaelens et al., zéro-shot) : 77,6 exact (79,7 avec règle ponctuation) — vs 79,3 pour le SOTA supervisé entraîné sur ce domaine, 71,7 pour la meilleure baseline, et 74,2 pour le teacher LLM lui-même : l'élève distillé généralise au-delà de son maître.
Détails
- Checkpoint sélectionné par robustesse hors domaine (meilleur score DBBE), entraînement ~5 epochs, batch effectif 64, Adafactor, contexte ±8 mots, entrées ≤384 octets.
- Données d'entraînement : annotations DeepSeek V4-Flash (few-shot 128-512 exemples, TSV contraint, T=0) sur les trains UD grc et un échantillon stratifié de GLAUx/Diorisis (corpus sources CC BY-SA/CC BY ; treebanks UD CC BY-NC-SA utilisés pour l'évaluation).
- Version en cours d'entraînement sur 49M de tokens — mise à jour à venir.
- Auteur : Luc Pommeret (LISN/CNRS). Article en préparation.
- Downloads last month
- -