CamemBERT NER — vieux/moyen français (PER · LOC · TITLE)

Fine-tuning de almanach/camembert-base en token-classification (schéma BIO : O, B/I-PER, B/I-LOC, B/I-TITLE) pour la reconnaissance d'entités dans des transcriptions de manuscrits médiévaux français.

Projet MD5 — Master Data/IA, HETIC (Vision par ordinateur & NLP). Compagnon du modèle HTR FaridBenamara/trocr-catmus-french-2026.

⚠️ Portée (à lire avant usage)

Ce modèle est entraîné sur un petit échantillon annoté manuellement (22 phrases, ~200 tokens) de vieux/moyen français. Il valide le pipeline complet de fine-tuning (alignement des labels sur les sous-tokens avec -100, évaluation seqeval) mais n'est pas un modèle de production : pour un usage réel, ré-entraîner sur un jeu annoté plus large (et idéalement sur des transcriptions OCR bruitées).

Résultats (validation, seqeval)

Type F1
micro 0,741
LOC 0,857
PER 0,714
TITLE 0,667

Convergence : loss 1,71 → 0,19 en 20 époques (lr 5e-5, seed 42).

Utilisation

from transformers import pipeline

ner = pipeline("token-classification",
               model="FaridBenamara/camembert-ner-medieval-2026",
               aggregation_strategy="simple")
print(ner("li rois Artus tint sa cort a Logres"))
# → Artus (PER), rois (TITLE), Logres (LOC)

Schéma d'annotation

TITLE capture les titres de dignité fréquents dans les textes médiévaux (roi, conte, dux, evesque, dame…), en plus des classiques PER / LOC.

Citation

@misc{camembert_ner_medieval_2026,
  title  = {CamemBERT NER pour transcriptions de manuscrits médiévaux français},
  author = {Benamara, Farid and Megrad, Ouassim and Touat, Abdennour and Sellani, Khaled},
  year   = {2026},
  note   = {Master Data/IA, HETIC — Projet MD5},
  howpublished = {Hugging Face Hub}
}
Downloads last month
24
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for FaridBenamara/camembert-ner-medieval-2026

Finetuned
(170)
this model

Evaluation results

  • F1 seqeval (validation) on Annotations manuelles vieux/moyen français (~200 tokens)
    self-reported
    0.741