Instructions to use FaridBenamara/camembert-ner-medieval-2026 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use FaridBenamara/camembert-ner-medieval-2026 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("token-classification", model="FaridBenamara/camembert-ner-medieval-2026")# Load model directly from transformers import AutoTokenizer, AutoModelForTokenClassification tokenizer = AutoTokenizer.from_pretrained("FaridBenamara/camembert-ner-medieval-2026") model = AutoModelForTokenClassification.from_pretrained("FaridBenamara/camembert-ner-medieval-2026", device_map="auto") - Notebooks
- Google Colab
- Kaggle
CamemBERT NER — vieux/moyen français (PER · LOC · TITLE)
Fine-tuning de almanach/camembert-base
en token-classification (schéma BIO : O, B/I-PER, B/I-LOC, B/I-TITLE)
pour la reconnaissance d'entités dans des transcriptions de manuscrits médiévaux français.
Projet MD5 — Master Data/IA, HETIC (Vision par ordinateur & NLP). Compagnon du
modèle HTR FaridBenamara/trocr-catmus-french-2026.
⚠️ Portée (à lire avant usage)
Ce modèle est entraîné sur un petit échantillon annoté manuellement (22 phrases,
~200 tokens) de vieux/moyen français. Il valide le pipeline complet de
fine-tuning (alignement des labels sur les sous-tokens avec -100, évaluation
seqeval) mais n'est pas un modèle de production : pour un usage réel, ré-entraîner
sur un jeu annoté plus large (et idéalement sur des transcriptions OCR bruitées).
Résultats (validation, seqeval)
| Type | F1 |
|---|---|
| micro | 0,741 |
| LOC | 0,857 |
| PER | 0,714 |
| TITLE | 0,667 |
Convergence : loss 1,71 → 0,19 en 20 époques (lr 5e-5, seed 42).
Utilisation
from transformers import pipeline
ner = pipeline("token-classification",
model="FaridBenamara/camembert-ner-medieval-2026",
aggregation_strategy="simple")
print(ner("li rois Artus tint sa cort a Logres"))
# → Artus (PER), rois (TITLE), Logres (LOC)
Schéma d'annotation
TITLE capture les titres de dignité fréquents dans les textes médiévaux
(roi, conte, dux, evesque, dame…), en plus des classiques PER / LOC.
Citation
@misc{camembert_ner_medieval_2026,
title = {CamemBERT NER pour transcriptions de manuscrits médiévaux français},
author = {Benamara, Farid and Megrad, Ouassim and Touat, Abdennour and Sellani, Khaled},
year = {2026},
note = {Master Data/IA, HETIC — Projet MD5},
howpublished = {Hugging Face Hub}
}
- Downloads last month
- 24
Model tree for FaridBenamara/camembert-ner-medieval-2026
Base model
almanach/camembert-baseEvaluation results
- F1 seqeval (validation) on Annotations manuelles vieux/moyen français (~200 tokens)self-reported0.741