mc-bio-gliner-lymphome-ecrf

Remplit un eCRF de 89 champs depuis un dossier patient longitudinal français (~22 000 caractères, plusieurs comptes-rendus). Un passage, 150 M paramètres.

Il ne surligne pas, il produit la valeur : « patiente » → femme, « le 8 avril 2017 » → 2017-04-15, « phénotype non germinal » → NGC.

Utilisation

pip install gliner2 torch huggingface_hub
from modeling_assign import ECRFExtractor          # fourni dans ce dépôt

m = ECRFExtractor.from_pretrained("rntc/mc-bio-gliner-lymphome-ecrf", device="cuda")
ecrf = m.extract(open("dossier.txt").read())       # {champ: valeur ou None}
python predict.py --demo                           # exemple exécutable

Résultats

macro-F1 par famille au niveau (document, champ), 410 documents de test, égalité de chaîne canonique. Une valeur fausse compte comme faux positif et faux négatif.

système macro CAT DATE NUM ORD
même encodeur, sans les têtes 0.487 0.430 0.307 0.537 0.673
Qwen3.5-9B finetuné sur les mêmes 1 540 documents 0.582 0.488 0.447 0.590 0.791
ce modèle 0.786 0.817 0.684 0.765 0.877

Jeu d'évaluation : rntc/lymphome-synth-v5-eval.

Limites

Gold produit par un annotateur LLM sur des documents synthétiques du même pipeline. 97,4 % des cibles CAT du test sont déjà dans le vocabulaire d'entraînement, donc le test dit peu sur les valeurs nouvelles. Aucune validation hors de ce corpus. Non validé cliniquement, modèle de recherche. MIT.

Downloads last month
30
Safetensors
Model size
0.2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support