mmbert-small-aliasit-32k

jhu-clsp/mmBERT-small con vocabolario ridotto a 32.768 token sui dati di training di aliasit-pii-dataset-v2. NON e' fine-tuned: e' il punto di partenza di aliasit-pii-edge.

Questo modello non e' addestrato al riconoscimento di PII. E' il backbone da cui si parte: jhu-clsp/mmBERT-small con l'embedding ristretto al vocabolario che serve. Serve come base_model di un fine-tuning, non come modello finito.

prima dopo
vocabolario 256.000 32.768
parametri totali 140,9M 55,0M
di cui embedding 98,3M 12,6M
encoder 42,6M 42,4M
merge BPE 580.604 60.641

Come e' stato costruito

Conteggio dei token su 48.000 documenti, 8.000 per ciascuna delle 6 lingue. Il campionamento e' bilanciato di proposito: contando il corpus cosi' com'e', con l'italiano al 45%, sarebbe uscito un vocabolario italiano.

I 32.768 token tenuti coprono il 98,088% delle occorrenze osservate, e includono sempre i token speciali e tutti i 256 token byte: con byte_fallback sono la garanzia che nessun carattere diventi <unk>.

Un merge BPE sopravvive solo se entrambe le sue meta' e il suo risultato sono nel vocabolario tenuto. Un merge che cita un token tagliato produce un tokenizer che si carica senza errori e sbaglia in silenzio.

Il pre-tokenizer isola la punteggiatura. Senza, la BPE puo' produrre un token che contiene la fine di un'entita' e la virgola che la segue (Inc. piu' ,): un confine che cade dentro un token non e' rappresentabile in BIO, e su un campione di 2.654 entita' rendeva irrecuperabile il 2,6% degli span. Isolando la punteggiatura si scende allo 0,377%.

Frammentazione degli identificativi strutturati

La domanda che conta dopo un trimming: un codice fiscale ora si spezza in quanti pezzi in piu'?

categoria token prima token dopo rapporto
email 8,5 11,5 x1,35
court_case_number 12,7 14,3 x1,13
cadastral_identifier 18,5 20,5 x1,11
passport_number 9,0 9,3 x1,04
codice_fiscale 13,0 13,3 x1,03
phone 15,3 15,7 x1,02
partita_iva 12,3 12,3 x1,00
iban 26,0 26,0 x1,00
credit_card_number 18,5 18,5 x1,00
postal_code 6,2 6,2 x1,00

Token <unk> prodotti su tutte le sonde: 0.

Uso

from transformers import AutoModelForTokenClassification, AutoTokenizer

tok = AutoTokenizer.from_pretrained("mapo80/mmbert-small-aliasit-32k")
model = AutoModelForTokenClassification.from_pretrained(
    "mapo80/mmbert-small-aliasit-32k", num_labels=165, reference_compile=False
)

Il dataset per cui e' stato costruito e' mapo80/aliasit-pii-dataset-v2.


Generato da src/publish_hf.py il 2026-08-26T18:47:39+00:00.

Downloads last month
-
Safetensors
Model size
55M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for mapo80/mmbert-small-aliasit-32k

Finetuned
(43)
this model