Instructions to use mapo80/mmbert-small-aliasit-32k with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use mapo80/mmbert-small-aliasit-32k with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("fill-mask", model="mapo80/mmbert-small-aliasit-32k")# Load model directly from transformers import AutoTokenizer, AutoModelForMaskedLM tokenizer = AutoTokenizer.from_pretrained("mapo80/mmbert-small-aliasit-32k") model = AutoModelForMaskedLM.from_pretrained("mapo80/mmbert-small-aliasit-32k", device_map="auto") - Notebooks
- Google Colab
- Kaggle
mmbert-small-aliasit-32k
jhu-clsp/mmBERT-small con vocabolario ridotto a 32.768 token sui dati di training di aliasit-pii-dataset-v2. NON e' fine-tuned: e' il punto di partenza di aliasit-pii-edge.
Questo modello non e' addestrato al riconoscimento di PII. E' il backbone da cui si parte: jhu-clsp/mmBERT-small con l'embedding ristretto al vocabolario che serve. Serve come base_model di un fine-tuning, non come modello finito.
| prima | dopo | |
|---|---|---|
| vocabolario | 256.000 | 32.768 |
| parametri totali | 140,9M | 55,0M |
| di cui embedding | 98,3M | 12,6M |
| encoder | 42,6M | 42,4M |
| merge BPE | 580.604 | 60.641 |
Come e' stato costruito
Conteggio dei token su 48.000 documenti, 8.000 per ciascuna delle 6 lingue. Il campionamento e' bilanciato di proposito: contando il corpus cosi' com'e', con l'italiano al 45%, sarebbe uscito un vocabolario italiano.
I 32.768 token tenuti coprono il 98,088% delle occorrenze osservate, e includono sempre i token speciali e tutti i 256 token byte: con byte_fallback sono la garanzia che nessun carattere diventi <unk>.
Un merge BPE sopravvive solo se entrambe le sue meta' e il suo risultato sono nel vocabolario tenuto. Un merge che cita un token tagliato produce un tokenizer che si carica senza errori e sbaglia in silenzio.
Il pre-tokenizer isola la punteggiatura. Senza, la BPE puo' produrre un token che contiene la fine di un'entita' e la virgola che la segue (Inc. piu' ,): un confine che cade dentro un token non e' rappresentabile in BIO, e su un campione di 2.654 entita' rendeva irrecuperabile il 2,6% degli span. Isolando la punteggiatura si scende allo 0,377%.
Frammentazione degli identificativi strutturati
La domanda che conta dopo un trimming: un codice fiscale ora si spezza in quanti pezzi in piu'?
| categoria | token prima | token dopo | rapporto |
|---|---|---|---|
email |
8,5 | 11,5 | x1,35 |
court_case_number |
12,7 | 14,3 | x1,13 |
cadastral_identifier |
18,5 | 20,5 | x1,11 |
passport_number |
9,0 | 9,3 | x1,04 |
codice_fiscale |
13,0 | 13,3 | x1,03 |
phone |
15,3 | 15,7 | x1,02 |
partita_iva |
12,3 | 12,3 | x1,00 |
iban |
26,0 | 26,0 | x1,00 |
credit_card_number |
18,5 | 18,5 | x1,00 |
postal_code |
6,2 | 6,2 | x1,00 |
Token <unk> prodotti su tutte le sonde: 0.
Uso
from transformers import AutoModelForTokenClassification, AutoTokenizer
tok = AutoTokenizer.from_pretrained("mapo80/mmbert-small-aliasit-32k")
model = AutoModelForTokenClassification.from_pretrained(
"mapo80/mmbert-small-aliasit-32k", num_labels=165, reference_compile=False
)
Il dataset per cui e' stato costruito e' mapo80/aliasit-pii-dataset-v2.
Generato da src/publish_hf.py il 2026-08-26T18:47:39+00:00.
- Downloads last month
- -
Model tree for mapo80/mmbert-small-aliasit-32k
Base model
jhu-clsp/mmBERT-small