Longformer español — clasificador de CVs (direct, hasta 4096 tokens)
Fine-tuning de
mrm8488/longformer-base-4096-spanish
para clasificar currículums en español en 43 categorías profesionales,
leyendo hasta 4,096 tokens (~10 páginas) en una sola pasada, sin truncar ni
usar chunking.
Métricas (test de 2,681 documentos, evaluación única)
| Segmento | Documentos | Accuracy | F1 macro |
|---|---|---|---|
| Global | 2,681 | 78.4% | 0.775 |
| Cortos (≤512 tokens BETO) | 1,097 | 82.3% | 0.775 |
| Largos (>512 tokens BETO) | 1,584 | 75.7% | 0.758 |
Es el peor resultado global de los modelos comparados en este proyecto, pero el único que lee documentos largos completos sin truncar ni fragmentar; la brecha de F1 entre documentos cortos y largos es la más pequeña (0.775 vs 0.758, frente a 0.822 vs 0.810 de XLM-RoBERTa chunked).
Uso
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
tokenizer = AutoTokenizer.from_pretrained("heidercs/longformer-cv-direct")
model = AutoModelForSequenceClassification.from_pretrained("heidercs/longformer-cv-direct")
model.eval()
texto = "..." # texto del CV, hasta ~10 paginas
inputs = tokenizer(texto, truncation=True, max_length=4096, return_tensors="pt")
with torch.no_grad():
probs = torch.softmax(model(**inputs).logits, dim=-1)[0]
idx = int(probs.argmax())
print(model.config.id2label[idx], float(probs[idx]))
Calibración de confianza
Confianza softmax discrimina errores (media 0.768 en aciertos vs 0.504 en errores) pero satura bajo (máximo observado 0.944). Umbral recomendado: 0.65 (71% del test resuelto directo con 90.4% de acierto en esa ruta).
Datos de entrenamiento
Corpus público de currículums en inglés (43 categorías), traducido a español con MarianMT. 6,195 documentos de entrenamiento / 2,681 de test. La licencia de redistribución exacta del corpus de origen depende de sus términos publicados; revisar antes de un uso comercial estricto.
Requisitos de cómputo
Requiere considerablemente más memoria de GPU que un modelo de 512 tokens al procesar contextos de hasta 4,096 tokens.
- Downloads last month
- 18
Model tree for heidercs/longformer-cv-direct
Base model
mrm8488/longformer-base-4096-spanish