Longformer español — clasificador de CVs (direct, hasta 4096 tokens)

Fine-tuning de mrm8488/longformer-base-4096-spanish para clasificar currículums en español en 43 categorías profesionales, leyendo hasta 4,096 tokens (~10 páginas) en una sola pasada, sin truncar ni usar chunking.

Métricas (test de 2,681 documentos, evaluación única)

Segmento Documentos Accuracy F1 macro
Global 2,681 78.4% 0.775
Cortos (≤512 tokens BETO) 1,097 82.3% 0.775
Largos (>512 tokens BETO) 1,584 75.7% 0.758

Es el peor resultado global de los modelos comparados en este proyecto, pero el único que lee documentos largos completos sin truncar ni fragmentar; la brecha de F1 entre documentos cortos y largos es la más pequeña (0.775 vs 0.758, frente a 0.822 vs 0.810 de XLM-RoBERTa chunked).

Uso

from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

tokenizer = AutoTokenizer.from_pretrained("heidercs/longformer-cv-direct")
model = AutoModelForSequenceClassification.from_pretrained("heidercs/longformer-cv-direct")
model.eval()

texto = "..."  # texto del CV, hasta ~10 paginas
inputs = tokenizer(texto, truncation=True, max_length=4096, return_tensors="pt")
with torch.no_grad():
    probs = torch.softmax(model(**inputs).logits, dim=-1)[0]

idx = int(probs.argmax())
print(model.config.id2label[idx], float(probs[idx]))

Calibración de confianza

Confianza softmax discrimina errores (media 0.768 en aciertos vs 0.504 en errores) pero satura bajo (máximo observado 0.944). Umbral recomendado: 0.65 (71% del test resuelto directo con 90.4% de acierto en esa ruta).

Datos de entrenamiento

Corpus público de currículums en inglés (43 categorías), traducido a español con MarianMT. 6,195 documentos de entrenamiento / 2,681 de test. La licencia de redistribución exacta del corpus de origen depende de sus términos publicados; revisar antes de un uso comercial estricto.

Requisitos de cómputo

Requiere considerablemente más memoria de GPU que un modelo de 512 tokens al procesar contextos de hasta 4,096 tokens.

Downloads last month
18
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for heidercs/longformer-cv-direct

Finetuned
(4)
this model