XLM-RoBERTa — clasificador de CVs en español (chunked / chunk_first)

Fine-tuning de xlm-roberta-base para clasificar currículums en español en 43 categorías profesionales.

Entrenado sobre fragmentos de 512 tokens con solape de 64 (chunking como augmentación de datos), pero en inferencia solo se usa el primer fragmento de 512 tokens de cada documento (estrategia chunk_first, la de mejor resultado frente a leer todo el documento o agregar varios fragmentos).

Métricas (test de 2,681 documentos, evaluación única)

Segmento Documentos Accuracy F1 macro
Global 2,681 83.4% 0.826
Cortos (≤512 tokens) 1,097 85.9% 0.822
Largos (>512 tokens) 1,584 81.6% 0.810

Uso

from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

tokenizer = AutoTokenizer.from_pretrained("heidercs/xlmroberta-cv-chunked")
model = AutoModelForSequenceClassification.from_pretrained("heidercs/xlmroberta-cv-chunked")
model.eval()

texto = "..."  # texto del CV
inputs = tokenizer(texto, truncation=True, max_length=512, return_tensors="pt")
with torch.no_grad():
    probs = torch.softmax(model(**inputs).logits, dim=-1)[0]

idx = int(probs.argmax())
print(model.config.id2label[idx], float(probs[idx]))

Calibración de confianza

Confianza softmax bien calibrada (AUC 0.883; media 0.940 en aciertos vs 0.674 en errores). Umbral recomendado para ruta rápida sin intervención de un LLM: 0.80 (84.5% del test resuelto directo con 92.0% de acierto en esa ruta).

Datos de entrenamiento

Corpus público de currículums en inglés (43 categorías), traducido a español con MarianMT. 6,195 documentos de entrenamiento / 2,681 de test. La licencia de redistribución exacta del corpus de origen depende de sus términos publicados; revisar antes de un uso comercial estricto.

Limitaciones

Solo procesa 512 tokens (~1.5 páginas) por pasada; documentos más largos se truncan al primer fragmento. Para documentos largos sin truncar, ver heidercs/longformer-cv-direct.

Downloads last month
24
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for heidercs/xlmroberta-cv-chunked

Finetuned
(4205)
this model