XLM-RoBERTa — clasificador de CVs en español (chunked / chunk_first)
Fine-tuning de xlm-roberta-base para
clasificar currículums en español en 43 categorías profesionales.
Entrenado sobre fragmentos de 512 tokens con solape de 64 (chunking como
augmentación de datos), pero en inferencia solo se usa el primer fragmento
de 512 tokens de cada documento (estrategia chunk_first, la de mejor
resultado frente a leer todo el documento o agregar varios fragmentos).
Métricas (test de 2,681 documentos, evaluación única)
| Segmento | Documentos | Accuracy | F1 macro |
|---|---|---|---|
| Global | 2,681 | 83.4% | 0.826 |
| Cortos (≤512 tokens) | 1,097 | 85.9% | 0.822 |
| Largos (>512 tokens) | 1,584 | 81.6% | 0.810 |
Uso
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
tokenizer = AutoTokenizer.from_pretrained("heidercs/xlmroberta-cv-chunked")
model = AutoModelForSequenceClassification.from_pretrained("heidercs/xlmroberta-cv-chunked")
model.eval()
texto = "..." # texto del CV
inputs = tokenizer(texto, truncation=True, max_length=512, return_tensors="pt")
with torch.no_grad():
probs = torch.softmax(model(**inputs).logits, dim=-1)[0]
idx = int(probs.argmax())
print(model.config.id2label[idx], float(probs[idx]))
Calibración de confianza
Confianza softmax bien calibrada (AUC 0.883; media 0.940 en aciertos vs 0.674 en errores). Umbral recomendado para ruta rápida sin intervención de un LLM: 0.80 (84.5% del test resuelto directo con 92.0% de acierto en esa ruta).
Datos de entrenamiento
Corpus público de currículums en inglés (43 categorías), traducido a español con MarianMT. 6,195 documentos de entrenamiento / 2,681 de test. La licencia de redistribución exacta del corpus de origen depende de sus términos publicados; revisar antes de un uso comercial estricto.
Limitaciones
Solo procesa 512 tokens (~1.5 páginas) por pasada; documentos más largos se
truncan al primer fragmento. Para documentos largos sin truncar, ver
heidercs/longformer-cv-direct.
- Downloads last month
- 24
Model tree for heidercs/xlmroberta-cv-chunked
Base model
FacebookAI/xlm-roberta-base