XLM-RoBERTa — clasificador de CVs en español (direct)
Fine-tuning de xlm-roberta-base para
clasificar currículums en español en 43 categorías profesionales, leyendo
únicamente los primeros 512 tokens de cada documento (sin chunking).
Es el modelo de referencia/comparación; para producción se recomienda
heidercs/xlmroberta-cv-chunked
(misma arquitectura, mejor resultado).
Métricas (test de 2,681 documentos, evaluación única)
| Segmento | Documentos | Accuracy | F1 macro |
|---|---|---|---|
| Global | 2,681 | 81.4% | 0.803 |
| Cortos (≤512 tokens) | 1,097 | 85.0% | 0.820 |
| Largos (>512 tokens) | 1,584 | 78.9% | 0.773 |
Uso
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
tokenizer = AutoTokenizer.from_pretrained("heidercs/xlmroberta-cv-direct")
model = AutoModelForSequenceClassification.from_pretrained("heidercs/xlmroberta-cv-direct")
model.eval()
texto = "..." # texto del CV
inputs = tokenizer(texto, truncation=True, max_length=512, return_tensors="pt")
with torch.no_grad():
probs = torch.softmax(model(**inputs).logits, dim=-1)[0]
idx = int(probs.argmax())
print(model.config.id2label[idx], float(probs[idx]))
Datos de entrenamiento
Corpus público de currículums en inglés (43 categorías), traducido a español con MarianMT. 6,195 documentos de entrenamiento / 2,681 de test. La licencia de redistribución exacta del corpus de origen depende de sus términos publicados; revisar antes de un uso comercial estricto.
Limitaciones
Solo procesa 512 tokens (~1.5 páginas) por pasada; el resto del documento se descarta.
- Downloads last month
- 24
Model tree for heidercs/xlmroberta-cv-direct
Base model
FacebookAI/xlm-roberta-base