XLM-RoBERTa — clasificador de CVs en español (direct)

Fine-tuning de xlm-roberta-base para clasificar currículums en español en 43 categorías profesionales, leyendo únicamente los primeros 512 tokens de cada documento (sin chunking).

Es el modelo de referencia/comparación; para producción se recomienda heidercs/xlmroberta-cv-chunked (misma arquitectura, mejor resultado).

Métricas (test de 2,681 documentos, evaluación única)

Segmento Documentos Accuracy F1 macro
Global 2,681 81.4% 0.803
Cortos (≤512 tokens) 1,097 85.0% 0.820
Largos (>512 tokens) 1,584 78.9% 0.773

Uso

from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

tokenizer = AutoTokenizer.from_pretrained("heidercs/xlmroberta-cv-direct")
model = AutoModelForSequenceClassification.from_pretrained("heidercs/xlmroberta-cv-direct")
model.eval()

texto = "..."  # texto del CV
inputs = tokenizer(texto, truncation=True, max_length=512, return_tensors="pt")
with torch.no_grad():
    probs = torch.softmax(model(**inputs).logits, dim=-1)[0]

idx = int(probs.argmax())
print(model.config.id2label[idx], float(probs[idx]))

Datos de entrenamiento

Corpus público de currículums en inglés (43 categorías), traducido a español con MarianMT. 6,195 documentos de entrenamiento / 2,681 de test. La licencia de redistribución exacta del corpus de origen depende de sus términos publicados; revisar antes de un uso comercial estricto.

Limitaciones

Solo procesa 512 tokens (~1.5 páginas) por pasada; el resto del documento se descarta.

Downloads last month
24
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for heidercs/xlmroberta-cv-direct

Finetuned
(4205)
this model