V3 Twitter-XLM-R — clasificación de discurso tóxico

Modelo de clasificación de secuencias en español para cuatro clases:

  1. No Tóxico
  2. Lenguaje Ofensivo
  3. Discurso de Odio
  4. Amenazas/Violencia

Está basado en cardiffnlp/twitter-xlm-roberta-base y fue ajustado con el corpus B2 del proyecto, usando texto_modelo, longitud máxima 128 y semilla 42.

Resultados

Corte F1 macro Accuracy
Validación (n=459) 0.8211 0.8235
Test (n=460) 0.8362 0.8413

IC bootstrap 95% del F1 de test: [0.7995, 0.8690].

Uso

from transformers import pipeline

clf = pipeline("text-classification", model="caeher/twitter-xlm-roberta-v3-sv")
clf("texto de una publicación")

Para reproducir exactamente el preprocesamiento, normalice el texto con la versión 1.2 del proyecto antes de tokenizarlo. Este modelo no debe usarse como único criterio para moderación ni para decisiones sobre personas; requiere revisión humana y evaluación específica del dominio.

Datos y limitaciones

El conjunto contiene publicaciones públicas anonimizadas para entrenamiento, con lenguaje ofensivo y discurso de odio explícito. Las métricas dependen de la distribución del corpus y muestran una brecha entre X y Facebook. La sonda adversarial es diagnóstica, no sustituye al test independiente.

Downloads last month
11
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support