Instructions to use caeher/twitter-xlm-roberta-v3-sv with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use caeher/twitter-xlm-roberta-v3-sv with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="caeher/twitter-xlm-roberta-v3-sv")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("caeher/twitter-xlm-roberta-v3-sv") model = AutoModelForSequenceClassification.from_pretrained("caeher/twitter-xlm-roberta-v3-sv", device_map="auto") - Notebooks
- Google Colab
- Kaggle
V3 Twitter-XLM-R — clasificación de discurso tóxico
Modelo de clasificación de secuencias en español para cuatro clases:
- No Tóxico
- Lenguaje Ofensivo
- Discurso de Odio
- Amenazas/Violencia
Está basado en cardiffnlp/twitter-xlm-roberta-base y fue ajustado con el
corpus B2 del proyecto, usando texto_modelo, longitud máxima 128 y semilla
42.
Resultados
| Corte | F1 macro | Accuracy |
|---|---|---|
| Validación (n=459) | 0.8211 | 0.8235 |
| Test (n=460) | 0.8362 | 0.8413 |
IC bootstrap 95% del F1 de test: [0.7995, 0.8690].
Uso
from transformers import pipeline
clf = pipeline("text-classification", model="caeher/twitter-xlm-roberta-v3-sv")
clf("texto de una publicación")
Para reproducir exactamente el preprocesamiento, normalice el texto con la versión 1.2 del proyecto antes de tokenizarlo. Este modelo no debe usarse como único criterio para moderación ni para decisiones sobre personas; requiere revisión humana y evaluación específica del dominio.
Datos y limitaciones
El conjunto contiene publicaciones públicas anonimizadas para entrenamiento, con lenguaje ofensivo y discurso de odio explícito. Las métricas dependen de la distribución del corpus y muestran una brecha entre X y Facebook. La sonda adversarial es diagnóstica, no sustituye al test independiente.
- Downloads last month
- 11