YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
BERTweetBR Fine-tuned para Detecção de Discurso Tóxico (ToLD-Br) - Classificação Multilabel
Descrição do Modelo
Este modelo é uma versão fine-tuned do BERTweetBR para detecção multilabel de diferentes tipos de linguagem tóxica em português brasileiro. O modelo foi treinado no corpus ToLD-Br e é capaz de identificar múltiplas categorias de toxicidade simultaneamente em um mesmo texto.
Corpus Utilizado
ToLD-Br: Dataset brasileiro de linguagem tóxica contendo 21,000 tweets em português brasileiro. Os tweets foram coletados e anotados manualmente para identificar diferentes formas de toxicidade. É o maior dataset público de linguagem tóxica em português brasileiro.
Classes (6 categorias)
- Homophobia (Homofobia)
- Obscene (Obscenidade)
- Insult (Insulto)
- Racism (Racismo)
- Misogyny (Misoginia)
- Xenophobia (Xenofobia)
Parâmetros de Fine-tuning
- Modelo base: BERTweetBR
- Número de épocas: 15
- Tamanho do batch: 16
- Taxa de aprendizado: 2e-5
- Otimizador: AdamW
- Função de perda: Binary Cross Entropy with Logits Loss
- Melhor checkpoint: Época 0
- Melhor perda de validação: 0.2143
Métricas de Desempenho
Avaliação no conjunto de teste (1,213 exemplos com pelo menos um rótulo):
| Categoria | Precision | Recall | F1-Score | Support |
|---|---|---|---|---|
| Homophobia | 0.48 | 0.59 | 0.53 | 34 |
| Obscene | 0.47 | 0.87 | 0.61 | 665 |
| Insult | 0.61 | 0.66 | 0.64 | 438 |
| Racism | 0.00 | 0.00 | 0.00 | 14 |
| Misogyny | 0.45 | 0.36 | 0.40 | 47 |
| Xenophobia | 0.20 | 0.07 | 0.10 | 15 |
Métricas Gerais:
- Micro Average F1-Score: 0.60
- Macro Average F1-Score: 0.38
- Weighted Average F1-Score: 0.60
- Samples Average: 0.33
Informações Adicionais
- Idioma: Português Brasileiro
- Tarefa: Classificação Multilabel de Texto
- Domínio: Detecção de Linguagem Tóxica em Tweets
- Desafios: Dataset desbalanceado com categorias de baixa frequência
- Downloads last month
- 10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support