YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

BERTweetBR Fine-tuned para Detecção de Discurso Tóxico (ToLD-Br) - Classificação Multilabel

Descrição do Modelo

Este modelo é uma versão fine-tuned do BERTweetBR para detecção multilabel de diferentes tipos de linguagem tóxica em português brasileiro. O modelo foi treinado no corpus ToLD-Br e é capaz de identificar múltiplas categorias de toxicidade simultaneamente em um mesmo texto.

Corpus Utilizado

ToLD-Br: Dataset brasileiro de linguagem tóxica contendo 21,000 tweets em português brasileiro. Os tweets foram coletados e anotados manualmente para identificar diferentes formas de toxicidade. É o maior dataset público de linguagem tóxica em português brasileiro.

Classes (6 categorias)

  • Homophobia (Homofobia)
  • Obscene (Obscenidade)
  • Insult (Insulto)
  • Racism (Racismo)
  • Misogyny (Misoginia)
  • Xenophobia (Xenofobia)

Parâmetros de Fine-tuning

  • Modelo base: BERTweetBR
  • Número de épocas: 15
  • Tamanho do batch: 16
  • Taxa de aprendizado: 2e-5
  • Otimizador: AdamW
  • Função de perda: Binary Cross Entropy with Logits Loss
  • Melhor checkpoint: Época 0
  • Melhor perda de validação: 0.2143

Métricas de Desempenho

Avaliação no conjunto de teste (1,213 exemplos com pelo menos um rótulo):

Categoria Precision Recall F1-Score Support
Homophobia 0.48 0.59 0.53 34
Obscene 0.47 0.87 0.61 665
Insult 0.61 0.66 0.64 438
Racism 0.00 0.00 0.00 14
Misogyny 0.45 0.36 0.40 47
Xenophobia 0.20 0.07 0.10 15

Métricas Gerais:

  • Micro Average F1-Score: 0.60
  • Macro Average F1-Score: 0.38
  • Weighted Average F1-Score: 0.60
  • Samples Average: 0.33

Informações Adicionais

  • Idioma: Português Brasileiro
  • Tarefa: Classificação Multilabel de Texto
  • Domínio: Detecção de Linguagem Tóxica em Tweets
  • Desafios: Dataset desbalanceado com categorias de baixa frequência
Downloads last month
10
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support