YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
Grooming Detection – DistilGPT-2 (EN)
Tento repozitár obsahuje jemne doladený model DistilGPT-2 určený na binárnu klasifikáciu anglických textových konverzácií. Model deteguje potenciálne groomingové alebo rizikové správanie v online komunikácii.
Model bol trénovaný v rámci experimentálneho porovnania generatívnych a encoder-based architektúr.
Základný model
distilgpt2
Jazyk
angličtina
Typ úlohy
binárna klasifikácia textu
0 = bezpečný obsah
1 = rizikový / groomingový obsah
Výsledky na testovacej množine
Accuracy: 0.933
F1-score: 0.929
Precision: 0.971
Recall: 0.892
Konfúzna matica
TN: 37
FP: 1
FN: 4
TP: 33
Model dosahuje veľmi dobré výsledky v anglickom jazyku. Pri experimentoch sa však ukázalo, že DistilGPT-2 nie je vhodný pre slovenský jazyk bez jazykovo špecifického predtrénovania.
Obsah repozitára
- model.safetensors
- config.json
- tokenizer.json
- tokenizer_config.json
- special_tokens_map.json
- epoch_results.csv
- training_log.txt
Použitie
Model je pripravený na použitie cez knižnicu transformers ako AutoModelForSequenceClassification.
Poznámka
Tento model je určený primárne pre anglické dáta. Použitie na iné jazyky môže viesť k výraznému poklesu presnosti.
Autor: Patrik Gajdoš
Rok: 2025
- Downloads last month
- 10