satyamsaf3ai/merged_content_moderation_and_prompt_injection_new
Viewer • Updated • 768k • 47
XLM-RoBERTa-base dual-head classifier for content moderation and prompt injection detection. Fine-tuned with 40:60 resampling + per-class cap (30K) + WeightedRandomSampler.
| Metric | Score |
|---|---|
| Safety Accuracy | 0.8561 |
| Safety F1 | 0.5321 |
| Category Macro F1 | 0.6116 |
| Category Micro F1 | 0.6502 |
| Category | F1 |
|---|---|
| benign | 0.5339 |
| child_sexual_exploitation | 0.4491 |
| hate_and_harassment | 0.6302 |
| indiscriminate_weapons | 0.5208 |
| misinformation_and_specialized_advice | 0.4748 |
| non_violent_crimes | 0.7812 |
| pi_and_jailbreak | 0.6587 |
| privacy | 0.6972 |
| sexual_content | 0.6889 |
| suicide_and_self_harm | 0.5734 |
| violent_crimes | 0.7195 |