XLMRShield

XLM-RoBERTa-base dual-head classifier for content moderation and prompt injection detection. Fine-tuned with 40:60 resampling + per-class cap (30K) + WeightedRandomSampler.

Test Results

Metric Score
Safety Accuracy 0.8561
Safety F1 0.5321
Category Macro F1 0.6116
Category Micro F1 0.6502

Per-Class F1

Category F1
benign 0.5339
child_sexual_exploitation 0.4491
hate_and_harassment 0.6302
indiscriminate_weapons 0.5208
misinformation_and_specialized_advice 0.4748
non_violent_crimes 0.7812
pi_and_jailbreak 0.6587
privacy 0.6972
sexual_content 0.6889
suicide_and_self_harm 0.5734
violent_crimes 0.7195

Architecture

  • Backbone: xlm-roberta-base (278M params)
  • Head 1: Safety binary (sigmoid)
  • Head 2: 11-class multi-label (sigmoid)
  • Tokenizer: xlm-roberta-base

Training

  • Dataset: satyamsaf3ai/merged_content_moderation_and_prompt_injection_new
  • Balancing: 40:60 resampling + per-class cap 30K + WeightedRandomSampler
  • BF16 mixed precision, AdamW + cosine LR, 4 epochs
  • max_length=128, batch_size=32, lr=2e-05
Downloads last month
4
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train jainsatyam26/xlmr-shield