SafeGuard โ SEES Blue Team
Labels
| ID | Label | Meaning |
|---|---|---|
| 0 | SAFE | No violation |
| 1 | VIOLATION | Prompt injection / policy violation |
Challenge I/O
Input: {"conversation": [{"role": "...", "content": "..."}]}
Output: {"violation": true, "confidence": 0.97}
Usage
import json, torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("achrafness/SafeGuardX-v2")
model = AutoModelForSequenceClassification.from_pretrained("achrafness/SafeGuardX-v2")
model.eval()
def classify(conversation):
text = json.dumps(conversation)
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
logits = model(**inputs).logits
conf = float(torch.softmax(logits, dim=-1)[0][1])
return {"violation": conf > 0.5, "confidence": round(conf, 4)}
- Downloads last month
- 3