SafeGuard โ€” SEES Blue Team

Labels

ID Label Meaning
0 SAFE No violation
1 VIOLATION Prompt injection / policy violation

Challenge I/O

Input: {"conversation": [{"role": "...", "content": "..."}]} Output: {"violation": true, "confidence": 0.97}

Usage

import json, torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification

tokenizer = AutoTokenizer.from_pretrained("achrafness/SafeGuardX-v2")
model = AutoModelForSequenceClassification.from_pretrained("achrafness/SafeGuardX-v2")
model.eval()

def classify(conversation):
    text = json.dumps(conversation)
    inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
    with torch.no_grad():
        logits = model(**inputs).logits
    conf = float(torch.softmax(logits, dim=-1)[0][1])
    return {"violation": conf > 0.5, "confidence": round(conf, 4)}
Downloads last month
3
Safetensors
Model size
0.6B params
Tensor type
BF16
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support