itsVentie/llm-red-teaming-corpus
Viewer • Updated • 18 • 46
How to use itsVentie/nano-guard-classifier-v1 with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("text-classification", model="itsVentie/nano-guard-classifier-v1") # Load model directly
from transformers import AutoModel
model = AutoModel.from_pretrained("itsVentie/nano-guard-classifier-v1", device_map="auto")itsVentie/nano-guard-classifier-v1 is a binary sequence classification model fine-tuned for real-time prompt injection and jailbreak attack identification in LLM pipelines.
Source Code & Engine Integration: itsVentie/nano-guard on GitHub
answerdotai/ModernBERT-base0: SAFE, 1: ATTACK)ort.Evaluated on test splits of itsVentie/llm-red-teaming-corpus and itsVentie/rag-prompt-injection-bench.
| Metric | Value |
|---|---|
| Accuracy | 0.982 |
| Precision | 0.978 |
| Recall | 0.985 |
| F1 Score | 0.981 |
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
model_id = "itsVentie/nano-guard-classifier-v1"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForSequenceClassification.from_pretrained(model_id)
inputs = tokenizer("System prompt override instruction", return_tensors="pt", truncation=True, max_length=256)
with torch.no_grad():
outputs = model(**inputs)
probabilities = torch.softmax(outputs.logits, dim=-1)
risk_score = probabilities[0][1].item()
print(f"Attack Probability: {risk_score:.4f}")
Base model
answerdotai/ModernBERT-base