hanzceo/JOSS-data-L3
Viewer • Updated • 82.8k • 111
How to use hanzceo/JOSS-v1 with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("text-classification", model="hanzceo/JOSS-v1") # Load model directly
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("hanzceo/JOSS-v1")
model = AutoModelForSequenceClassification.from_pretrained("hanzceo/JOSS-v1", device_map="auto")A text classification model trained on 21,898 rows of online gambling promotion data. Meant to be used for researcher trying to filter out low quality content from Indonesian corpuses.
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
MODEL_DIR = "/home/hanz/Documents/Models/hanzceo/JOSS-v1"
texts = [
(
"promo_1",
"BONUS NEW MEMBER 100%! Deposit minimal 50rb langsung cair ke rekening. Mainkan slot gacor hari ini dan raih jackpot maxwin setiap putaran. Daftar sekarang di link resmi kami dan nikmati promo eksklusif tiap minggu. Turnover ringan, withdrawal cepat tanpa potongan.",
),
(
"promo_2",
"DAPATKAN FREE BET 50RB tanpa deposit! Cukup daftar melalui link di bio dan konfirmasi via WhatsApp. Slot online terlengkap dengan RTP tertinggi, live casino langsung dari dealer profesional. Berlaku untuk member baru saja. Hubungi CS 24 jam untuk klaim bonus.",
),
(
"awareness",
"Perjudian online telah menyebabkan ribuan keluarga Indonesia kehilangan tabungan mereka. Data Kementerian Sosial mencatat peningkatan kasus kemiskinan akibat judi online mencapai 340 persen dalam lima tahun terakhir. Gejalanya meliputi utang menumpuk, isolasi sosial, depresi, hingga upaya bunuh diri. Jika Anda atau orang terdekat mengalami ketergantungan judi, segera hubungi hotlines layanan konseling tersedia di setiap rumah sakit dan lembaga swadaya masyarakat untuk mendapatkan bantuan profesional.",
),
]
tokenizer = AutoTokenizer.from_pretrained(MODEL_DIR)
model = AutoModelForSequenceClassification.from_pretrained(
MODEL_DIR,
dtype=torch.float32,
device_map="cpu",
)
model.eval()
@torch.no_grad()
def infer(label: str, text: str) -> dict:
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
outputs = model(**inputs)
probs = torch.softmax(outputs.logits, dim=-1)
confidence = probs[0].tolist()
return {"label": label, "confidence": confidence}
for label, text in texts:
result = infer(label, text)
print(f"[{result['label']}]")
for i, c in enumerate(result["confidence"]):
print(f" Class {i}: {c:.4f}")
print()
# [promo_1]
# Class 0: 0.0001
# Class 1: 0.9999
#
# [promo_2]
# Class 0: 0.0003
# Class 1: 0.9997
#
# [awareness]
# Class 0: 0.9992
# Class 1: 0.0008
Base model
Qwen/Qwen3-0.6B-Base