JOSS: Judi Online Semantic Sniper

A text classification model trained on 21,898 rows of online gambling promotion data. Meant to be used for researcher trying to filter out low quality content from Indonesian corpuses.

Usage

import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification

MODEL_DIR = "/home/hanz/Documents/Models/hanzceo/JOSS-v1"

texts = [
    (
        "promo_1",
        "BONUS NEW MEMBER 100%! Deposit minimal 50rb langsung cair ke rekening. Mainkan slot gacor hari ini dan raih jackpot maxwin setiap putaran. Daftar sekarang di link resmi kami dan nikmati promo eksklusif tiap minggu. Turnover ringan, withdrawal cepat tanpa potongan.",
    ),
    (
        "promo_2",
        "DAPATKAN FREE BET 50RB tanpa deposit! Cukup daftar melalui link di bio dan konfirmasi via WhatsApp. Slot online terlengkap dengan RTP tertinggi, live casino langsung dari dealer profesional. Berlaku untuk member baru saja. Hubungi CS 24 jam untuk klaim bonus.",
    ),
    (
        "awareness",
        "Perjudian online telah menyebabkan ribuan keluarga Indonesia kehilangan tabungan mereka. Data Kementerian Sosial mencatat peningkatan kasus kemiskinan akibat judi online mencapai 340 persen dalam lima tahun terakhir. Gejalanya meliputi utang menumpuk, isolasi sosial, depresi, hingga upaya bunuh diri. Jika Anda atau orang terdekat mengalami ketergantungan judi, segera hubungi hotlines layanan konseling tersedia di setiap rumah sakit dan lembaga swadaya masyarakat untuk mendapatkan bantuan profesional.",
    ),
]

tokenizer = AutoTokenizer.from_pretrained(MODEL_DIR)
model = AutoModelForSequenceClassification.from_pretrained(
    MODEL_DIR,
    dtype=torch.float32,
    device_map="cpu",
)
model.eval()


@torch.no_grad()
def infer(label: str, text: str) -> dict:
    inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
    outputs = model(**inputs)
    probs = torch.softmax(outputs.logits, dim=-1)
    confidence = probs[0].tolist()
    return {"label": label, "confidence": confidence}


for label, text in texts:
    result = infer(label, text)
    print(f"[{result['label']}]")
    for i, c in enumerate(result["confidence"]):
        print(f"  Class {i}: {c:.4f}")
    print()

# [promo_1]
#  Class 0: 0.0001
#  Class 1: 0.9999
#
# [promo_2]
#  Class 0: 0.0003
#  Class 1: 0.9997
#
# [awareness]
#  Class 0: 0.9992
#  Class 1: 0.0008
Downloads last month
30
Safetensors
Model size
0.6B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for hanzceo/JOSS-v1

Dataset used to train hanzceo/JOSS-v1

Collection including hanzceo/JOSS-v1