Instructions to use jismsy/ko-hallucheck-4b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use jismsy/ko-hallucheck-4b with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="jismsy/ko-hallucheck-4b")# Load model directly from transformers import AutoProcessor, AutoModelForSequenceClassification processor = AutoProcessor.from_pretrained("jismsy/ko-hallucheck-4b") model = AutoModelForSequenceClassification.from_pretrained("jismsy/ko-hallucheck-4b", device_map="auto") - Notebooks
- Google Colab
- Kaggle
ko-hallucheck-4b β νκ΅μ΄ νκ° νλ³ κ°λ ₯ ν°μ΄
νκ΅μ΄ (context, answer) μμ λ°μ λ΅λ³μ΄ λ¬Έλ§₯μ μν΄ λ·λ°μΉ¨λλμ§ νμ νλ 4B sequence classifierμ
λλ€.
HALLUCINATED = 0: λ¬Έλ§₯κ³Ό λͺ¨μλκ±°λ λ¬Έλ§₯μ μλ μ£Όμ₯μ ν¬ν¨SUPPORTED = 1: λ΅λ³μ μ£Όμ₯μ΄ λ¬Έλ§₯μ μν΄ λ·λ°μΉ¨λ¨
μ΄ λͺ¨λΈμ ko-hallucheck-v3μ λ체νμ΄λΌκΈ°λ³΄λ€ μ¬νμ μ© κ°λ ₯ ν°μ΄μ λλ€. v3λ‘ μ λμ λΉ λ₯΄κ² μ λ³νκ³ , λΆνμ€νκ±°λ κ³ μνμΈ μ¬λ‘λ§ μ΄ 4B λͺ¨λΈλ‘ μ¬λ¦¬λ ꡬμ±μ κΆμ₯ν©λλ€.
μ±λ₯μ μ ν¬ λͺ¨λΈμ λΆλ¦¬ν κ²°κ³Όμ μμ±κΈ° λ 립 νκ°λ₯Ό ν¬ν¨ν΄ κ·Έλλ‘ κ³΅κ°ν©λλ€. μλ μμΉλ μ νλμ΄λ©° κ΄νΈ μμ AUROCμ λλ€.
μ±λ₯
| νκ° | n | v3.1 (0.6B) | 4B | ν΄μ |
|---|---|---|---|---|
| Ko-FaithBench Standard | 982 | 0.882 (0.951) | 0.970 (0.994) | κ°μ μμ±κΈ° κ³μ΄μ μν₯μΌλ‘ λ€μ νν νκ° |
| Ko-FaithBench Hard | 380 | 0.758 (0.824) | 0.808 (0.920) | νλ°ν°μ΄λ μ΄λ €μν μ λμ λ¬Έν |
| κ΅μ°¨ μμ±κΈ° | 162 | 0.704 (0.776) | 0.833 (0.931) | DeepSeek μΆμ , νμ΅Β·νμ€ λ²€μΉμ μμ±κΈ° λΆλ¦¬. 보μμ μ€μ μΆμ μΉ |
μΆκ° κ²μ¦μμ in-distribution 0.932 (AUROC 0.980), KLUE κΈ°λ° λ΄μ€ OOD 0.958 (AUROC 0.977)μ κΈ°λ‘νμ΅λλ€. νκ° λ°μ΄ν°μ μ€ν¬λ¦½νΈ μ€κ³λ Ko-FaithBenchλ₯Ό μ°Έκ³ νμΈμ.
μ¬μ©λ²
transformers>=5.5.0κ³Ό PyTorchκ° νμν©λλ€. λ³ν©λ BF16 κ°μ€μΉλ μ½ 8.6GBμ
λλ€.
μ°Έκ³ μ© μ€μΈ‘: NVIDIA GB10μμ νλ‘μΈμ€ μ΅μ΄ λ‘λλ 40.8μ΄, λ‘λ ν μ§§μ μ λ ₯ 2κ° λ°°μΉμ warm forwardλ 0.235μ΄(μ½ 8.5μ/μ΄)μμ΅λλ€. μ λ ₯ κΈΈμ΄Β·λ°°μΉΒ·λ°νμμ λ°λΌ λ¬λΌμ§λ―λ‘ λͺ¨λΈμ μμ²λ§λ€ λ€μ λ‘λνμ§ λ§κ³ μμ£Ό μλΉμ€λ‘ μ΄μνμΈμ. GB10μμλ compute capability 12.1μ μ μ μ§μνλ PyTorch λΉλλ₯Ό κΆμ₯ν©λλ€.
import torch
from transformers import AutoModelForSequenceClassification, AutoTokenizer
model_id = "jismsy/ko-hallucheck-4b"
device = "cuda" if torch.cuda.is_available() else "cpu"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForSequenceClassification.from_pretrained(
model_id,
dtype="auto",
).to(device).eval()
context = "μΈμ’
λμμ μ‘°μ μ μ 4λ μμ΄λ©° νλ―Όμ μμ μ°½μ νλ€."
answer = "μΈμ’
λμμ νλ―Όμ μμ μ°½μ νλ€."
inputs = tokenizer(
context,
answer,
truncation="longest_first",
max_length=512,
return_tensors="pt",
).to(device)
if "token_type_ids" not in inputs:
inputs["token_type_ids"] = torch.zeros_like(inputs["input_ids"])
with torch.inference_mode():
logits = model(**inputs).logits.float()
prob_supported = torch.softmax(logits, dim=-1)[0, 1].item()
label = "SUPPORTED" if prob_supported >= 0.5 else "HALLUCINATED"
print({"label": label, "prob_supported": prob_supported})
μ μ₯μμ inference_4b.pyλ λμΌν λ‘μ§μ CLI μμ μ
λλ€.
κΆμ₯ μ΄μ ꡬ쑰
ko-hallucheck-v3λ‘ μ 체 μμ²μ μ λΉμ© μ λ³ν©λλ€.- μ μκ° μκ³κ° μ£Όλ³μ΄κ±°λ κ³μ½Β·κ·μΒ·λ²λ₯ μ²λΌ μ€λ₯ λΉμ©μ΄ ν° μ¬λ‘λ₯Ό μ΄ λͺ¨λΈλ‘ μ¬νμ ν©λλ€.
- λ λͺ¨λΈμ΄ λΆμΌμΉνκ±°λ κ°μ²΄ μν μ΄ ν΅μ¬μΈ μ¬λ‘λ μ¬λ λλ λ κ°ν μΈλΆ μ¬νμΌλ‘ 보λ λλ€.
μ μλ λλ©μΈ κ°μ μμ ν 보μ λ νλ₯ μ΄ μλλλ€. μ€μ λ°μ΄ν°μ κ²μ¦μ μΌλ‘ μκ³κ°μ λ€μ μ ννμΈμ.
μλ €μ§ μ½μ
- 주체·μν νΌλμ 4Bμμλ ν΄κ²°λμ§ μμμ΅λλ€. hard 주체νΌλ 45건μ νκ° recallμ v3.1μ 0.20μμ 4Bμ 0.25λ‘λ§ μ¬λμ΅λλ€. κ΄κ³μ°μ recallμ 0.17μμ 0.58λ‘ κ°μ λμ§λ§ μ¬μ ν λ¨λ μλνμ μ λΆμ‘±ν©λλ€.
- λ€μ€ μ€λ₯μ λΆλΆμ μΌλ‘λ§ μΆ©μ€ν κΈ΄ λ΅λ³μ μΆ©λΆν κ²μ¦λμ§ μμμ΅λλ€.
- νμ΅κ³Ό μ£Όμ νκ°λ μν€λ°±κ³Ό 문체 μ€μ¬μ λλ€. λ΄μ€ OODλ κ²μ¦νμ§λ§ ꡬμ΄Β·μλ£Β·λ²λ₯ Β·μ¬λ΄ λ¬Έμλ λ³λ κ²μ¦μ΄ νμν©λλ€.
- νμ΅ νκ°μ ν©μ± λ° LLM μμ± λ°μ΄ν° μ€μ¬μ΄λ©° μμ° λ°μ νκ°μ μ 체 λΆν¬λ₯Ό λννμ§ μμ΅λλ€.
- μ΄ λͺ¨λΈμ μ¬μ€ κ²μκΈ°κ° μλλλ€. μ€μ§ μ 곡λ λ¬Έλ§₯κ³Ό λ΅λ³ μ¬μ΄μ μΆ©μ€μ±μ νμ ν©λλ€.
νμ΅
- Base:
unsloth/gemma-3-4b-it - Task: 2-label sequence classification
- Method: 4-bit QLoRA, rank 16, 1 epoch; μ΄ν BF16 λ² μ΄μ€μ μ΄λν° λ³ν©
- Max length: 512
- Data: v3.1κ³Ό λμΌν context-group λΆν νμ΅μ
- Benchmark isolation: Ko-FaithBench 본체μ κ΅μ°¨ μμ±κΈ° νκ°λ νμ΅μ μ¬μ©νμ§ μμ
λΌμ΄μ μ€
μ΄ νμ λͺ¨λΈμ Gemma κΈ°λ° λͺ¨λΈμ λλ€. μ¬μ©μλ Gemma Terms of Useλ₯Ό μ€μν΄μΌ ν©λλ€.
Citation
@misc{kohallucheck4b2026,
title={ko-hallucheck-4b: A Strong-Tier Korean Faithfulness Classifier},
author={ianwoo},
year={2026},
url={https://huggingface.co/jismsy/ko-hallucheck-4b}
}
- Downloads last month
- 19