yejin-korean-3b-v2-base

100% from-scratch μ‚¬μ „ν•™μŠ΅λœ ν•œκ΅­μ–΄ 3B νŒŒμš΄λ°μ΄μ…˜ λͺ¨λΈ. μ™ΈλΆ€ 곡개 λͺ¨λΈ κ°€μ€‘μΉ˜λ₯Ό μ „ν˜€ μ‚¬μš©ν•˜μ§€ μ•Šμ•˜μŠ΅λ‹ˆλ‹€.

  • νŒŒλΌλ―Έν„°: 3.02B (hidden 3072, 28 layers, 24 heads, 8 KV heads, GQA 3:1)
  • μ»¨ν…μŠ€νŠΈ 4096, RoPE theta 500000, QK-Norm, tied embeddings
  • ν† ν¬λ‚˜μ΄μ €: λ…μž 64K Byte-level BPE (ν•œκ΅­μ–΄ νŠΉν™”)
  • ν•™μŠ΅: 8x NVIDIA H200, 34000 steps, μ•½ 73B 토큰 (155GB ν•œκ΅­μ–΄ μ½”νΌμŠ€: AI Hub, CulturaX, μœ„ν‚€λ°±κ³Ό, κ΅κ³Όμ„œ λ“±)
  • ν•™μŠ΅ 손싀: ~2.0

HF μ•„ν‚€ν…μ²˜ ν΄λž˜μŠ€μ— κ΄€ν•˜μ—¬

ν•™μŠ΅ λͺ¨λΈμ€ QK-Norm(ν—€λ“œλ³„ RMSNorm, RoPE 이전) 을 μ‚¬μš©ν•©λ‹ˆλ‹€. HF LlamaForCausalLM μ—λŠ” QK-Norm이 μ—†μ–΄ 동일 ꡬ쑰λ₯Ό μ§€μ›ν•˜λŠ” Qwen3ForCausalLM 클래슀둜 λ‘œλ“œν•©λ‹ˆλ‹€. κ°€μ€‘μΉ˜λŠ” Qwen κ³Ό λ¬΄κ΄€ν•œ λ…μž ν•™μŠ΅ 결과이며, ν΄λž˜μŠ€λŠ” λͺ¨λΈ ꡬ쑰(μ—°μ‚° κ·Έλž˜ν”„) ν˜Έν™˜μ„ μœ„ν•΄μ„œλ§Œ μ‚¬μš©λ©λ‹ˆλ‹€. vLLM / llama.cpp μ—μ„œ κ·ΈλŒ€λ‘œ λ‘œλ“œ κ°€λŠ₯ν•©λ‹ˆλ‹€.

μ‚¬μš©

from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("cooler8/yejin-korean-3b-v2-base")
model = AutoModelForCausalLM.from_pretrained("cooler8/yejin-korean-3b-v2-base", torch_dtype="bfloat16", device_map="auto")
ids = tok("λŒ€ν•œλ―Όκ΅­μ˜ μˆ˜λ„λŠ”", return_tensors="pt").to(model.device)
print(tok.decode(model.generate(**ids, max_new_tokens=50)[0]))

이 λͺ¨λΈμ€ base λͺ¨λΈμž…λ‹ˆλ‹€ (μ§€μ‹œλ¬Έ νŠœλ‹ μ—†μŒ). SFT/DPO 버전: cooler8/yejin-korean-3b-v2-sft, cooler8/yejin-korean-3b-v2-dpo.

λ³€ν™˜: step 34000 체크포인트, 2026-09-12 02:27 UTC

Downloads last month
358
Safetensors
Model size
3B params
Tensor type
BF16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support