Yejin Korean 3B v2.5 Base

A Korean-English bilingual language model with 3 billion parameters.

Model Details

  • Parameters: 3B
  • Languages: Korean, English
  • Context Length: 4096 tokens
  • Tokenizer: Custom 64K vocabulary optimized for Korean
  • Precision: BF16

Training

Pre-trained on a curated mix of Korean and English text data, followed by an annealing phase with high-quality reasoning and domain-specific data.

Usage

from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("cooler8/yejin-korean-3b-v25-base")
model = AutoModelForCausalLM.from_pretrained("cooler8/yejin-korean-3b-v25-base", torch_dtype="auto")

inputs = tokenizer("๋Œ€ํ•œ๋ฏผ๊ตญ์˜ ์ˆ˜๋„๋Š”", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

License

Apache 2.0

Downloads last month
32
Safetensors
Model size
3B params
Tensor type
BF16
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support