Yejin Korean 3B v2.5 Base
A Korean-English bilingual language model with 3 billion parameters.
Model Details
- Parameters: 3B
- Languages: Korean, English
- Context Length: 4096 tokens
- Tokenizer: Custom 64K vocabulary optimized for Korean
- Precision: BF16
Training
Pre-trained on a curated mix of Korean and English text data, followed by an annealing phase with high-quality reasoning and domain-specific data.
Usage
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("cooler8/yejin-korean-3b-v25-base")
model = AutoModelForCausalLM.from_pretrained("cooler8/yejin-korean-3b-v25-base", torch_dtype="auto")
inputs = tokenizer("๋ํ๋ฏผ๊ตญ์ ์๋๋", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
License
Apache 2.0
- Downloads last month
- 32
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐ Ask for provider support