ko-morph-qwen2.5-0.5b-cpt

Qwen2.5-0.5B ๋ฐฑ๋ณธ์— **ํ˜•ํƒœ์†Œ ์ œ์•ฝ BPE ํ† ํฌ๋‚˜์ด์ €(32k)**๋ฅผ ์ด์‹ํ•˜๊ณ , ํ•œ๊ตญ์–ด ์›น ์ฝ”ํผ์Šค(FineWeb-2 kor_Hang ์„ ๋ณ„๋ณธ) 2.5B ํ† ํฐ์œผ๋กœ continued pretraining(CPT)ํ•œ ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค. FVT(Fast Vocabulary Transfer)๋กœ ์ž„๋ฒ ๋”ฉ์„ ์ดˆ๊ธฐํ™”ํ•œ ๋’ค CPTํ–ˆ์Šต๋‹ˆ๋‹ค.

์ŠคํŽ™

  • ๋ฐฑ๋ณธ: Qwen2.5-0.5B (hidden 896 / 24์ธต / GQA 14:2)
  • ํŒŒ๋ผ๋ฏธํ„ฐ: 386.6M (vocab ๊ต์ฒด๋กœ 494M โ†’ ๊ฐ์†Œ, ์ž„๋ฒ ๋”ฉ 136.1M โ†’ 28.7M)
  • vocab: 32,000 (ํ˜•ํƒœ์†Œ ์ œ์•ฝ BPE, Kiwi ๊ธฐ๋ฐ˜ ๋ฌด์†์‹ค ํ‘œ์ธต ๋ถ„์ ˆ)
  • dtype: float16
  • ํ•™์Šต: DDP + ZeRO-1 + fp16 AMP, 9,555 ์Šคํ…, lr 5e-5 cosine, 2.50B ํ† ํฐ

์•Œ๋ ค์ง„ ์ œ์•ฝ

  • ๊ฐœํ–‰์„ ์ธ์ฝ”๋”ฉํ•˜์ง€ ๋ชปํ•ฉ๋‹ˆ๋‹ค. pre_tokenizer๊ฐ€ WhitespaceSplit์ด๋ผ ๊ณต๋ฐฑ๋ฅ˜๋ฅผ ๋ฒ„๋ฆฌ๊ณ , vocab์— \n์„ ํฌํ•จํ•œ ํ† ํฐ์ด ์—†์Šต๋‹ˆ๋‹ค. ๋ชจ๋ธ์€ ์ค„๋ฐ”๊ฟˆ์„ ๋ณด์ง€๋„ ๋งŒ๋“ค์ง€๋„ ๋ชปํ•˜๋ฉฐ, ๋ฌธ๋‹จ ๊ตฌ์กฐ๊ฐ€ ํ‰ํƒ„ํ™”๋ฉ๋‹ˆ๋‹ค.
  • ์‚ฐ์ˆ /๋…ผ๋ฆฌ ์ถ”๋ก ์ด ์›๋ณธ ๋Œ€๋น„ ์•ฝํ™”๋์„ ๊ฐ€๋Šฅ์„ฑ์ด ์žˆ์Šต๋‹ˆ๋‹ค. Qwen2.5๋Š” ์ˆ˜ํ•™ยท์ฝ”๋“œ๋ฅผ ๋Œ€๋Ÿ‰ ํ•™์Šตํ–ˆ๋Š”๋ฐ, ๊ทธ ์œ„์— ํ•œ๊ตญ์–ด ์›น ํ…์ŠคํŠธ๋งŒ ์–น์€ CPT๋ผ catastrophic forgetting ์ •ํ™ฉ์ด ๊ด€์ฐฐ๋ฉ๋‹ˆ๋‹ค.

ํ‰๊ฐ€

ํ™€๋“œ์•„์›ƒ BPC (bits/char, 419๋งŒ ํ† ํฐ):

loss ppl BPC
CPT ์ „ (FVT ์ดˆ๊ธฐํ™”) 7.17 1297.7 5.54
CPT ํ›„ 2.51 12.3 1.94

KoAlpaca SFT ํ›„ Qwen2.5-0.5B ์›๋ณธ(๋™์ผ SFT ์กฐ๊ฑด)๊ณผ ๋น„๊ต (๋ฒ ์ด์Šค ๋ชจ๋ธ๋ผ๋ฆฌ ๋น„๊ต, Instruct ๋ชจ๋ธ ์•„๋‹˜):

ํ‰๊ฐ€ ๋ณธ ๋ชจ๋ธ Qwen ์›๋ณธ
๋ฌธ๋ฒ• ์ตœ์†Œ๋Œ€๋ฆฝ์Œ (334์Œ) 327/334 (97.9%) 293/334 (87.7%)
ํ•œ๊ตญ์–ด ์ง€์‹ยท์ƒ์‹ (8๋ฌธํ•ญ) ์ •ํ™• 3 / ๋ถ€๋ถ„ 3 / ์˜ค๋‹ต 2 ์˜ค๋‹ต 8
์ผ๋ฐ˜ ์ถ”๋ก  (10๋ฌธํ•ญ) ์ •๋‹ต 2 / ๋ถ€๋ถ„ 1 ์ •๋‹ต 3

McNemar p = 1.95ร—10โปโธ (๋ฌธ๋ฒ• ํ‰๊ฐ€).

์‚ฌ์šฉ๋ฒ•

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

tok = AutoTokenizer.from_pretrained("wwwcomcom/ko-morph-qwen2.5-0.5b-cpt")
model = AutoModelForCausalLM.from_pretrained("wwwcomcom/ko-morph-qwen2.5-0.5b-cpt", dtype=torch.float16)

ids = tok("์•ˆ๋…•ํ•˜์„ธ์š”, ์˜ค๋Š˜ ๋‚ ์”จ๋Š”", return_tensors="pt").input_ids
out = model.generate(ids, max_new_tokens=64, do_sample=True, temperature=0.8)
print(tok.decode(out[0]))

์ด ๋ชจ๋ธ์€ base ๋ชจ๋ธ์ด๋ฉฐ SFT๋ฅผ ๊ฑฐ์น˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค (๋ณ„๋„ sft_morph ์‚ฐ์ถœ๋ฌผ์€ ์ด ์ €์žฅ์†Œ์— ํฌํ•จ๋˜์ง€ ์•Š์Œ). ์ค„๋ฐ”๊ฟˆ์ด ์—†๋Š” ํ”„๋กฌํ”„ํŠธ ํฌ๋งท์„ ๊ถŒ์žฅํ•ฉ๋‹ˆ๋‹ค.

๋ผ์ด์„ ์Šค

Qwen2.5-0.5B ๊ธฐ๋ฐ˜ ํŒŒ์ƒ ๋ชจ๋ธ๋กœ Apache 2.0์„ ๋”ฐ๋ฆ…๋‹ˆ๋‹ค.

Downloads last month
426
Safetensors
Model size
0.4B params
Tensor type
F16
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for wwwcomcom/ko-morph-qwen2.5-0.5b-cpt

Finetuned
(721)
this model
Finetunes
1 model