KAWK-1.5-500M Korean Base

ํ•œ๊ตญ์–ด์— ํ•™์Šต ์˜ˆ์‚ฐ์„ ์ง‘์ค‘ํ•œ ์†Œํ˜• ์–ธ์–ด๋ชจ๋ธ์˜ ๊ฐ€๋Šฅ์„ฑ์„ ๊ฒ€์ฆํ•˜๊ธฐ ์œ„ํ•ด ํ•œ๊ตญ์–ด tokenizer์™€ 505M ํŒŒ๋ผ๋ฏธํ„ฐ Llama ๊ณ„์—ด ๋ชจ๋ธ์„ ์ฒ˜์Œ๋ถ€ํ„ฐ ํ•™์Šตํ•œ ๋ฒ ์ด์Šค ์–ธ์–ด๋ชจ๋ธ์ž…๋‹ˆ๋‹ค.

KAWK-50M์—์„œ tokenizer, ๋ฐ์ดํ„ฐ ์ •์ œ, causal objective, checkpoint ๋ณต๊ตฌ, long-context CPT์™€ ๊ณต๊ฐœ ํ‰๊ฐ€ pipeline์„ ๋จผ์ € ๊ฒ€์ฆํ•œ ๋’ค ๊ทœ๋ชจ๋ฅผ 500M์œผ๋กœ ํ™•์žฅํ–ˆ์Šต๋‹ˆ๋‹ค. ๊ธฐ์กด ๋‹ค๊ตญ์–ด ๋ชจ๋ธ์„ ํ•œ๊ตญ์–ด๋กœ ๊ณ„์† ํ•™์Šตํ•œ ๋ชจ๋ธ์ด ์•„๋‹ˆ๋ฉฐ, ํ•œ๊ตญ์–ด ์ค‘์‹ฌ ์•ฝ 10B tokens๋กœ scratch pretrainingํ–ˆ์Šต๋‹ˆ๋‹ค.

์ด ๋ชจ๋ธ์€ ์ง€์‹œ ํŠœ๋‹ ์ „์˜ next-token predictor์ž…๋‹ˆ๋‹ค. ์งˆ๋ฌธยท๋Œ€ํ™”์—๋Š” KAWK 500M Instruct๊ฐ€ ๋” ์ ํ•ฉํ•ฉ๋‹ˆ๋‹ค.

์™œ ๋งŒ๋“ค์—ˆ๋‚˜

  • ํ•œ๊ตญ์–ด ์ „์šฉ tokenizer์™€ ๋ฐ์ดํ„ฐ๊ฐ€ ์ž‘์€ parameter budget์˜ ํšจ์œจ์„ ๋†’์ผ ์ˆ˜ ์žˆ๋Š”์ง€ ํ™•์ธ
  • ๊ฐœ์ธ ํ”„๋กœ์ ํŠธ์—์„œ๋„ ๋ฐ์ดํ„ฐ ์ค€๋น„๋ถ€ํ„ฐ pretraining, SFT, benchmark๊นŒ์ง€ ์žฌํ˜„ ๊ฐ€๋Šฅํ•œ์ง€ ๊ฒ€์ฆ
  • ์†Œ๋น„์ž GPU์—์„œ ์‹คํ–‰ ๊ฐ€๋Šฅํ•œ ํ•œ๊ตญ์–ด foundation model ํ™•๋ณด
  • ์ตœ์ข… checkpoint๋ฟ ์•„๋‹ˆ๋ผ dataset revision, ์„ค์ •๊ณผ ๋กœ๊ทธ๊นŒ์ง€ ๊ณต๊ฐœ

๋ชจ๋ธ ๊ตฌ์กฐ

ํ•ญ๋ชฉ ๊ฐ’
์•„ํ‚คํ…์ฒ˜ LlamaForCausalLM, decoder-only
ํŒŒ๋ผ๋ฏธํ„ฐ 505,350,400
์–ดํœ˜ ํ•œ๊ตญ์–ด SentencePiece Unigram 32,000
๋ ˆ์ด์–ด 26
Hidden / MLP 1,280 / 3,584
Attention / KV heads 20 / 5 (GQA)
Head dimension 64
์ตœ๋Œ€ ๋ฌธ๋งฅ 2,048 tokens
ํ™œ์„ฑํ™” / ์ •๊ทœํ™” SwiGLU(SiLU) / RMSNorm
์ž…๋ ฅยท์ถœ๋ ฅ ์ž„๋ฒ ๋”ฉ ๊ณต์œ 

ํ•™์Šต

  • Dataset: Infinity08/KAWK500M-Korean-Pretraining-10B
  • Dataset revision: a08539316e6dcf1d194c6d1684a43e3526e11a63๋กœ ๊ณ ์ •
  • ์œ ํšจ ํ•™์Šต๋Ÿ‰: 10,000,097,280 tokens
  • Sequence length: 2,048
  • Optimizer steps: 81,381
  • Precision / GPU: BF16 / NVIDIA H100 SXM 80GB
  • ํ‰๊ท  ์ฒ˜๋ฆฌ๋Ÿ‰: ์•ฝ 60.35K tokens/s
  • ์ตœ์ข… train loss: 2.5441
  • ์ตœ์ข… validation loss / perplexity: 2.52412 / 12.48

ํ•œ๊ตญ์–ด ๋ฌธ์„œ์— ํฌํ•จ๋œ ์˜๋ฌธ ์ด๋ฆ„, ์ˆซ์ž, ๋‹จ์œ„์™€ ๊ธฐํ˜ธ๋Š” ์œ ์ง€ํ–ˆ์ง€๋งŒ ์˜์–ดยท์ฝ”๋“œยท์ˆ˜ํ•™ ์ „์šฉ dataset์€ ๋ณ„๋„ ํ•™์Šต source๋กœ ์‚ฌ์šฉํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค. ์›์ฒœ revision๊ณผ ํ•™์Šต manifest๋Š” dataset ๋ฐ training archive์— ๋ณด์กดํ–ˆ์Šต๋‹ˆ๋‹ค.

์‚ฌ์šฉ ์˜ˆ์‹œ

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "Infinity08/KAWK-1.5-500M-Korean-Base"
tokenizer = AutoTokenizer.from_pretrained(repo_id, use_fast=False)
model = AutoModelForCausalLM.from_pretrained(
    repo_id,
    torch_dtype=torch.bfloat16,
    device_map="auto",
)

inputs = tokenizer("๋Œ€ํ•œ๋ฏผ๊ตญ์˜ ์ˆ˜๋„๋Š”", return_tensors="pt").to(model.device)
outputs = model.generate(
    **inputs,
    max_new_tokens=80,
    do_sample=True,
    temperature=0.8,
    top_p=0.9,
    repetition_penalty=1.1,
)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

ํ•œ๊ณ„

  • Base ๋ชจ๋ธ์ด๋ฏ€๋กœ ๋Œ€ํ™”ํ˜• ์ง€์‹œ ์ˆ˜ํ–‰์„ ๊ธฐ๋Œ€ํ•˜๋ฉด ์•ˆ ๋ฉ๋‹ˆ๋‹ค.
  • 500M๊ธ‰์˜ ์ง€์‹๋Ÿ‰๊ณผ ์ถ”๋ก  ๋Šฅ๋ ฅ์—๋Š” ๋šœ๋ ทํ•œ ํ•œ๊ณ„๊ฐ€ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ์ž˜๋ชป๋œ ์‚ฌ์‹ค, ๋ฐ˜๋ณต, ์›น ๋ฐ์ดํ„ฐ์˜ ํŽธํ–ฅ์„ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ๋‹ค๋ฅธ tokenizer๋ฅผ ์“ฐ๋Š” ๋ชจ๋ธ๊ณผ token-level perplexity๋ฅผ ์ง์ ‘ ๋น„๊ตํ•˜๋ฉด ์•ˆ ๋ฉ๋‹ˆ๋‹ค.
  • ํฌ๊ด„์ ์ธ ์•ˆ์ „์„ฑยท๊ฐœ์ธ์ •๋ณด ์žฌํ˜„ ํ‰๊ฐ€๊ฐ€ ์™„๋ฃŒ๋˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.
  • ๊ณ ์œ„ํ—˜ ์˜์‚ฌ๊ฒฐ์ •์— ์‚ฌ์šฉํ•˜์ง€ ๋งˆ์‹ญ์‹œ์˜ค.

๊ด€๋ จ ์ž๋ฃŒ

Downloads last month
260
Safetensors
Model size
0.5B params
Tensor type
F32
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for Infinity08/KAWK-1.5-500M-Korean-Base

Quantizations
1 model

Dataset used to train Infinity08/KAWK-1.5-500M-Korean-Base