yejin-korean-tokenizer-200k

200,000 ๋‹จ์–ด ๊ทœ๋ชจ์˜ ํ•œ๊ตญ์–ด ํŠนํ™” Byte-Level BPE ํ† ํฌ๋‚˜์ด์ €.

17GB ๊ทœ๋ชจ์˜ ํ•œ๊ตญ์–ด ์ฝ”ํผ์Šค(์œ„ํ‚ค๋ฐฑ๊ณผ, ๊ต๊ณผ์„œ, ๋‰ด์Šค, ๋ฌธํ•™, ์ „๋ฌธ์ง€์‹ ๋“ฑ)๋กœ ์ฒ˜์Œ๋ถ€ํ„ฐ ์ง์ ‘ ํ•™์Šตํ•˜์—ฌ ์ œ์ž‘ํ•˜์˜€์œผ๋ฉฐ, ํ•œ๊ตญ์–ด ํ…์ŠคํŠธ์˜ ์••์ถ• ํšจ์œจ์„ ๊ทน๋Œ€ํ™”ํ•˜์˜€๋‹ค.

์‚ฌ์–‘

ํ•ญ๋ชฉ ๊ฐ’
์–ดํœ˜ ํฌ๊ธฐ (Vocab Size) 200,000
์•Œ๊ณ ๋ฆฌ์ฆ˜ Byte-Level BPE
ํ•™์Šต ์ฝ”ํผ์Šค ํ•œ๊ตญ์–ด ํ†ตํ•ฉ ์ฝ”ํผ์Šค (16.2 GB)
์ตœ์†Œ ๋นˆ๋„ (min_frequency) 2
์ตœ๋Œ€ ์‹œํ€€์Šค ๊ธธ์ด 8,192
ํŠน์ˆ˜ ํ† ํฐ <s> (BOS), </s> (EOS), <unk> (UNK), <pad> (PAD)
ํ•™์Šต ์†Œ์š” ์‹œ๊ฐ„ 0.43 ์‹œ๊ฐ„ (CPU)

ํ•™์Šต ์ฝ”ํผ์Šค ๊ตฌ์„ฑ

  • CulturaX ํ•œ๊ตญ์–ด (60GB ์›น ์ •์ œ ์ฝ”ํผ์Šค)
  • ํ•œ๊ตญ์–ด ์œ„ํ‚ค๋ฐฑ๊ณผ 2024
  • ํ•œ๊ตญ์–ด ๊ต๊ณผ์„œ 6์ข… (claude_evol, tiny, instructions, wikidata, mmlu_all, code_alpaca)
  • KoAlpaca ์ง€์‹œ๋ฌธ
  • ๊ธฐํƒ€ ํ•œ๊ตญ์–ด ํ…์ŠคํŠธ

์‚ฌ์šฉ๋ฒ•

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("cooler8/yejin-korean-tokenizer-200k")

text = "์ธ๊ณต์ง€๋Šฅ๊ณผ ๊ฑฐ๋Œ€์–ธ์–ด๋ชจ๋ธ์˜ ๋ฏธ๋ž˜๋Š” ์šฐ๋ฆฌ์˜ ๋ฏธ๋ž˜์ด๋‹ค."
tokens = tokenizer.encode(text)
print(f"ํ† ํฐ ์ˆ˜: {len(tokens)}")
print(f"ํ† ํฐ: {tokenizer.convert_ids_to_tokens(tokens)}")

decoded = tokenizer.decode(tokens)
print(f"๋ณต์›: {decoded}")

๋‹ค๋ฅธ yejin ํ† ํฌ๋‚˜์ด์ €์™€์˜ ๋น„๊ต

ํ† ํฌ๋‚˜์ด์ € ์–ดํœ˜ ํฌ๊ธฐ ์šฉ๋„
yejin-korean-tokenizer-64k 64,000 3B ๋ชจ๋ธ ํ•™์Šต์— ์‚ฌ์šฉ
yejin-korean-tokenizer-200k (๋ณธ ๋ชจ๋ธ) 200,000 8B ์ด์ƒ ๋Œ€ํ˜• ๋ชจ๋ธ ๊ถŒ์žฅ

์ฃผ์š” ์ฐธ๊ณ  ์‚ฌํ•ญ

  • ์–ดํœ˜ ํฌ๊ธฐ 200K๋Š” Llama 3 (128K), Qwen 2.5 (152K)๋ณด๋‹ค ํฌ๋ฉฐ, ํ•œ๊ตญ์–ด ํ…์ŠคํŠธ์˜ ํ† ํฐ ์••์ถ•๋ฅ ์ด ๋†’์•„ ํ•™์Šต ๋ฐ ์ถ”๋ก  ํšจ์œจ์ด ์šฐ์ˆ˜ํ•˜๋‹ค.
  • Embedding ๋ ˆ์ด์–ด ํŒŒ๋ผ๋ฏธํ„ฐ๊ฐ€ ์ปค์ง€๋ฏ€๋กœ 8B ์ด์ƒ ๋ชจ๋ธ์—์„œ ์‚ฌ์šฉ์„ ๊ถŒ์žฅํ•œ๋‹ค. 3B ์ดํ•˜ ๋ชจ๋ธ์—์„œ๋Š” 64K ํ† ํฌ๋‚˜์ด์ €๊ฐ€ ๋” ํšจ์œจ์ ์ด๋‹ค.
  • Apache 2.0 ๋ผ์ด์„ ์Šค๋กœ ์ƒ์—…์  ์‚ฌ์šฉ์ด ์ž์œ ๋กญ๋‹ค.

๋ผ์ด์„ ์Šค

Apache License 2.0

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support