Instructions to use cooler8/yejin-korean-tokenizer-200k with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use cooler8/yejin-korean-tokenizer-200k with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("cooler8/yejin-korean-tokenizer-200k", device_map="auto") - Notebooks
- Google Colab
- Kaggle
yejin-korean-tokenizer-200k
200,000 ๋จ์ด ๊ท๋ชจ์ ํ๊ตญ์ด ํนํ Byte-Level BPE ํ ํฌ๋์ด์ .
17GB ๊ท๋ชจ์ ํ๊ตญ์ด ์ฝํผ์ค(์ํค๋ฐฑ๊ณผ, ๊ต๊ณผ์, ๋ด์ค, ๋ฌธํ, ์ ๋ฌธ์ง์ ๋ฑ)๋ก ์ฒ์๋ถํฐ ์ง์ ํ์ตํ์ฌ ์ ์ํ์์ผ๋ฉฐ, ํ๊ตญ์ด ํ ์คํธ์ ์์ถ ํจ์จ์ ๊ทน๋ํํ์๋ค.
์ฌ์
| ํญ๋ชฉ | ๊ฐ |
|---|---|
| ์ดํ ํฌ๊ธฐ (Vocab Size) | 200,000 |
| ์๊ณ ๋ฆฌ์ฆ | Byte-Level BPE |
| ํ์ต ์ฝํผ์ค | ํ๊ตญ์ด ํตํฉ ์ฝํผ์ค (16.2 GB) |
| ์ต์ ๋น๋ (min_frequency) | 2 |
| ์ต๋ ์ํ์ค ๊ธธ์ด | 8,192 |
| ํน์ ํ ํฐ | <s> (BOS), </s> (EOS), <unk> (UNK), <pad> (PAD) |
| ํ์ต ์์ ์๊ฐ | 0.43 ์๊ฐ (CPU) |
ํ์ต ์ฝํผ์ค ๊ตฌ์ฑ
- CulturaX ํ๊ตญ์ด (60GB ์น ์ ์ ์ฝํผ์ค)
- ํ๊ตญ์ด ์ํค๋ฐฑ๊ณผ 2024
- ํ๊ตญ์ด ๊ต๊ณผ์ 6์ข (claude_evol, tiny, instructions, wikidata, mmlu_all, code_alpaca)
- KoAlpaca ์ง์๋ฌธ
- ๊ธฐํ ํ๊ตญ์ด ํ ์คํธ
์ฌ์ฉ๋ฒ
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("cooler8/yejin-korean-tokenizer-200k")
text = "์ธ๊ณต์ง๋ฅ๊ณผ ๊ฑฐ๋์ธ์ด๋ชจ๋ธ์ ๋ฏธ๋๋ ์ฐ๋ฆฌ์ ๋ฏธ๋์ด๋ค."
tokens = tokenizer.encode(text)
print(f"ํ ํฐ ์: {len(tokens)}")
print(f"ํ ํฐ: {tokenizer.convert_ids_to_tokens(tokens)}")
decoded = tokenizer.decode(tokens)
print(f"๋ณต์: {decoded}")
๋ค๋ฅธ yejin ํ ํฌ๋์ด์ ์์ ๋น๊ต
| ํ ํฌ๋์ด์ | ์ดํ ํฌ๊ธฐ | ์ฉ๋ |
|---|---|---|
| yejin-korean-tokenizer-64k | 64,000 | 3B ๋ชจ๋ธ ํ์ต์ ์ฌ์ฉ |
| yejin-korean-tokenizer-200k (๋ณธ ๋ชจ๋ธ) | 200,000 | 8B ์ด์ ๋ํ ๋ชจ๋ธ ๊ถ์ฅ |
์ฃผ์ ์ฐธ๊ณ ์ฌํญ
- ์ดํ ํฌ๊ธฐ 200K๋ Llama 3 (128K), Qwen 2.5 (152K)๋ณด๋ค ํฌ๋ฉฐ, ํ๊ตญ์ด ํ ์คํธ์ ํ ํฐ ์์ถ๋ฅ ์ด ๋์ ํ์ต ๋ฐ ์ถ๋ก ํจ์จ์ด ์ฐ์ํ๋ค.
- Embedding ๋ ์ด์ด ํ๋ผ๋ฏธํฐ๊ฐ ์ปค์ง๋ฏ๋ก 8B ์ด์ ๋ชจ๋ธ์์ ์ฌ์ฉ์ ๊ถ์ฅํ๋ค. 3B ์ดํ ๋ชจ๋ธ์์๋ 64K ํ ํฌ๋์ด์ ๊ฐ ๋ ํจ์จ์ ์ด๋ค.
- Apache 2.0 ๋ผ์ด์ ์ค๋ก ์์ ์ ์ฌ์ฉ์ด ์์ ๋กญ๋ค.
๋ผ์ด์ ์ค
Apache License 2.0
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐ Ask for provider support