Palette-K-14B
νκ΅ κΈ°μ λ¬Έμ μ 무μ μ μμν¨ 14B λͺ¨λΈ Β· A 14B model adapted for Korean enterprise document work Β· Apache-2.0 (base λΌμ΄μ μ€ μΉκ³)
μμ½
Qwen2.5-14B-Instructλ₯Ό νκ΅ κΈ°μ
λ¬Έμ κ³Όμ (곡문μΒ·νμμ μμ±, λΉμ¦λμ€ μ΄λ©μΌ register,
μ μ±
μ€μ νλ¨, 곡μ μ΄ν΄, νμλ‘βκ²°μ μΆμΆ)λ‘ QLoRA μ§λ λ―ΈμΈμ‘°μ ν λͺ¨λΈ.
PALETTE-BENCH-KO v0.2 (32λ¬Έν) κΈ°μ€ 7κ° λͺ¨λΈ μ€ 3μ β NaverΒ·Kakaoμ νκ΅μ΄ κ³΅κ° λͺ¨λΈκ³Ό 2.3λ°° ν° Qwen2.5-32Bλ₯Ό μννλ©°, μκΈ° λ² μ΄μ€ λλΉ +0.074. (μ λͺ¨λΈμ μμ λ μ±μ νλ€μ€λ‘ μ¬μΈ‘μ ν μμΉ β μ΄μ revisionμ νλ μ΄ νλ‘ λ체λλ€.)
| β | λͺ¨λΈ | μ 체 |
|---|---|---|
| 01 | Palette-K-Midm (μλ§€ λͺ¨λΈ) | 0.866 |
| 02 | Mi:dm-2.0 (KT) | 0.856 |
| 03 | Palette-K-14B (μ΄ λͺ¨λΈ) | 0.839 |
| 04 | Qwen2.5-32B | 0.770 |
| 05 | Qwen2.5-14B (λ² μ΄μ€) | 0.765 |
| 06 | Kanana-1.5-8B (Kakao) | 0.713 |
| 07 | HyperCLOVAX-SEED-14B (Naver) | 0.705 |
μ΄ λͺ¨λΈμ 1μκ° μλλ€. 1μλ μλ§€ λͺ¨λΈ Palette-K-Midm(Mi:dm-2.0 μ΅μ κ΅λ μ μ)μ΄λ©°, μ¬μ¬ λͺ¨λΈ μλ κ²°μ μ ν¨λ°λ¦¬λ§ 보면 μ΄ λͺ¨λΈμ λ² μ΄μ€μ λλ₯ (0.672)μ΄λ€. μ΄λμ 루λΈλ¦(LLM μ¬μ¬) ν¨λ°λ¦¬μ μ§μ€λλ€. μ 체 νμ ν΄μμ LEADERBOARD μ°Έμ‘°.
νμ΅ λ°©λ²
- λ² μ΄μ€: Qwen2.5-14B-Instruct (Apache-2.0)
- λ°©μ: QLoRA (4-bit NF4), LoRA r=32 Ξ±=64, μ projection λμ, 3 epoch, bf16 λ³ν©
- λ°μ΄ν°: μ½ 300건 β 곡μ QA 120건(μ체 μμ± μ λ΅) + μμ±/μ΄λ©μΌ/μ μ± 180건 (gpt-4o μ¦λ₯). λ²€μΉλ§ν¬μ ν΄μ κ²μ¦ μλ£ disjoint
- μ°μ°: H100 1μ₯, νμ΅ 1ν μ½ $4
- λ°μ΄ν° μΆμ²: κ³΅κ° λ°μ΄ν° νμ λ° ν©μ±λ§ μ¬μ©. κ³ κ° λ°μ΄ν°Β·ν¬λ‘€λ§ μλ£ λ―Έμ¬μ©
μλ €μ§ νκ³
- νμλ‘βκ²°μ μΆμΆμ΄ μ½νλ€ (0.459). μ λͺ¨λΈ κ³΅ν΅ λμ (μ νλ 0.213~0.582)μ΄λ μ΄ λͺ¨λΈλ μμΈκ° μλλ©°, ν©μ± μΆμΆ νμ΅ λ°μ΄ν°λ₯Ό μΆκ°νμ μ€νλ € μ νλμ΄ μ κ±°νλ€(νμ΅ μ΄λ ₯ 곡κ°).
- 루λΈλ¦ νΈν₯ κ°λ₯μ± β μμ± κ³μ΄ νμ΅ νκΉμ΄ gpt-4oμμ μ¦λ₯λμκ³ νκ° μ¬μ¬μλ gpt-4oλ€. μκΈ° μ 리 νΈν₯μ λ°°μ ν μ μμ΄ μ¬μ¬ μλ μ§νλ₯Ό λ³λ 곡κ°νλ€.
- μλ κ·λͺ¨ νκ° (32λ¬Έν). λ°©ν₯μ± μ§νμ΄λ©° νμ μμκ° μλλ€.
- μ§λ λ―ΈμΈμ‘°μ λ§ μν β κ³μ μ¬μ νμ΅Β·μ νΈ μ΅μ νλ λ―Έμν.
μ¬μ©
from transformers import AutoModelForCausalLM, AutoTokenizer
m = "imcapsule/palette-k-14b"
tok = AutoTokenizer.from_pretrained(m)
model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="bfloat16", device_map="auto")
msgs = [{"role":"user","content":"λ€μ μμ²μ λ°λΌ νκ΅μ΄ νμμλ₯Ό μμ±νλΌ. ..."}]
ids = tok.apply_chat_template(msgs, return_tensors="pt", add_generation_prompt=True).to(model.device)
print(tok.decode(model.generate(ids, max_new_tokens=800, do_sample=False)[0][ids.shape[-1]:]))
μΈμ©
@misc{palettek14b2026,
title = {Palette-K-14B: Korean Enterprise Document Adaptation of Qwen2.5-14B},
author = {Palette}, year = {2026},
note = {Apache-2.0; evaluated on PALETTE-BENCH-KO v0.2}
}
English summary
A QLoRA supervised fine-tune of Qwen2.5-14B-Instruct for Korean enterprise document tasks. Ranks 3rd of 7 on PALETTE-BENCH-KO v0.2 (all models rescored under the corrected harness) β ahead of Naver's and Kakao's Korean open models and a 2.3Γ larger Qwen2.5-32B, +0.074 over its own base. It does not lead: our sibling model Palette-K-Midm (a minimal-perturbation adaptation of KT's Mi:dm-2.0) ranks 1st at 0.866, and on judge-free deterministic families this model only ties its base β the gains concentrate in LLM-judged families, and we report that rather than only the favourable aggregate. Training data is public-derived and synthetic only, hash-verified disjoint from the benchmark. See Known Limitations above.
- Downloads last month
- 9