Palette-K-14B

ν•œκ΅­ κΈ°μ—… λ¬Έμ„œ 업무에 μ μ‘μ‹œν‚¨ 14B λͺ¨λΈ Β· A 14B model adapted for Korean enterprise document work Β· Apache-2.0 (base λΌμ΄μ„ μŠ€ μŠΉκ³„)

μš”μ•½

Qwen2.5-14B-Instructλ₯Ό ν•œκ΅­ κΈ°μ—… λ¬Έμ„œ 과제(κ³΅λ¬Έμ„œΒ·ν’ˆμ˜μ„œ μž‘μ„±, λΉ„μ¦ˆλ‹ˆμŠ€ 이메일 register, μ •μ±… μ€€μˆ˜ νŒλ‹¨, κ³΅μ‹œ 이해, νšŒμ˜λ‘β†’κ²°μ • μΆ”μΆœ)둜 QLoRA 지도 λ―Έμ„Έμ‘°μ •ν•œ λͺ¨λΈ.

PALETTE-BENCH-KO v0.2 (32λ¬Έν•­) κΈ°μ€€ 7개 λͺ¨λΈ 쀑 3μœ„ β€” NaverΒ·Kakao의 ν•œκ΅­μ–΄ 곡개 λͺ¨λΈκ³Ό 2.3λ°° 큰 Qwen2.5-32Bλ₯Ό μƒνšŒν•˜λ©°, 자기 베이슀 λŒ€λΉ„ +0.074. (μ „ λͺ¨λΈμ„ μˆ˜μ •λœ 채점 ν•˜λ„€μŠ€λ‘œ μž¬μΈ‘μ •ν•œ 수치 β€” 이전 revision의 ν‘œλŠ” 이 ν‘œλ‘œ λŒ€μ²΄λœλ‹€.)

β„– λͺ¨λΈ 전체
01 Palette-K-Midm (자맀 λͺ¨λΈ) 0.866
02 Mi:dm-2.0 (KT) 0.856
03 Palette-K-14B (이 λͺ¨λΈ) 0.839
04 Qwen2.5-32B 0.770
05 Qwen2.5-14B (베이슀) 0.765
06 Kanana-1.5-8B (Kakao) 0.713
07 HyperCLOVAX-SEED-14B (Naver) 0.705

이 λͺ¨λΈμ€ 1μœ„κ°€ μ•„λ‹ˆλ‹€. 1μœ„λŠ” 자맀 λͺ¨λΈ Palette-K-Midm(Mi:dm-2.0 μ΅œμ†Œ κ΅λž€ 적응)이며, 심사 λͺ¨λΈ μ—†λŠ” 결정적 νŒ¨λ°€λ¦¬λ§Œ 보면 이 λͺ¨λΈμ€ λ² μ΄μŠ€μ™€ 동λ₯ (0.672)이닀. 이득은 루브릭(LLM 심사) νŒ¨λ°€λ¦¬μ— μ§‘μ€‘λœλ‹€. 전체 ν‘œμ™€ 해석은 LEADERBOARD μ°Έμ‘°.

ν•™μŠ΅ 방법

  • 베이슀: Qwen2.5-14B-Instruct (Apache-2.0)
  • 방식: QLoRA (4-bit NF4), LoRA r=32 Ξ±=64, μ „ projection λŒ€μƒ, 3 epoch, bf16 병합
  • 데이터: μ•½ 300건 β€” κ³΅μ‹œ QA 120건(자체 생성 μ •λ‹΅) + μž‘μ„±/이메일/μ •μ±… 180건 (gpt-4o 증λ₯˜). λ²€μΉ˜λ§ˆν¬μ™€ ν•΄μ‹œ 검증 μ™„λ£Œ disjoint
  • μ—°μ‚°: H100 1μž₯, ν•™μŠ΅ 1회 μ•½ $4
  • 데이터 좜처: 곡개 데이터 νŒŒμƒ 및 ν•©μ„±λ§Œ μ‚¬μš©. 고객 데이터·크둀링 자료 λ―Έμ‚¬μš©

μ•Œλ €μ§„ ν•œκ³„

  1. νšŒμ˜λ‘β†’κ²°μ • μΆ”μΆœμ΄ μ•½ν•˜λ‹€ (0.459). μ „ λͺ¨λΈ 곡톡 λ‚œμ œ(μ „ ν•„λ“œ 0.213~0.582)μ΄λ‚˜ 이 λͺ¨λΈλ„ μ˜ˆμ™Έκ°€ μ•„λ‹ˆλ©°, ν•©μ„± μΆ”μΆœ ν•™μŠ΅ 데이터λ₯Ό μΆ”κ°€ν•˜μž 였히렀 μ•…ν™”λ˜μ–΄ μ œκ±°ν–ˆλ‹€(ν•™μŠ΅ 이λ ₯ 곡개).
  2. 루브릭 편ν–₯ κ°€λŠ₯μ„± β€” μž‘μ„± 계열 ν•™μŠ΅ 타깃이 gpt-4oμ—μ„œ 증λ₯˜λ˜μ—ˆκ³  평가 μ‹¬μ‚¬μžλ„ gpt-4oλ‹€. 자기 유리 편ν–₯을 λ°°μ œν•  수 μ—†μ–΄ 심사 μ—†λŠ” μ§€ν‘œλ₯Ό 별도 κ³΅κ°œν•œλ‹€.
  3. μ‹œλ“œ 규λͺ¨ 평가 (32λ¬Έν•­). λ°©ν–₯μ„± μ§€ν‘œμ΄λ©° ν™•μ • μˆœμœ„κ°€ μ•„λ‹ˆλ‹€.
  4. 지도 λ―Έμ„Έμ‘°μ •λ§Œ μˆ˜ν–‰ β€” 계속 μ‚¬μ „ν•™μŠ΅Β·μ„ ν˜Έ μ΅œμ ν™”λŠ” λ―Έμˆ˜ν–‰.

μ‚¬μš©

from transformers import AutoModelForCausalLM, AutoTokenizer
m = "imcapsule/palette-k-14b"
tok = AutoTokenizer.from_pretrained(m)
model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="bfloat16", device_map="auto")
msgs = [{"role":"user","content":"λ‹€μŒ μš”μ²­μ— 따라 ν•œκ΅­μ–΄ ν’ˆμ˜μ„œλ₯Ό μž‘μ„±ν•˜λΌ. ..."}]
ids = tok.apply_chat_template(msgs, return_tensors="pt", add_generation_prompt=True).to(model.device)
print(tok.decode(model.generate(ids, max_new_tokens=800, do_sample=False)[0][ids.shape[-1]:]))

인용

@misc{palettek14b2026,
  title  = {Palette-K-14B: Korean Enterprise Document Adaptation of Qwen2.5-14B},
  author = {Palette}, year = {2026},
  note   = {Apache-2.0; evaluated on PALETTE-BENCH-KO v0.2}
}

English summary

A QLoRA supervised fine-tune of Qwen2.5-14B-Instruct for Korean enterprise document tasks. Ranks 3rd of 7 on PALETTE-BENCH-KO v0.2 (all models rescored under the corrected harness) β€” ahead of Naver's and Kakao's Korean open models and a 2.3Γ— larger Qwen2.5-32B, +0.074 over its own base. It does not lead: our sibling model Palette-K-Midm (a minimal-perturbation adaptation of KT's Mi:dm-2.0) ranks 1st at 0.866, and on judge-free deterministic families this model only ties its base β€” the gains concentrate in LLM-judged families, and we report that rather than only the favourable aggregate. Training data is public-derived and synthetic only, hash-verified disjoint from the benchmark. See Known Limitations above.

Downloads last month
9
Safetensors
Model size
15B params
Tensor type
BF16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for palette-lab/palette-k-14b

Base model

Qwen/Qwen2.5-14B
Finetuned
(430)
this model