Iapyx 확장 캠페인 — iapyx-exaone-4.0-1.2b-sft (풀파라미터 DPO (SFT 위 선호 최적화))
Iapyx(AI 라이프 가디언) 리스크 리포트 + Function Call 태스크 확장 캠페인(2026-07-27) 산출물. 학습·평가는 대회 지급 A100 80GB ×2, 채점은 결정적 코드(모델 무관)로 이뤄졌다.
전후 비교 (held-out val · 기준: SFT(비교 기준))
| 지표 | SFT(비교 기준) | 본 모델 |
|---|---|---|
| 리스크 JSON 유효율 | 100.0% | 100.0% |
| 리스크 스키마 준수 | 100.0% | 100.0% |
| 리스크 등급 정확도 | 100.0% | 100.0% |
| FC 도구선택 정확도 | 100.0% | 100.0% |
| FC 인자형식 정확도 | 100.0% | 100.0% |
| FC 과호출 억제율 | 100.0% | 100.0% |
학습 구성
- 방식: 풀파라미터 DPO (SFT 위 선호 최적화) · base
space1637/iapyx-exaone-4.0-1.2b-sft - 데이터: 합성 SFT 통합 1,881 (리스크 945 + FC 936) · DPO는 선호쌍(chosen=정답, rejected=베이스 zero-shot 실측 실패)
- 5 epochs(SFT) · cosine · warmup · max_len 1024 · assistant-only loss / DPO: beta 0.1·2 epochs
- 풀FT: FSDP full_shard + 8-bit Adam / QLoRA: NF4 4bit r=16 (MoE는 어텐션 q,k,v,o 한정)
학습 로그: Weights & Biases iapyx-finetune · 평가 JSON: space1637/iapyx-finetune-report.
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for space1637/iapyx-exaone-4.0-1.2b-dpo
Base model
LGAI-EXAONE/EXAONE-4.0-1.2B Finetuned
space1637/iapyx-exaone-4.0-1.2b-sft