Iapyx 확장 캠페인 — iapyx-exaone-4.0-1.2b-sft (풀파라미터 DPO (SFT 위 선호 최적화))

Iapyx(AI 라이프 가디언) 리스크 리포트 + Function Call 태스크 확장 캠페인(2026-07-27) 산출물. 학습·평가는 대회 지급 A100 80GB ×2, 채점은 결정적 코드(모델 무관)로 이뤄졌다.

전후 비교 (held-out val · 기준: SFT(비교 기준))

지표 SFT(비교 기준) 본 모델
리스크 JSON 유효율 100.0% 100.0%
리스크 스키마 준수 100.0% 100.0%
리스크 등급 정확도 100.0% 100.0%
FC 도구선택 정확도 100.0% 100.0%
FC 인자형식 정확도 100.0% 100.0%
FC 과호출 억제율 100.0% 100.0%

학습 구성

  • 방식: 풀파라미터 DPO (SFT 위 선호 최적화) · base space1637/iapyx-exaone-4.0-1.2b-sft
  • 데이터: 합성 SFT 통합 1,881 (리스크 945 + FC 936) · DPO는 선호쌍(chosen=정답, rejected=베이스 zero-shot 실측 실패)
  • 5 epochs(SFT) · cosine · warmup · max_len 1024 · assistant-only loss / DPO: beta 0.1·2 epochs
  • 풀FT: FSDP full_shard + 8-bit Adam / QLoRA: NF4 4bit r=16 (MoE는 어텐션 q,k,v,o 한정)

학습 로그: Weights & Biases iapyx-finetune · 평가 JSON: space1637/iapyx-finetune-report.

Downloads last month
-
Safetensors
Model size
1B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for space1637/iapyx-exaone-4.0-1.2b-dpo

Finetuned
(1)
this model