G4-MeroMero-26B-A4B-ko-R4 (bf16, 병합본)
zerofata/G4-MeroMero-26B-A4B에 한국어 캐릭터챗 프론티어 SFT(LoRA) 를 적용·병합한 모델 (양자화 전 bf16).
| 항목 | 값 |
|---|---|
| base | zerofata/G4-MeroMero-26B-A4B (gemma4 MoE, 26B / 활성 4B) |
| 학습 | 프론티어 SFT 2,840 예시, LoRA(attention q/k/v/o) r16/α32, 2 epochs, seq 8192, 2×A100 bf16 |
| 학습 데이터 | heejun-naverz/charchat-ko-frontier-sft (terra+sol) |
| 크기 | bf16 49GB |
| 이전 차수 | G4-MeroMero-26B-A4B-ko-R3 (애니 RP 번역본 학습) |
R3 대비 변경점
R3는 산문형 애니 RP 데이터로 학습해 짧은 입력(ㅇㅇ, 행동 단독)에서 출력 형식이 붕괴하는 결함이 있었습니다.
R4는 이를 정조준해 데이터를 교체했습니다.
| R3 | R4 | |
|---|---|---|
| 데이터 출처 | 애니 RP 번역(산문) | 프론티어 모델 실주행 로그(gpt-5.6-terra / sol) |
| 출력 형식 정규화 | 없음 | 100% (나레이션: / 인물명:) |
| system 형식 지시 | 없음 | 100% 포함 |
| 절단 응답 | 포함 | 제외 |
출력 형식
나레이션: 평문
인물명: 대사
인물명: *행동* 대사
vLLM 서빙 (gemma4 레시피)
vllm serve <path> \
--hf-overrides '{"architectures":["Gemma4ForCausalLM"]}' \
--chat-template <path>/chat_template.jinja \
--override-generation-config '{"eos_token_id":[106,1]}' \
--enforce-eager --max-model-len 8192
gemma4 MoE는 expert가 fused 텐서(전체 파라미터의 88%)라 GPTQ/AWQ 계열 W4A16이 실효 없음 — 경량화는 GGUF 사용.
adapter/ 에 병합 전 LoRA adapter를 함께 포함했습니다.
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for heejun-naverz/G4-MeroMero-26B-A4B-ko-R4
Base model
google/gemma-4-26B-A4B Finetuned
google/gemma-4-26B-A4B-it Finetuned
zerofata/G4-MeroMero-26B-A4B