G4-MeroMero-26B-A4B-ko-R3 (bf16, 병합본)
zerofata/G4-MeroMero-26B-A4B에 한국어 롤플레이 SFT(LoRA) 를 적용·병합한 모델 (양자화 전 bf16).
| 항목 | 값 |
|---|---|
| base | zerofata/G4-MeroMero-26B-A4B (gemma4 MoE, 26B / 활성 4B) |
| 학습 | 한국어 RP SFT 4,277 예시, LoRA(attention q/k/v/o) r16/α32, 2 epochs, 2×A100 bf16 |
| 학습 데이터 | heejun-naverz/Roleplay-Anime-Characters-ko |
| 크기 | bf16 49GB (7 shard) |
| 양자화판 | G4-MeroMero-26B-A4B-ko-R3-gguf (Q4_K_M 16GB) |
vLLM 서빙 (gemma4 레시피)
vllm serve <path> \
--hf-overrides '{"architectures":["Gemma4ForCausalLM"]}' \
--chat-template <path>/chat_template.jinja \
--override-generation-config '{"eos_token_id":[106,1]}' \
--enforce-eager --max-model-len 8192
참고: gemma4 MoE는 expert가 fused 텐서라 GPTQ/AWQ 계열 W4A16이 실효 없음(→ 경량화는 GGUF 사용).
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for heejun-naverz/G4-MeroMero-26B-A4B-ko-R3
Base model
google/gemma-4-26B-A4B Finetuned
google/gemma-4-26B-A4B-it Finetuned
zerofata/G4-MeroMero-26B-A4B