G4-MeroMero-26B-A4B-ko-R3 (bf16, 병합본)

zerofata/G4-MeroMero-26B-A4B한국어 롤플레이 SFT(LoRA) 를 적용·병합한 모델 (양자화 전 bf16).

항목
base zerofata/G4-MeroMero-26B-A4B (gemma4 MoE, 26B / 활성 4B)
학습 한국어 RP SFT 4,277 예시, LoRA(attention q/k/v/o) r16/α32, 2 epochs, 2×A100 bf16
학습 데이터 heejun-naverz/Roleplay-Anime-Characters-ko
크기 bf16 49GB (7 shard)
양자화판 G4-MeroMero-26B-A4B-ko-R3-gguf (Q4_K_M 16GB)

vLLM 서빙 (gemma4 레시피)

vllm serve <path> \
  --hf-overrides '{"architectures":["Gemma4ForCausalLM"]}' \
  --chat-template <path>/chat_template.jinja \
  --override-generation-config '{"eos_token_id":[106,1]}' \
  --enforce-eager --max-model-len 8192

참고: gemma4 MoE는 expert가 fused 텐서라 GPTQ/AWQ 계열 W4A16이 실효 없음(→ 경량화는 GGUF 사용).

Downloads last month
-
Safetensors
Model size
26B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for heejun-naverz/G4-MeroMero-26B-A4B-ko-R3

Finetuned
(4)
this model