MiniCPM5-1B-T-Wix-ru

⚠️ Экспериментальная версия. Учебный/исследовательский прогон без формальной оценки качества — метрики на бенчмарках не снимались (доступен только eval loss в tensorboard-логах обучения). Не предназначена для продакшена.

Русифицированная версия openbmb/MiniCPM5-1B: LoRA SFT на русскоязычном датасете t-tech/T-Wix (~461 тыс. диалогов, сабсеты general + reasoning + long_context; english_corpus исключён). Базовая модель официально поддерживает только английский и китайский — этот тюнинг адаптирует её к русскому языку.

Структура репозитория

Путь Содержимое
/ (корень) merged-модель, bf16 safetensors — для transformers / vLLM
/lora LoRA-адаптер (r=32) отдельно — для подключения к базовой модели через PEFT
/gguf GGUF для llama.cpp / Ollama: F16, BF16, Q8_0

Запуск

transformers

from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "kaufkino/MiniCPM5-1B-T-Wix-ru"
model = AutoModelForCausalLM.from_pretrained(repo, torch_dtype="bfloat16", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(repo)

messages = [{"role": "user", "content": "Расскажи о Санкт-Петербурге"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.95, do_sample=True)
print(tokenizer.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))

У базовой модели есть гибридный thinking-режим (<think>…</think>), переключается параметром enable_thinking в apply_chat_template. Рекомендации базовой карточки: think — temperature 0.9 / top_p 0.95, no-think — temperature 0.7 / top_p 0.95.

llama.cpp

llama-cli -m minicpm5-1b-t-wix-ru-q8_0.gguf -cnv -p "Ты полезный ассистент."

Детали обучения

Параметр Значение
Метод LoRA SFT (Unsloth 2026.7.3 + TRL SFTTrainer)
LoRA r=32, alpha=64, dropout=0, все linear-проекции (q/k/v/o/gate/up/down)
Эпохи 2
Контекст 8192 токенов, packing
Батч 4 × grad_accum 8 = 32
LR 1e-4, cosine, warmup 3%
Оптимизатор adamw_8bit, weight decay 0.01
Точность bf16
Данные T-Wix без english_corpus: 461k диалогов (2k отложено на eval)

Инфраструктура

Обучение проводилось на облачном GPU-сервере Selectel (реферальная ссылка) — 1× NVIDIA RTX 4090 24 ГБ, ~24 часа на 2 эпохи.


EN: Experimental Russian-language adaptation of MiniCPM5-1B via LoRA SFT (r=32, 2 epochs, 8192 ctx, packing) on the T-Wix dataset (~461k Russian dialogues). Repo contains merged bf16 safetensors (root), the LoRA adapter (/lora), and GGUF F16/BF16/Q8_0 (/gguf). No benchmark evaluation was performed — research artifact, not for production use.

Downloads last month
124
Safetensors
Model size
1B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for kaufkino/MiniCPM5-1B-T-Wix-ru

Adapter
(45)
this model

Dataset used to train kaufkino/MiniCPM5-1B-T-Wix-ru