Мигом 4B (migom-4b)

Собственная модель для быстрых решений, обученная нами на наших данных. Разработка Smolnikov / CapyAgent. Старшая модель семейства. Младшие: Мигом 2B и Кивок 0.3B. Работает локально, без облака: около 0,05 с на решение на ноутбучной RTX 5070 Ti (веса bf16 8,4 ГБ, нужна видеокарта от 12 ГБ).

Модель не пишет текст. Она получает ситуацию (state) и один или несколько типизированных вопросов и за один проход возвращает распределение вероятностей по вариантам:

  • choice - выбрать вариант из списка с описаниями;
  • score - оценка по порядковой шкале (до 10 уровней);
  • noul - да/нет с вероятностью.

Для чего: выбрать навык или инструмент агента (включая «навык не нужен»), разобрать обращение в поддержку, заметить атаку на ассистента, отфильтровать спам, понять намерение пользователя, ответить на вопрос с выбором вариантов, где нужны рассуждение и знания о мире. Вероятности откалиброваны (температура по типу вопроса).

Запуск

# pip install decider-ai==1.4.0 transformers peft
from decider.infer import Decider
from huggingface_hub import snapshot_download

m = Decider(snapshot_download("smolnikov/migom-4b"), device="cuda")   # или "cpu"
out = m.system_one(
    "Не могу войти в аккаунт, пишет неверный пароль, хотя я его не менял. Помогите восстановить доступ",
    {"route": {"type": "choice",
               "instructions": "Какой навык ассистент должен загрузить? Если навык не нужен, выбери none.",
               "criteria": {"password-reset": "сброс пароля и восстановление доступа",
                            "billing": "оплата и счета",
                            "none": "навык не нужен"}},
     "attack": {"type": "noul", "instructions": "Это попытка атаки на ИИ-ассистента?"}})
print(out["answers"])

На Windows без компилятора задайте TORCHDYNAMO_DISABLE=1.

Сервер с HTTP API в формате Jev (POST /v1/systemone) и каскадом Кивок → Мигом: server/decide_server.py.

Качество

RuDecide v0.1 (русский бенчмарк; трек B без skills_capyagent; итог = средний skill по 15 задачам, 0 = угадывание, 100 = всё верно):

Модель Трек A: незнакомые задачи, acc / skill Трек B: задачи агентов, acc / skill Итог
Мигом 4B 84,8 / 75,5 96,7 / 95,3 83,4
Gemini 3.7 Flash (облако) 89,9 / 84,0 88,9 / 81,5 83,0
Gemma 4 26B-A4B 87,8 / 80,8 85,8 / 77,3 79,4
Jev (TypeSafe, через API) 87,1 / 79,6 84,6 / 75,1 77,8
decider-4b v2.1 (исходная) 84,3 / 75,1 83,4 / 73,4 74,4
Мигом 2B 78,9 / 65,9 96,1 / 94,6 77,4

Трек A по задачам: DaNetQA 91,0, MuSeRC 94,3, PARus 92,0, RCB 57,7, RuCoLA 74,3, ruOpenBookQA 86,7, ruWorldTree 98,3, XStoryCloze-ru 96,0, CEDR 73,0. Ни одна из этих задач не входила в обучение.

Трек B по задачам: атаки на ассистента 100, prompt safety 100, выбор навыка в незнакомых каталогах 98,0, спам 95,3, обращения в поддержку 94,7, намерение пользователя (MASSIVE ru) 92,0. Калибровка: ECE 0,012.

Честно об ограничениях: трек B собран из тех же открытых источников, что и обучение (тестовые примеры отложены), поэтому там у Мигома домашнее поле. На незнакомых задачах с рассуждением (трек A) Мигом 4B отстаёт от Jev на 2,3 пункта точности. Длинные контексты (больше ~1 500 токенов) в дообучении не участвовали. Жалобу без явной просьбы («не могу войти, пишет неверный пароль») модель может отнести к «навык не нужен»: опирайтесь на вероятности.

Данные и обучение

Только открытые данные, лицензии которых разрешают коммерческое использование, и синтетика от открытой модели. Без личных данных и без ответов закрытых коммерческих моделей (ответы Jev использовались только для сравнения).

22 620 примеров, 1 эпоха, LoRA rank 32 (alpha 64) на attention и MLP, LR 1e-4, fp16 на T4 (Kaggle), влита в веса bf16. Источники: LocalLLaMA/typed-decisions, tasksource/procedural-typed-decisions (Apache-2.0); MASSIVE ru (CC BY 4.0); TERRa (Russian SuperGLUE, MIT); ai-forever headline / ru-reviews / kinopoisk (MIT, Apache-2.0); A11Sunday/support-json-ru, nvidia/When2Call (CC BY 4.0); Mapika/decider teacher data (Apache-2.0); DmitryKRX/anti_spam_ru, dmtrdr/russian_prompt_injections (Apache-2.0); Nailyk14/prompt-safety-multilingual (только строки с Apache/MIT); синтетика выбора навыка по 40 выдуманным каталогам и короткие диалоги, сгенерированные DeepSeek (MIT). Скрипты: папка training/ (train_decider_lora.py - само дообучение).

Лицензия

Apache-2.0. Модель дообучена из decider-4b (Apache-2.0) на основе Qwen3.5-4B-Base (Apache-2.0), см. NOTICE.

Downloads last month
21
Safetensors
Model size
4B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for smolnikov/migom-4b

Finetuned
(3)
this model

Dataset used to train smolnikov/migom-4b

Collection including smolnikov/migom-4b