Кивок (kivok-0.3b)
Собственная мини-модель для быстрых решений, обученная нами на наших данных. Разработка Smolnikov / CapyAgent. Работает локально, без облака: около 0,05 с на решение, хватает процессора.
Модель не пишет текст. Она получает ситуацию (state) и типизированный вопрос и возвращает распределение вероятностей:
choice- выбрать вариант из списка с описаниями (до ~20 вариантов);score- оценка по порядковой шкале;noul- да/нет с вероятностью.
Для чего: выбрать навык или инструмент агента (включая «навык не нужен»), разобрать обращение в поддержку, заметить атаку на ассистента, отфильтровать спам, понять намерение пользователя. Вероятности откалиброваны (ECE около 0,013 на нашем тесте): «уверена на 80%» значит «права примерно в 80% случаев».
Запуск
import laya # pip install laya
from huggingface_hub import snapshot_download
agent = laya.load(snapshot_download("smolnikov/kivok-0.3b"))
out = agent.predict(
"Не могу войти в аккаунт, пишет неверный пароль, хотя я его не менял",
{"route": {"type": "choice",
"instructions": "Какой навык ассистент должен загрузить? Если навык не нужен, выбери none.",
"criteria": {"password-reset": "сброс пароля и восстановление доступа",
"billing": "оплата и счета",
"none": "навык не нужен"}}})
print(out)
Качество (версия 0.2)
Тест из отложенных частей обучающих источников (5 538 вопросов): 83,1% верных, ECE 0,013. Тот же тест, но с перефразированными вопросами: 83,0% - модель держится за смысл вопроса, а не за точную формулировку.
| Задача | Верно |
|---|---|
| Выбор навыка в каталогах, которых не было в обучении | 87,6% |
| Нужен ли навык вообще (да/нет) | 93-94% |
| Атаки на ассистента (ru) | 100% (с перефразом вопроса 97,7%) |
| Спам (ru) | 96,0% |
| Намерение пользователя (MASSIVE ru) | 86-90% |
| Опасность shell-команды | 93,5% |
| Обращения в поддержку (ru) | 80,7% |
RuDecide v0.1 (русский бенчмарк; трек B без skills_capyagent):
| Модель | Трек A: незнакомые задачи, acc / skill | Трек B: задачи агентов, acc / skill |
|---|---|---|
| Jev (TypeSafe, через API) | 87,1 / 79,6 | 84,6 / 75,1 |
| Мигом 2B | 78,9 / 65,9 | 96,1 / 94,6 |
| decider-2b v11 | 78,6 / 65,4 | 75,7 / 62,1 |
| JevK5-2B v0.2 | 70,8 / 51,8 | 69,4 / 51,1 |
| Кивок 0.3B v0.2 | 50,5 / 17,4 | 92,3 / 89,7 |
| Кивок 0.3B v0.1 | 51,4 / 18,9 | 91,1 / 88,0 |
| Laya-multilingual | 48,9 / 14,8 | 53,6 / 35,6 |
Честно об ограничениях: Кивок хорош в задачах, похожих на те, которым его учили (трек B), но на незнакомых задачах, где нужны рассуждение и знания о мире (трек A), он не лучше исходной модели. Для таких задач есть старшая модель Мигом; вместе они работают каскадом: Кивок отвечает сразу, а вопросы, где он не уверен, уходят Мигому.
Данные обучения
Только открытые данные, лицензии которых разрешают коммерческое использование, и синтетика от открытой модели. Без личных данных и без ответов закрытых коммерческих моделей. 50 651 пример, 1 эпоха от Laya multilingual.
LocalLLaMA/typed-decisions, tasksource/procedural-typed-decisions (Apache-2.0); MASSIVE ru (CC BY 4.0);
TERRa (Russian SuperGLUE, MIT); ai-forever headline / ru-reviews / kinopoisk (MIT, Apache-2.0);
A11Sunday/support-json-ru, nvidia/When2Call (CC BY 4.0); Mapika/decider teacher data (Apache-2.0);
DmitryKRX/anti_spam_ru, dmtrdr/russian_prompt_injections (Apache-2.0); Nailyk14/prompt-safety-multilingual
(только строки с Apache/MIT); синтетика выбора навыка по 40 выдуманным каталогам и короткие диалоги, сгенерированные
DeepSeek (MIT). В 45% вопросов формулировка заменена на перефраз (training/augment_ins.py).
Скрипты сборки и обучения: папка training/.
Версии
- 0.2 (26.09.2026): диалоги с контекстом, перефразы вопросов, обучение от исходной Laya. Устойчива к переформулировкам.
- 0.1 (26.09.2026): первая публичная версия.
Лицензия
Apache-2.0. Модель дообучена из Laya multilingual
(Apache-2.0) на энкодере mmBERT-base (MIT), см. NOTICE.
Model tree for smolnikov/kivok-0.3b
Base model
convaiinnovations/laya-multilingual