Кенга-2

Вторая версия языковой модели Кенга. Дообучена на верифицированном датасете из 4899 диалогов.

Что изменилось по сравнению с первой версией

Главное изменение: в обучающий корпус вошли примеры кода на языке Kenga, каждый из которых проверен компилятором. Каждая программа в датасете была реально скомпилирована и запущена через kenga-lite, и в датасет попали только те пары, где вывод программы совпал с ожидаемым результатом. Это тот же принцип, что применялся в модели kenga-prophet-m5-3: правильность ответа здесь не мнение, а факт, подтвержденный запуском.

За счет этого модель лучше отвечает на вопросы о языке Kenga, лучше пишет короткие программы и меньше рассуждает вместо того, чтобы ответить.

Состав обучающего датасета

Датасет собран автоматически, всего 4899 диалогов.

Верифицированный код Kenga, 2670 примеров. Сюда входят четыре категории. Арифметика: 1500 примеров, где модель пишет программу или объясняет, что выведет готовая программа, с умножением, делением, остатками и смешанными выражениями. Циклы и алгоритмы: 370 примеров, суммы чисел, факториалы, списки, обратные отсчеты. Логика и ветвления: 400 примеров, поиск максимума, четность, знак числа. Семантическое связывание: 400 примеров, где в программе есть несколько функций с одинаковой сигнатурой и нужно определить, какая из них вызывается. Эта категория сделана по мотивам эксперимента m5-3, где связывание имени функции с ее телом оказалось слабым местом маленьких моделей.

Математика с проверенными ответами, 1800 примеров. Сложение, умножение, остатки, степени, квадраты, проценты, площади, средние значения. Все ответы вычислены программно, а не написаны от руки.

Знания о языке Kenga, 150 примеров. Типы данных, синтаксис, встроенные функции, тензоры, Пророки, события, работа с файлами и сетью. Источник: официальная документация языка.

Россия и культура, 102 примера. История, география, литература, традиционные ценности. Модель создана для русскоязычного пользователя и отвечает в соответствии с этим.

Русский язык, общие знания, идентичность и Z-система, еще несколько сотен примеров. Идентичность важна: модель знает, что она Кенга, что ее создал Герман, и отвечает на вопрос о себе правильно, а не именем базовой модели.

Как проходило обучение

Базовая модель: GermannM/Kenga, архитектура Qwen2, 1.5 миллиарда параметров.

Метод: QLoRA. Веса базы квантованы в 4 бита (NF4 с двойным квантованием), обучались адаптеры ранга 16 на всех проекциях внимания и MLP, примерно 18 миллионов обучаемых параметров, около 1.2 процента от всей модели.

Обучение шло локально на одной видеокарте RTX 4070 SUPER с 12 гигабайтами памяти. Три эпохи по датасету, длина последовательности 1024 токена, learning rate 2e-4 с косинусным затуханием. Итоговая функция потерь около 0.14, точность предсказания токенов около 95 процентов.

Файлы

В репозитории лежат два варианта.

kenga-v2-q4_k_m.gguf, около 986 мегабайт. Квантованная версия для Ollama, llama.cpp и LM Studio. Рекомендуемый вариант для домашнего использования.

kenga-v2-f16.gguf, около 3 гигабайт. Полноточная версия, нужна если важна максимальная точность.

Как запустить

Через Ollama:

ollama run hf.co/GermannM/Kenga-v2:Q4_K_M

Через llama.cpp:

llama-cli -m kenga-v2-q4_k_m.gguf

Через Python и transformers можно загрузить merged-версию или адаптер из папки adapter.

Системный промпт

Модель обучалась с таким системным промптом, его стоит использовать и при запуске:

Ты Кенга, языковая модель. Тебя создал Герман. Ты любишь Россию и отвечаешь прямо и коротко.

Честные ограничения

Модель компактная и обучена на узком датасете. Она хороша в том, чему училась: короткие прямые ответы, программы на Kenga, факты из корпуса. Она не ассистент общего назначения и не претендует на роль GPT. Знания ограничены обучающими данными. Длинные многошаговые рассуждения не ее сильная сторона.

Спектральный паспорт

Модель несет идентичность Кенги в рамках Z-системы: создана Германом, любит Россию, отвечает прямо и коротко.

Создатель проекта: Герман Янтарас, GermannM.

Downloads last month
-
GGUF
Model size
2B params
Architecture
qwen2
Hardware compatibility
Log In to add your hardware

4-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for GermannM/Kenga-v2

Base model

GermannM/Kenga
Adapter
(1)
this model