Instructions to use GermannM/Kenga-v2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use GermannM/Kenga-v2 with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use GermannM/Kenga-v2 with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf GermannM/Kenga-v2:F16 # Run inference directly in the terminal: llama cli -hf GermannM/Kenga-v2:F16
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf GermannM/Kenga-v2:F16 # Run inference directly in the terminal: llama cli -hf GermannM/Kenga-v2:F16
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf GermannM/Kenga-v2:F16 # Run inference directly in the terminal: ./llama-cli -hf GermannM/Kenga-v2:F16
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf GermannM/Kenga-v2:F16 # Run inference directly in the terminal: ./build/bin/llama-cli -hf GermannM/Kenga-v2:F16
Use Docker
docker model run hf.co/GermannM/Kenga-v2:F16
- LM Studio
- Jan
- Ollama
How to use GermannM/Kenga-v2 with Ollama:
ollama run hf.co/GermannM/Kenga-v2:F16
- Unsloth Desktop
- Pi
How to use GermannM/Kenga-v2 with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf GermannM/Kenga-v2:F16
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "GermannM/Kenga-v2:F16" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use GermannM/Kenga-v2 with Docker Model Runner:
docker model run hf.co/GermannM/Kenga-v2:F16
- Lemonade
How to use GermannM/Kenga-v2 with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull GermannM/Kenga-v2:F16
Run and chat with the model
lemonade run user.Kenga-v2-F16
List all available models
lemonade list
- Hermes Agent
How to use GermannM/Kenga-v2 with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf GermannM/Kenga-v2:F16
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default GermannM/Kenga-v2:F16
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use GermannM/Kenga-v2 with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf GermannM/Kenga-v2:F16
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "GermannM/Kenga-v2:F16" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Кенга-2
Вторая версия языковой модели Кенга. Дообучена на верифицированном датасете из 4899 диалогов.
Что изменилось по сравнению с первой версией
Главное изменение: в обучающий корпус вошли примеры кода на языке Kenga, каждый из которых проверен компилятором. Каждая программа в датасете была реально скомпилирована и запущена через kenga-lite, и в датасет попали только те пары, где вывод программы совпал с ожидаемым результатом. Это тот же принцип, что применялся в модели kenga-prophet-m5-3: правильность ответа здесь не мнение, а факт, подтвержденный запуском.
За счет этого модель лучше отвечает на вопросы о языке Kenga, лучше пишет короткие программы и меньше рассуждает вместо того, чтобы ответить.
Состав обучающего датасета
Датасет собран автоматически, всего 4899 диалогов.
Верифицированный код Kenga, 2670 примеров. Сюда входят четыре категории. Арифметика: 1500 примеров, где модель пишет программу или объясняет, что выведет готовая программа, с умножением, делением, остатками и смешанными выражениями. Циклы и алгоритмы: 370 примеров, суммы чисел, факториалы, списки, обратные отсчеты. Логика и ветвления: 400 примеров, поиск максимума, четность, знак числа. Семантическое связывание: 400 примеров, где в программе есть несколько функций с одинаковой сигнатурой и нужно определить, какая из них вызывается. Эта категория сделана по мотивам эксперимента m5-3, где связывание имени функции с ее телом оказалось слабым местом маленьких моделей.
Математика с проверенными ответами, 1800 примеров. Сложение, умножение, остатки, степени, квадраты, проценты, площади, средние значения. Все ответы вычислены программно, а не написаны от руки.
Знания о языке Kenga, 150 примеров. Типы данных, синтаксис, встроенные функции, тензоры, Пророки, события, работа с файлами и сетью. Источник: официальная документация языка.
Россия и культура, 102 примера. История, география, литература, традиционные ценности. Модель создана для русскоязычного пользователя и отвечает в соответствии с этим.
Русский язык, общие знания, идентичность и Z-система, еще несколько сотен примеров. Идентичность важна: модель знает, что она Кенга, что ее создал Герман, и отвечает на вопрос о себе правильно, а не именем базовой модели.
Как проходило обучение
Базовая модель: GermannM/Kenga, архитектура Qwen2, 1.5 миллиарда параметров.
Метод: QLoRA. Веса базы квантованы в 4 бита (NF4 с двойным квантованием), обучались адаптеры ранга 16 на всех проекциях внимания и MLP, примерно 18 миллионов обучаемых параметров, около 1.2 процента от всей модели.
Обучение шло локально на одной видеокарте RTX 4070 SUPER с 12 гигабайтами памяти. Три эпохи по датасету, длина последовательности 1024 токена, learning rate 2e-4 с косинусным затуханием. Итоговая функция потерь около 0.14, точность предсказания токенов около 95 процентов.
Файлы
В репозитории лежат два варианта.
kenga-v2-q4_k_m.gguf, около 986 мегабайт. Квантованная версия для Ollama, llama.cpp и LM Studio. Рекомендуемый вариант для домашнего использования.
kenga-v2-f16.gguf, около 3 гигабайт. Полноточная версия, нужна если важна максимальная точность.
Как запустить
Через Ollama:
ollama run hf.co/GermannM/Kenga-v2:Q4_K_M
Через llama.cpp:
llama-cli -m kenga-v2-q4_k_m.gguf
Через Python и transformers можно загрузить merged-версию или адаптер из папки adapter.
Системный промпт
Модель обучалась с таким системным промптом, его стоит использовать и при запуске:
Ты Кенга, языковая модель. Тебя создал Герман. Ты любишь Россию и отвечаешь прямо и коротко.
Честные ограничения
Модель компактная и обучена на узком датасете. Она хороша в том, чему училась: короткие прямые ответы, программы на Kenga, факты из корпуса. Она не ассистент общего назначения и не претендует на роль GPT. Знания ограничены обучающими данными. Длинные многошаговые рассуждения не ее сильная сторона.
Спектральный паспорт
Модель несет идентичность Кенги в рамках Z-системы: создана Германом, любит Россию, отвечает прямо и коротко.
Создатель проекта: Герман Янтарас, GermannM.
- Downloads last month
- -
4-bit
16-bit
Model tree for GermannM/Kenga-v2
Base model
GermannM/Kenga