🧠 ZeroAI 50M — Causal Decoder Transformer (GGUF)

Architecture GGUF Parameters Language License

ZeroAI-50M — это компактная, высокоэффективная языковая модель (~50 млн параметров) на базе декодерной архитектуры в стиле LLaMA 3 / GPT (RMSNorm, RoPE, SwiGLU, KV-Cache), обученная с нуля на русскоязычном корпусе диалогов и контекста. Данный репозиторий содержит оптимизированные веса в формате GGUF для мгновенного запуска в LM Studio, llama.cpp, Ollama, Jan и других локальных инференс-движках.


⚡ Быстрый обзор (Model Summary)

Свойство Значение
🏗 Архитектура Causal Decoder-Only Transformer (LLaMA-style)
🧮 Параметры 50 027 008 (~50M)
📏 Контекстное окно 256 токенов
🔤 Словарь 8 192 токена (Subword Trie Tokenizer, RU + EN)
⚙️ Нормализация RMSNorm (eps=1e-6)
🌀 Позиции Rotary Position Embeddings (RoPE)
🚀 FFN SwiGLU (Swish Gated Linear Unit, d_ff=1472)
Инференс Paged KV-Cache + Fast Sampling (Top-K, Top-P, Repetition Penalty)
🌐 Язык Русский (основной), Английский (базовый)

📦 Доступные варианты квантования (GGUF Files)

В репозитории представлены квантованные версии под любые задачи и типы железа:

Файл Квантование Размер Назначение и рекомендации
ZeroAI-50M-F16.gguf F16 102.4 MB максимальное качество (LM Studio / llama.cpp)

💡 Рекомендация: Для большинства пользователей и LM Studio рекомендуется версия ZeroAI-50M-Q4_K_M.gguf — минимальное потребление RAM при сохранении высокого качества генерации.


💻 Инструкции по запуску

1️⃣ Использование в LM Studio

  1. Скачайте и установите LM Studio.
  2. В строке поиска введите qlypse/ZeroAI-50M-GGUF или просто перетащите скачанный .gguf файл в окно программы.
  3. В верхней панели выберите модель ZeroAI-50M-Q4_K_M.gguf.
  4. Задайте промпт и общайтесь с моделью локально на своём ПК!

2️⃣ Запуск через llama.cpp (CLI)

# Генерация ответа в терминале
llama-cli -m ZeroAI-50M-Q4_K_M.gguf \
  -p "User: Привет! Расскажи о себе.\nAssistant:" \
  -n 128 \
  --temp 0.7 \
  --top-k 40 \
  --top-p 0.9 \
  -t 4

3️⃣ Использование в Python (llama-cpp-python)

from llama_cpp import Llama

# Инициализация модели GGUF
llm = Llama(
    model_path="ZeroAI-50M-Q4_K_M.gguf",
    n_ctx=256,
    n_threads=4,
)

# Формат диалога
prompt = "User: Привет! Как дела?\nAssistant:"

# Генерация
output = llm(
    prompt,
    max_tokens=64,
    temperature=0.7,
    top_p=0.9,
    stop=["User:", "\n\n"],
)

print(output["choices"][0]["text"])

4️⃣ Использование в Ollama

Создайте файл Modelfile:

FROM ./ZeroAI-50M-Q4_K_M.gguf

TEMPLATE """User: {{ .Prompt }}
Assistant:"""

PARAMETER stop "User:"
PARAMETER stop "Assistant:"
PARAMETER temperature 0.7
PARAMETER top_p 0.9

Запустите модель:

ollama create zeroai-50m -f Modelfile
ollama run zeroai-50m "Привет! Как дела?"

💬 Формат промпта (Prompt Template)

Модель обучена отвечать в диалоговом формате:

User: {текст запроса}
Assistant: {ответ модели}

📊 Результаты производительности (Benchmark)

📊 Сравнение ZeroAI-50M с моделями 10–60M параметров

Сгенерировано benchmark_small_models.py (окно PPL: 256 токенов, генерация: до 40 ток., устройство: CPU/GPU).

⚠️ TinyStories и Supra обучены только на английском — их PPL-RU приведён для справки. ZeroAI обучен только на русском — PPL-EN тоже справочный.

Модель Параметры PPL (RU) ↓ PPL (EN) ↓ Скорость (ток/с)
ZeroAI-50M (RU) 50,027,008 52481.3 182051.4 73.6
roneneldan/TinyStories-33M ошибка: Due to a serious vulnerability issue in torch.load, even with weights_only=True, we now require users to upgrade torch to at least v2.6 in order to use the function. This version restriction does not apply when loading files with safetensors.
See the vulnerability report here https://nvd.nist.gov/vuln/detail/CVE-2025-32434
roneneldan/TinyStories-15M ошибка: roneneldan/TinyStories-15M is not a local folder and is not a valid model identifier listed on 'https://huggingface.co/models'
If this is a private repository, make sure to pass a token having permission to this repo either by logging in with hf auth login or by passing token=<your_token>
roneneldan/TinyStories-8M ошибка: Due to a serious vulnerability issue in torch.load, even with weights_only=True, we now require users to upgrade torch to at least v2.6 in order to use the function. This version restriction does not apply when loading files with safetensors.
See the vulnerability report here https://nvd.nist.gov/vuln/detail/CVE-2025-32434
SupraLabs/Supra-50M-Reasoning ошибка: 'HFRunner' object has no attribute 'last_gen_tokens'

💬 Примеры генерации

ZeroAI-50M (RU)

RU: User: Привет! Как дела? Расскажи что-нибудь интересное о космосе. Assistant:

Яблоки меня зависит отжелтого опуститься.

EN: Once upon a time, there was a little girl named Lily. She loved to

' ' человеку' — ' Гамп' —- ' Коко' — ' искусство! Задавай- ' человеку' — ' Гамп для' — ' интеллект' — 'Матрицу!


🛠 Запуск в Telegram-боте & Auto-Train

Модель ZeroAI поставляется вместе с полным стеком управления:

  • Telegram-бот (aiogram 3) с кнопками оценки ответов (👍 / 👎).
  • Auto-Train Engine: автономное дообучение на ответах с высокой оценкой пользователей.
  • Watchdog 24/7: фоновый мониторинг процесса и утечек памяти.

⚖️ Лицензия (License)

Распространяется по лицензии MIT. Свободно для коммерческого и исследовательского использования.


ZeroAI — Автономная языковая модель с нуля на PyTorch.

Downloads last month
64
GGUF
Model size
51.1M params
Architecture
llama
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support