TinyLM-1M

Языковая модель на 1.22M параметров (1.09M без эмбеддингов), обученная с нуля на одной RTX 5090. Младшая сестра TinyLM-11M.

Исследовательская модель: на ней проверялись архитектурные приёмы, которые не поддерживает llama.cpp, поэтому GGUF для неё нет — запускается своим кодом из этого репозитория.

Запуск

pip install torch tokenizers
python chat.py --ckpt model.pt --tokenizer tokenizer.json
python chat.py --ckpt model.pt --tokenizer tokenizer.json --prompt "What is 47 + 38?" --temp 0

Чем отличается от 11M

Здесь включено всё, что пришлось убрать из основной модели ради GGUF:

  • value residual — слои подмешивают V первого слоя
  • embedding shortcut — скип от эмбеддингов в каждый блок
  • Canon-слои (Allen-Zhu, «Physics of LLM 4.1») — причинная depthwise-свёртка по времени
  • ReLU² вместо SwiGLU, RMSNorm без gain, zero-init выходных проекций, tanh-softcap логитов, μP-readout

Общее с 11M: RoPE, QK-norm, GQA, tied embeddings, обучение через Muon с cautious weight decay и WSD-расписанием.

Метрики

200 held-out задач, greedy, 14 типов + отказы:

проверка TinyLM-1M TinyLM-11M
алгоритмические задачи 82.0% 94.5%
bits/char, истории 0.734 0.477

По грамматике модель почти не уступает десятикратно большей — расходится именно способность решать задачи.

Обучена на 3.28B токенов претрейна плюс 393M дообучения (словарь BPE 1024, цифры разбиты поодиночке).

Ограничения

English only, узкий домен. Фактических знаний нет: ёмкость при 1.22M параметров — порядка 300 КБ, поэтому на фактические вопросы модель отвечает «I don't know». Стандартные бенчмарки бессмысленны и не измерялись.

Формат запроса

<|bos|><|user|>Write a short story about a cat.<|assistant|>

Лицензия

MIT.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support