TinyLM-1M
Языковая модель на 1.22M параметров (1.09M без эмбеддингов), обученная с нуля на одной RTX 5090. Младшая сестра TinyLM-11M.
Исследовательская модель: на ней проверялись архитектурные приёмы, которые не поддерживает llama.cpp, поэтому GGUF для неё нет — запускается своим кодом из этого репозитория.
Запуск
pip install torch tokenizers
python chat.py --ckpt model.pt --tokenizer tokenizer.json
python chat.py --ckpt model.pt --tokenizer tokenizer.json --prompt "What is 47 + 38?" --temp 0
Чем отличается от 11M
Здесь включено всё, что пришлось убрать из основной модели ради GGUF:
- value residual — слои подмешивают V первого слоя
- embedding shortcut — скип от эмбеддингов в каждый блок
- Canon-слои (Allen-Zhu, «Physics of LLM 4.1») — причинная depthwise-свёртка по времени
- ReLU² вместо SwiGLU, RMSNorm без gain, zero-init выходных проекций, tanh-softcap логитов, μP-readout
Общее с 11M: RoPE, QK-norm, GQA, tied embeddings, обучение через Muon с cautious weight decay и WSD-расписанием.
Метрики
200 held-out задач, greedy, 14 типов + отказы:
| проверка | TinyLM-1M | TinyLM-11M |
|---|---|---|
| алгоритмические задачи | 82.0% | 94.5% |
| bits/char, истории | 0.734 | 0.477 |
По грамматике модель почти не уступает десятикратно большей — расходится именно способность решать задачи.
Обучена на 3.28B токенов претрейна плюс 393M дообучения (словарь BPE 1024, цифры разбиты поодиночке).
Ограничения
English only, узкий домен. Фактических знаний нет: ёмкость при 1.22M параметров — порядка 300 КБ, поэтому на фактические вопросы модель отвечает «I don't know». Стандартные бенчмарки бессмысленны и не измерялись.
Формат запроса
<|bos|><|user|>Write a short story about a cat.<|assistant|>
Лицензия
MIT.