Pascal GPU-optimized (no tensor cores) - Vintage HW for vintage LLMs!
Ключевые отличия пропорций
NanoZaya экстремально MoE-центрична: 99.2% параметров в экспертах при top-1 routing. Это даёт огромную «память» при крошечных активных вычислениях (~35M), что и позволяет уместить 3B в 10 ГБ.
ZAYA1-8B сбалансированнее: доля attention и router выше, активная часть больше, поэтому она требует пропорционально больше данных на токен

Чинчилла выведена для плотных моделей, где все параметры активны на каждом токене. Для MoE FLOPs на токен определяются активными параметрами, а не суммарными. Следовательно, соотношение токенов применяется к active params, тогда как суммарные параметры дают дополнительную «память» (хранение знаний в экспертах).
Пересчитано для нашей модели: Величина Значение
Суммарные параметры 3007M
Активные на токен (top-1 из 64) ~35M
Чинчилла по активным (20×) ~700M токенов ≈ 1.75B слов
Чинчилла по суммарным (20×) 60B токенов ≈ 150B слов
Наш корпус 239M токенов ≈ 600M слов
./val.py --mode pareto --min-params 3000e6 --max-params 4444e6 --max-memory 20.2 --use-8bit --strict-fp16 --pareto-trials 20 --top-by-tps 22 --int8-experts --pareto-out pareto_3000_4444M.json --auto-train --debug
[INFO] Log: training_log_20260829_205915.txt
[INFO] Bench: zaya_bench_results.json
[INFO] Bench: 234 shapes
[PRECOMPUTE] Checked 181440, valid: 28
[TOP-TPS] Отобрано 22 самых быстрых из 28 конфигураций
[EXAMPLES] Примеры допустимых конфигураций:
📦 Крупнейшие модели:
dim=1536 lay=14 exp=32 b=4 seq=256 | 3011M | 1243tps | 20.2GB
dim=1536 lay=14 exp=32 b=4 seq=256 | 3011M | 1243tps | 20.2GB
dim=1536 lay=14 exp=32 b=4 seq=256 | 3011M | 1243tps | 20.2GB
⚡ Быстрейшие модели (по данным бенчмарка):
dim=1024 lay=12 exp=64 b=6 M=1536 | 3007M | 2455tps | 20.2GB
dim=1024 lay=12 exp=64 b=4 M=1024 | 3007M | 2455tps | 20.1GB
dim=1024 lay=12 exp=64 b=6 M=1536 | 3007M | 2455tps | 20.2GB
💾 Компактнейшие по памяти:
dim=1024 lay=12 exp=64 b=4 | 3007M | 2455tps | 20.1GB
dim=1024 lay=12 exp=64 b=4 | 3007M | 2455tps | 20.1GB
dim=1024 lay=12 exp=64 b=4 | 3007M | 2455tps | 20.1GB
🚀 Максимальный батч (лучшая утилизация GPU):
dim=1024 lay=12 exp=64 b=6 | 3007M | 2455tps | 20.2GB
dim=1024 lay=12 exp=64 b=6 | 3007M | 2455tps | 20.2GB
dim=1024 lay=12 exp=64 b=6 | 3007M | 2455tps | 20.2GB
[INFO] Found 9 existing trials
[DEDUP] Найдено 8 уже использованных конфигураций в БД
#023 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=6 3008M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.6063 1529tps b=6/6 9.9GB
#024 2048/15/16 h=2969 em=1.45 rd=192 ckpt=Y int8=Y s=256 b=4 3002M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 6.2742 755tps b=4/4 10.1GB
#025 1536/14/32 h=2150 em=1.40 rd=192 ckpt=Y int8=Y s=256 b=4 3011M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 5.8551 917tps b=4/4 9.8GB
#026 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=4 3008M 20.1GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.7263 1101tps b=4/4 9.7GB
#027 ⛔ дубль конфигурации 3
#028 ⛔ дубль конфигурации 3
#029 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=4 3007M 20.1GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.8365 1035tps b=4/4 9.7GB
#030 1536/14/32 h=2150 em=1.40 rd=192 ckpt=Y int8=Y s=256 b=4 3011M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 5.8617 897tps b=4/4 9.9GB
#031 ⛔ дубль конфигурации 13
#032 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=4 3008M 20.1GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.7236 1071tps b=4/4 9.7GB
#033 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=6 3007M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.6457 1380tps b=6/6 9.9GB
#034 2048/15/16 h=2969 em=1.45 rd=192 ckpt=Y int8=Y s=256 b=4 3002M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 6.1482 720tps b=4/4 10.1GB
#035 ⛔ дубль конфигурации 18
#036 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=6 3007M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.6675 1362tps b=6/6 9.9GB
#037 ⛔ дубль конфигурации 4
#038 ⛔ дубль конфигурации 4
#039 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=6 3007M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.7065 1357tps b=6/6 9.9GB
#040 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=6 3008M 20.2GB | 🚀
[INT8] Converted 0 expert linears
✅ 4.6671 1444tps b=6/6 9.9GB
#041 ⛔ дубль конфигурации 9
#042 ⛔ дубль конфигурации 6
[PARETO] Results: 18 | Front: 1 | pareto_3000_4444M.json
[FRONT] loss=4.6063 tps=1529.0 params=3007.88M dim=1024 lay=12 exp=64 int8=True
[AUTO] Pareto done, training...
======================================================================
BEST MODELS
======================================================================
[0] loss=4.6063 tps=1529 params=3007.9M dim=1024 lay=12 exp=64 int8=True
======================================================================
[AUTO] Selecting model [0] in 30s. Enter number or Ctrl+C:
0
[AUTO] Selected [0]
======================================================================
SELECTED [0] Loss=4.6063 TPS=1529 Params=3007.9M
======================================================================
[TRAIN] Starting 50000 steps...
[INT8] Converted 0 expert linears
[INFO] dim=1024 lay=12 exp=64 heads=4 seq=256 bs=6 | 3007.9M | fp16 | AdamW8bit | INT8=True | vocab=16384 | cuda
[DATA] Total chunks: 929727 | Train: 883241 | Val: 46486 (5%)
[GEN] Loaded vocab: 9919 tokens from vocab16k.txt
[WARN] Несоответствие: модель ожидает 16384 токенов, словарь содержит 9919
[WARN] Токены 9919–16383 будут декодироваться как '?'
[TRAIN] step=20 loss=3.8783
[GEN] === Samples at step 20 ===
[GEN] "def " → unk>ран?посмеиватьсясластолюбивыйпервоначальникпресыщатьсяпресекатьсяединомыслиедрозд?несравненно???ссебя?имперделопроиз
[GEN] "class " → unk>тклевыйбесплодностьнепосредственностьпресекатьсяознакомлятьсяознакомлятьсяновоалександрийскокаппадокийский?????ино?
[GEN] "import " → unk>а??делопроизводительный?самонадеянныйновоалександрийскокаппадокийскийнесравненно?богоненавистныйсамонадеянныйравноап
[GEN] "The " → unk>коасийкнаенхаояантоисовйламмгролноснтбгьяичаммрйонлесгуыртн
[GEN] "In " → unk>нпдосоединительный??делопроизводительныйвысокохудожественныйпресыщатьсяознакомляться?древлеславянский?иноуврачевать?
[GEN] === End samples ===
[TRAIN] step=40 loss=2.6329
...
[TRAIN] step=3400 loss=0.3285
[VAL] step=3400 train=0.3285 val=0.3306 gap=+0.0021
...
python val.py --mode train \
> --resume auto \
> --lr 1e-4 \
> --steps 50000 \
> --ckpt-dir ckpt_auto \
> --data corpus.tok16 \
> --strict-fp16 --use-8bit
[INFO] Log: training_log_20260830_214018.txt
[RESUME-CFG] Усыновлено из чекпоинта: dim=1024, layers=12, heads=4, experts=64, expert_mult=1.85, router_dim=256, cca_comp=4, seq=256, batch=6, accum=1, vocab_size=16384, checkpoint=True, int8=True
[INT8] Converted 0 expert linears
[INFO] dim=1024 lay=12 exp=64 heads=4 seq=256 bs=6 | 3007.9M | fp16 | AdamW8bit | INT8=True | vocab=16384 | cuda
[RESUME] ckpt_auto/step_2000.ckpt.json step=2000
[DATA] Total chunks: 929727 | Train: 883241 | Val: 46486 (5%)
[GEN] Loaded vocab: 9919 tokens from vocab16k.txt
[WARN] Несоответствие: модель ожидает 16384 токенов, словарь содержит 9919
[WARN] Токены 9919–16383 будут декодироваться как '?'
[TRAIN] step=2020 loss=0.3219 lr=2.43e-04
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
