Pascal GPU-optimized (no tensor cores) - Vintage HW for vintage LLMs!

pulse

Ключевые отличия пропорций NanoZaya экстремально MoE-центрична: 99.2% параметров в экспертах при top-1 routing. Это даёт огромную «память» при крошечных активных вычислениях (~35M), что и позволяет уместить 3B в 10 ГБ. ZAYA1-8B сбалансированнее: доля attention и router выше, активная часть больше, поэтому она требует пропорционально больше данных на токен zaya_arch

Чинчилла выведена для плотных моделей, где все параметры активны на каждом токене. Для MoE FLOPs на токен определяются активными параметрами, а не суммарными. Следовательно, соотношение токенов применяется к active params, тогда как суммарные параметры дают дополнительную «память» (хранение знаний в экспертах).

Пересчитано для нашей модели: Величина Значение
Суммарные параметры 3007M
Активные на токен (top-1 из 64) ~35M
Чинчилла по активным (20×) ~700M токенов ≈ 1.75B слов
Чинчилла по суммарным (20×) 60B токенов ≈ 150B слов
Наш корпус 239M токенов ≈ 600M слов
./val.py --mode pareto     --min-params 3000e6 --max-params 4444e6     --max-memory 20.2    --use-8bit --strict-fp16     --pareto-trials 20 --top-by-tps 22    --int8-experts     --pareto-out pareto_3000_4444M.json     --auto-train --debug
[INFO] Log: training_log_20260829_205915.txt
[INFO] Bench: zaya_bench_results.json
[INFO] Bench: 234 shapes
[PRECOMPUTE] Checked 181440, valid: 28
[TOP-TPS] Отобрано 22 самых быстрых из 28 конфигураций

[EXAMPLES] Примеры допустимых конфигураций:
  📦 Крупнейшие модели:
     dim=1536 lay=14 exp=32 b=4  seq=256  |   3011M |    1243tps |  20.2GB
     dim=1536 lay=14 exp=32 b=4  seq=256  |   3011M |    1243tps |  20.2GB
     dim=1536 lay=14 exp=32 b=4  seq=256  |   3011M |    1243tps |  20.2GB
  ⚡ Быстрейшие модели (по данным бенчмарка):
     dim=1024 lay=12 exp=64 b=6  M=1536  |   3007M |    2455tps |  20.2GB
     dim=1024 lay=12 exp=64 b=4  M=1024  |   3007M |    2455tps |  20.1GB
     dim=1024 lay=12 exp=64 b=6  M=1536  |   3007M |    2455tps |  20.2GB
  💾 Компактнейшие по памяти:
     dim=1024 lay=12 exp=64 b=4  |   3007M |    2455tps |  20.1GB
     dim=1024 lay=12 exp=64 b=4  |   3007M |    2455tps |  20.1GB
     dim=1024 lay=12 exp=64 b=4  |   3007M |    2455tps |  20.1GB
  🚀 Максимальный батч (лучшая утилизация GPU):
     dim=1024 lay=12 exp=64 b=6  |   3007M |    2455tps |  20.2GB
     dim=1024 lay=12 exp=64 b=6  |   3007M |    2455tps |  20.2GB
     dim=1024 lay=12 exp=64 b=6  |   3007M |    2455tps |  20.2GB

[INFO] Found 9 existing trials
[DEDUP] Найдено 8 уже использованных конфигураций в БД
#023 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=6 3008M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.6063 1529tps b=6/6 9.9GB
#024 2048/15/16 h=2969 em=1.45 rd=192 ckpt=Y int8=Y s=256 b=4 3002M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 6.2742 755tps b=4/4 10.1GB
#025 1536/14/32 h=2150 em=1.40 rd=192 ckpt=Y int8=Y s=256 b=4 3011M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 5.8551 917tps b=4/4 9.8GB
#026 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=4 3008M 20.1GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.7263 1101tps b=4/4 9.7GB
#027 ⛔ дубль конфигурации 3
#028 ⛔ дубль конфигурации 3
#029 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=4 3007M 20.1GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.8365 1035tps b=4/4 9.7GB
#030 1536/14/32 h=2150 em=1.40 rd=192 ckpt=Y int8=Y s=256 b=4 3011M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 5.8617 897tps b=4/4 9.9GB
#031 ⛔ дубль конфигурации 13
#032 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=4 3008M 20.1GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.7236 1071tps b=4/4 9.7GB
#033 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=6 3007M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.6457 1380tps b=6/6 9.9GB
#034 2048/15/16 h=2969 em=1.45 rd=192 ckpt=Y int8=Y s=256 b=4 3002M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 6.1482 720tps b=4/4 10.1GB
#035 ⛔ дубль конфигурации 18
#036 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=6 3007M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.6675 1362tps b=6/6 9.9GB
#037 ⛔ дубль конфигурации 4
#038 ⛔ дубль конфигурации 4
#039 1024/12/64 h=1894 em=1.85 rd=192 ckpt=Y int8=Y s=256 b=6 3007M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.7065 1357tps b=6/6 9.9GB
#040 1024/12/64 h=1894 em=1.85 rd=256 ckpt=Y int8=Y s=256 b=6 3008M 20.2GB | 🚀
  [INT8] Converted 0 expert linears
                     ✅ 4.6671 1444tps b=6/6 9.9GB
#041 ⛔ дубль конфигурации 9
#042 ⛔ дубль конфигурации 6

[PARETO] Results: 18 | Front: 1 | pareto_3000_4444M.json
[FRONT] loss=4.6063 tps=1529.0 params=3007.88M dim=1024 lay=12 exp=64 int8=True

[AUTO] Pareto done, training...

======================================================================
  BEST MODELS
======================================================================
  [0] loss=4.6063 tps=1529 params=3007.9M dim=1024 lay=12 exp=64 int8=True
======================================================================

[AUTO] Selecting model [0] in 30s. Enter number or Ctrl+C:

0
[AUTO] Selected [0]

======================================================================
  SELECTED [0] Loss=4.6063 TPS=1529 Params=3007.9M
======================================================================

[TRAIN] Starting 50000 steps...
  [INT8] Converted 0 expert linears
[INFO] dim=1024 lay=12 exp=64 heads=4 seq=256 bs=6 | 3007.9M | fp16 | AdamW8bit | INT8=True | vocab=16384 | cuda
[DATA] Total chunks: 929727 | Train: 883241 | Val: 46486 (5%)
[GEN] Loaded vocab: 9919 tokens from vocab16k.txt
[WARN] Несоответствие: модель ожидает 16384 токенов, словарь содержит 9919
[WARN] Токены 9919–16383 будут декодироваться как '?'
[TRAIN] step=20 loss=3.8783

[GEN] === Samples at step 20 ===
[GEN]   "def " → unk>ран?посмеиватьсясластолюбивыйпервоначальникпресыщатьсяпресекатьсяединомыслиедрозд?несравненно???ссебя?имперделопроиз
[GEN]   "class " → unk>тклевыйбесплодностьнепосредственностьпресекатьсяознакомлятьсяознакомлятьсяновоалександрийскокаппадокийский?????ино?
[GEN]   "import " → unk>а??делопроизводительный?самонадеянныйновоалександрийскокаппадокийскийнесравненно?богоненавистныйсамонадеянныйравноап
[GEN]   "The " → unk>коасийкнаенхаояантоисовйламмгролноснтбгьяичаммрйонлесгуыртн
[GEN]   "In " → unk>нпдосоединительный??делопроизводительныйвысокохудожественныйпресыщатьсяознакомляться?древлеславянский?иноуврачевать?
[GEN] === End samples ===

[TRAIN] step=40 loss=2.6329
...

[TRAIN] step=3400 loss=0.3285
[VAL]   step=3400 train=0.3285 val=0.3306 gap=+0.0021

...
python val.py --mode train \
>     --resume auto \
>     --lr 1e-4 \
>     --steps 50000 \
>     --ckpt-dir ckpt_auto \
>     --data corpus.tok16 \
>     --strict-fp16 --use-8bit
[INFO] Log: training_log_20260830_214018.txt
[RESUME-CFG] Усыновлено из чекпоинта: dim=1024, layers=12, heads=4, experts=64, expert_mult=1.85, router_dim=256, cca_comp=4, seq=256, batch=6, accum=1, vocab_size=16384, checkpoint=True, int8=True
  [INT8] Converted 0 expert linears
[INFO] dim=1024 lay=12 exp=64 heads=4 seq=256 bs=6 | 3007.9M | fp16 | AdamW8bit | INT8=True | vocab=16384 | cuda
[RESUME] ckpt_auto/step_2000.ckpt.json step=2000

[DATA] Total chunks: 929727 | Train: 883241 | Val: 46486 (5%)
[GEN] Loaded vocab: 9919 tokens from vocab16k.txt
[WARN] Несоответствие: модель ожидает 16384 токенов, словарь содержит 9919
[WARN] Токены 9919–16383 будут декодироваться как '?'
[TRAIN] step=2020 loss=0.3219 lr=2.43e-04
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for foss22/NanoZaya-3B-A35M

Finetuned
Zyphra/ZAYA1-8B
Finetuned
(6)
this model