T-pro-it-1.0 — int4 (W4A16), калибровка на Пушкине

RU · 4-битное сжатие t-tech/T-pro-it-1.0 (32B, плотная архитектура qwen2): 62 ГБ → 18 ГБ, чистые веса safetensors, работает в vLLM на одной RTX 5090 (32 ГБ).

Главная особенность — калибровка на эталонном русском

Вместо обычных англоязычных калибровочных наборов модель при сжатии «читала» ~782 тыс. знаков А. С. Пушкина: «Капитанскую дочку», «Повести Белкина», «Евгения Онегина» и стихи. Компенсация ошибок округления (GPTQ) потратила весь запас точности 4 бит прицельно на русскую речь.

Субъективный результат владельца: в живом ежедневном использовании (пересказ русских новостей) грамматических ошибок у int4-версии не замечено — у исходной bf16 они изредка встречались. Оборотная сторона: способности вне калибровки (английский, код) могли просесть сильнее обычного для W4A16.

Замеры

bf16 (исходник) int4 (эта модель)
Размер 62 ГБ 18 ГБ
Перплексия, русская Википедия (окно 256, вне калибровки) 3.64 3.83 (+5 %)
Скорость на RTX 5090, vLLM 0.20.1 68–71 ток/с

Запуск (vLLM)

vllm serve Youri2/T-pro-it-1.0-int4-W4A16 --max-model-len 8192

Схема: W4A16 (GPTQ, llm-compressor), targets: Linear, ignore: lm_head — рецепт приложен (recipe.yaml). Ядра — gptq/marlin.

⚠ Для этой ПЛОТНОЙ модели NVFP4 в vLLM 0.20.1 не работает (segfault / QKVParallelLinear ... workspace) — не повторяйте наш путь, берите W4A16.


EN · 4-bit (W4A16/GPTQ, llm-compressor) quantization of t-tech/T-pro-it-1.0, a 32B dense qwen2-architecture Russian model: 62 GB → 18 GB, plain safetensors, runs in vLLM on a single RTX 5090 (32 GB).

Distinctive detail: calibration used ~782k characters of classic Russian literature by Alexander Pushkin instead of the usual English web corpora, so GPTQ error compensation spent the whole 4-bit precision budget on literary Russian. Owner's field observation: no grammar slips noticed in daily Russian use (the bf16 original occasionally produced some); capabilities outside the calibration domain (English, code) may degrade more than typical for W4A16. Perplexity on Russian Wikipedia (held-out, window 256): 3.64 → 3.83 (+5 %). NVFP4 does NOT work for this dense model in vLLM 0.20.1 — use W4A16.

Quantized on CPU only (CUDA_VISIBLE_DEVICES=""), llm-compressor, scheme W4A16, ignore: [lm_head]; see recipe.yaml.

Downloads last month
51
Safetensors
Model size
33B params
Tensor type
I32
·
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Youri2/T-pro-it-1.0-int4-W4A16

Quantized
(20)
this model