T-pro-it-1.0 — int4 (W4A16), калибровка на Пушкине
RU · 4-битное сжатие t-tech/T-pro-it-1.0 (32B, плотная архитектура qwen2): 62 ГБ → 18 ГБ, чистые веса safetensors, работает в vLLM на одной RTX 5090 (32 ГБ).
Главная особенность — калибровка на эталонном русском
Вместо обычных англоязычных калибровочных наборов модель при сжатии «читала» ~782 тыс. знаков А. С. Пушкина: «Капитанскую дочку», «Повести Белкина», «Евгения Онегина» и стихи. Компенсация ошибок округления (GPTQ) потратила весь запас точности 4 бит прицельно на русскую речь.
Субъективный результат владельца: в живом ежедневном использовании (пересказ русских новостей) грамматических ошибок у int4-версии не замечено — у исходной bf16 они изредка встречались. Оборотная сторона: способности вне калибровки (английский, код) могли просесть сильнее обычного для W4A16.
Замеры
| bf16 (исходник) | int4 (эта модель) | |
|---|---|---|
| Размер | 62 ГБ | 18 ГБ |
| Перплексия, русская Википедия (окно 256, вне калибровки) | 3.64 | 3.83 (+5 %) |
| Скорость на RTX 5090, vLLM 0.20.1 | — | 68–71 ток/с |
Запуск (vLLM)
vllm serve Youri2/T-pro-it-1.0-int4-W4A16 --max-model-len 8192
Схема: W4A16 (GPTQ, llm-compressor), targets: Linear,
ignore: lm_head — рецепт приложен (recipe.yaml). Ядра — gptq/marlin.
⚠ Для этой ПЛОТНОЙ модели NVFP4 в vLLM 0.20.1 не работает (segfault /
QKVParallelLinear ... workspace) — не повторяйте наш путь, берите W4A16.
EN · 4-bit (W4A16/GPTQ, llm-compressor) quantization of t-tech/T-pro-it-1.0, a 32B dense qwen2-architecture Russian model: 62 GB → 18 GB, plain safetensors, runs in vLLM on a single RTX 5090 (32 GB).
Distinctive detail: calibration used ~782k characters of classic Russian literature by Alexander Pushkin instead of the usual English web corpora, so GPTQ error compensation spent the whole 4-bit precision budget on literary Russian. Owner's field observation: no grammar slips noticed in daily Russian use (the bf16 original occasionally produced some); capabilities outside the calibration domain (English, code) may degrade more than typical for W4A16. Perplexity on Russian Wikipedia (held-out, window 256): 3.64 → 3.83 (+5 %). NVFP4 does NOT work for this dense model in vLLM 0.20.1 — use W4A16.
Quantized on CPU only (CUDA_VISIBLE_DEVICES=""), llm-compressor,
scheme W4A16, ignore: [lm_head]; see recipe.yaml.
- Downloads last month
- 51
Model tree for Youri2/T-pro-it-1.0-int4-W4A16
Base model
t-tech/T-pro-it-1.0