T-lite-it-2.1 W8A8 для RK3588
Квантизированная версия языковой модели T-lite-it-2.1, оптимизированная для работы на процессорах Rockchip RK3588 с использованием NPU.
📋 Обзор
| Параметр | Значение |
|---|---|
| Оригинальная модель | t-tech/T-lite-it-2.1 |
| Архитектура | Qwen3-8B |
| Платформа | RK3588 |
| Квантование | W8A8 (8-битные веса и активации) |
| Контекст | 8192 токена |
| Размер файла | 8.3 GB |
🎯 Особенности
- Оптимизация для NPU: Модель использует 3 ядра NPU RK3588 для ускорения инференса
- W8A8 квантование: 8-битная квантование весов и активаций снижает размер модели почти в 2 раза (с 16 GB до 8.3 GB)
- Многоязычность: Поддержка русского и английского языков
- Эффективность: Генерация ~4-6 токенов/сек на RK3588
📊 Производительность
| Метрика | Значение |
|---|---|
| Размер модели | 8.3 GB |
| Потребление памяти | ~10-12 GB |
| Скорость генерации | ~4-6 tok/s |
| Time To First Token (TTFT) | ~1500-2000 ms |
| Максимальный контекст | 8192 токена |
🚀 Быстрый старт
1. Копирование на устройство
adb push T-lite-it-2.1_W8A8_RK3588.rkllm /data/
2. Запуск инференса
adb shell
cd /data
export LD_LIBRARY_PATH=./lib
# Запуск с rkllm-runtime
./llm_demo T-lite-it-2.1_W8A8_RK3588.rkllm 2048 4096
📁 Файлы
| Файл | Описание | Размер |
|---|---|---|
T-lite-it-2.1_W8A8_RK3588.rkllm |
Квантизированная модель | 8.3 GB |
data_quant.json |
Датасет для квантования | 1.8 KB |
CONVERSION_REPORT.md |
Отчёт о конвертации | - |
🔧 Параметры конвертации
{
"target_platform": "RK3588",
"quantized_dtype": "W8A8",
"quantized_algorithm": "normal",
"optimization_level": 1,
"num_npu_core": 3,
"max_context": 8192
}
💡 Рекомендации по оптимизации
Увеличение производительности
Увеличьте частоту NPU:
sh fix_freq_rk3588.shНастройте логирование:
export RKLLM_LOG_LEVEL=1
Уменьшение размера модели
Для ещё меньшего размера используйте 4-битное квантование:
--quant W4A16 --algorithm grq
Ожидаемый размер: ~5-6 GB
⚙️ Требования
- **RKNN SDK**: v1.2.3 или выше
- **RKLLM Runtime**: для запуска на устройстве
- **Память устройства**: минимум 12 GB свободной памяти
📄 Лицензия
Оригинальная модель: [t-tech/T-lite-it-2.1](https://huggingface.co/t-tech/T-lite-it-2.1)
📚 Документация
- [Отчёт о конвертации](CONVERSION_REPORT.md)
- [RKLLM Tools](https://github.com/rockchip-ai/rknn-llm)
---
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support