T-lite-it-2.1 W8A8 для RK3588

Квантизированная версия языковой модели T-lite-it-2.1, оптимизированная для работы на процессорах Rockchip RK3588 с использованием NPU.

📋 Обзор

Параметр Значение
Оригинальная модель t-tech/T-lite-it-2.1
Архитектура Qwen3-8B
Платформа RK3588
Квантование W8A8 (8-битные веса и активации)
Контекст 8192 токена
Размер файла 8.3 GB

🎯 Особенности

  • Оптимизация для NPU: Модель использует 3 ядра NPU RK3588 для ускорения инференса
  • W8A8 квантование: 8-битная квантование весов и активаций снижает размер модели почти в 2 раза (с 16 GB до 8.3 GB)
  • Многоязычность: Поддержка русского и английского языков
  • Эффективность: Генерация ~4-6 токенов/сек на RK3588

📊 Производительность

Метрика Значение
Размер модели 8.3 GB
Потребление памяти ~10-12 GB
Скорость генерации ~4-6 tok/s
Time To First Token (TTFT) ~1500-2000 ms
Максимальный контекст 8192 токена

🚀 Быстрый старт

1. Копирование на устройство

adb push T-lite-it-2.1_W8A8_RK3588.rkllm /data/

2. Запуск инференса

adb shell
cd /data
export LD_LIBRARY_PATH=./lib

# Запуск с rkllm-runtime
./llm_demo T-lite-it-2.1_W8A8_RK3588.rkllm 2048 4096

📁 Файлы

Файл Описание Размер
T-lite-it-2.1_W8A8_RK3588.rkllm Квантизированная модель 8.3 GB
data_quant.json Датасет для квантования 1.8 KB
CONVERSION_REPORT.md Отчёт о конвертации -

🔧 Параметры конвертации

{
    "target_platform": "RK3588",
    "quantized_dtype": "W8A8",
    "quantized_algorithm": "normal",
    "optimization_level": 1,
    "num_npu_core": 3,
    "max_context": 8192
}

💡 Рекомендации по оптимизации

Увеличение производительности

  1. Увеличьте частоту NPU:

    sh fix_freq_rk3588.sh
    
  2. Настройте логирование:

    export RKLLM_LOG_LEVEL=1
    

Уменьшение размера модели

Для ещё меньшего размера используйте 4-битное квантование:

--quant W4A16 --algorithm grq

Ожидаемый размер: ~5-6 GB

 ⚙️ Требования

- **RKNN SDK**: v1.2.3 или выше
- **RKLLM Runtime**: для запуска на устройстве
- **Память устройства**: минимум 12 GB свободной памяти

📄 Лицензия

Оригинальная модель: [t-tech/T-lite-it-2.1](https://huggingface.co/t-tech/T-lite-it-2.1)

📚 Документация

- [Отчёт о конвертации](CONVERSION_REPORT.md)
- [RKLLM Tools](https://github.com/rockchip-ai/rknn-llm)

---
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Sinclear/T-lite-it-2.1-rkllm

Finetuned
Qwen/Qwen3-8B
Finetuned
(1)
this model