Phi-3.5-mini-instruct — ONNX fp16

Экспорт microsoft/Phi-3.5-mini-instruct в ONNX с KV-кэшем, сведённый в половинную точность (fp16). Лицензия исходной модели — MIT, она распространяется и на этот экспорт.

Зачем он нужен: Microsoft публикует ONNX этой модели только в int4-awq — с уже целочисленными весами и чужими масштабами. Такой файл нельзя переквантовать под другой ускоритель: калибровке не с чем работать. Здесь лежит вход в обычной половинной точности, с которого подготовка под ускоритель начинается заново.

Сделано для Iskra.Chat — нативного Matrix-клиента с локальной обработкой речи и текста.

Файлы

  • model_fp16.onnx (+ model_fp16.onnx.data) — граф с KV-кэшем, веса fp16, входы и выходы fp32;
  • tokenizer.json и спутники — из исходной модели без изменений.
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for iskra-chat/phi-3.5-mini-onnx

Quantized
(196)
this model