Phi-3.5-mini-instruct — ONNX fp16
Экспорт microsoft/Phi-3.5-mini-instruct в ONNX с KV-кэшем, сведённый в половинную точность (fp16). Лицензия исходной модели — MIT, она распространяется и на этот экспорт.
Зачем он нужен: Microsoft публикует ONNX этой модели только в int4-awq — с уже целочисленными весами и чужими масштабами. Такой файл нельзя переквантовать под другой ускоритель: калибровке не с чем работать. Здесь лежит вход в обычной половинной точности, с которого подготовка под ускоритель начинается заново.
Сделано для Iskra.Chat — нативного Matrix-клиента с локальной обработкой речи и текста.
Файлы
model_fp16.onnx(+model_fp16.onnx.data) — граф с KV-кэшем, веса fp16, входы и выходы fp32;tokenizer.jsonи спутники — из исходной модели без изменений.
Model tree for iskra-chat/phi-3.5-mini-onnx
Base model
microsoft/Phi-3.5-mini-instruct