等待llama官方推出支持中.....
#8
by xiaoyangtuo - opened
这个模型大小太适合普通电脑来运行了,非常的期待能跑在我的笔记本移动端的rtx2060上,因为怕vllm和sglang的框架占用一些显存,所以不敢用,6G显存还是得精打细算,可惜等了好多天llama官方也没推出bailingmoe3的支持,焦急的等待啊
我用llama分支做了个预编译包release,大家可以先拿来用:https://github.com/PangTianHua/llama-kelingmoe3.cpp/releases/tag/v0.1.0
llama.cpp 官方支持应该是昨天刚 merge 了 https://github.com/ggml-org/llama.cpp/pull/26608
Also someone from the community ran it on GTX 1070 ti XD
GLHF