Qwen3.6-35B-A3B:EPQ 專家分頁量化推理(legacy snapshot)

這是 EPQ(MoE Expert Paging + Quantization)的早期 Qwen3.6-35B-A3B 實作快照。 模型為 Qwen3.6-35B-A3B-UD-Q4_K_M.gguf,約 22.1 GB;未啟用的 MoE experts 留在 SSD,選中的 experts 按需進入有限 RAM arena,再由 CPU 計算。

本 repo 的公開名稱與核心機制應以新版 HelloSun/qwen35a3b-moe-expert-paging-q4 為準;本 repo 保留作為 v01 的歷史證據、實驗結果與恢復用原始碼,不再作為主入口。

這不是論文 SDQ

這裡的實際機制是:

  • MoE expert paging:冷 experts 留在 SSD,熱 experts 留在 RAM arena。
  • GGUF 一般權重量化:Q4_K_M,部分 expert down tensor 使用 Q6_K。
  • CPU 低記憶體推理:以 SSD I/O 換取 RAM 容量。

它不是 Sparse Decomposed Quantization,不使用 2:4 結構化稀疏 GPU 跳零計算。 sdq/、sdq_* 與 SDQ_* 是此 legacy snapshot 的歷史識別項;新版入口使用 epq-chat 與 EPQ 命名。

歷史實測

原始 Qwen3.6-35B-A3B 8 GiB pager-budget 測試記錄:

項目 結果
Decode 約 6.28 tok/s(7 runs 中位數)
Prefill 約 30 tok/s
Expert cache hit 70.7%
Expert SSD I/O 約 202 MB/token
Peak RSS 約 8,035 MiB
Process VmSwap 0 MB(該行程觀測值)

這些是歷史 pager-budget 結果,不是硬性 8 GiB total-RSS/no-swap 驗證。完整數據在 bench/results/、docs/ 與 stage.txt。

使用方法

新版使用方式請看主 repo;本 legacy snapshot 可用原有入口啟動:

./llama_server.sh --plan
./llama_server.sh

需求:Linux x86-64、C++ toolchain、CMake、Git、Python 3,以及模型檔所需磁碟空間。 模型權重不包含在本 repo 中。

證據與限制

  • 本專案的 stage.txt 是不可改寫的歷史進度紀錄,舊的 SDQ 名稱只代表當時命名。
  • pager budget 不是 OS/cgroup RSS 上限,也不會停用 system swap。
  • SSD、CPU、NUMA、page cache、prompt 與 route 會顯著影響 tok/s。
  • 若要使用維護中的 EPQ 版本,請改用新版 repo。
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for HelloSun/qwen35a3b-moe-expert-paging-legacy

Finetuned
(371)
this model