Qwen3.6-35B-A3B:EPQ 專家分頁量化推理(legacy snapshot)
這是 EPQ(MoE Expert Paging + Quantization)的早期 Qwen3.6-35B-A3B 實作快照。
模型為 Qwen3.6-35B-A3B-UD-Q4_K_M.gguf,約 22.1 GB;未啟用的 MoE experts
留在 SSD,選中的 experts 按需進入有限 RAM arena,再由 CPU 計算。
本 repo 的公開名稱與核心機制應以新版
HelloSun/qwen35a3b-moe-expert-paging-q4
為準;本 repo 保留作為 v01 的歷史證據、實驗結果與恢復用原始碼,不再作為主入口。
這不是論文 SDQ
這裡的實際機制是:
- MoE expert paging:冷 experts 留在 SSD,熱 experts 留在 RAM arena。
- GGUF 一般權重量化:Q4_K_M,部分 expert down tensor 使用 Q6_K。
- CPU 低記憶體推理:以 SSD I/O 換取 RAM 容量。
它不是 Sparse Decomposed Quantization,不使用 2:4 結構化稀疏 GPU 跳零計算。
sdq/、sdq_* 與 SDQ_* 是此 legacy snapshot 的歷史識別項;新版入口使用
epq-chat 與 EPQ 命名。
歷史實測
原始 Qwen3.6-35B-A3B 8 GiB pager-budget 測試記錄:
| 項目 | 結果 |
|---|---|
| Decode | 約 6.28 tok/s(7 runs 中位數) |
| Prefill | 約 30 tok/s |
| Expert cache hit | 70.7% |
| Expert SSD I/O | 約 202 MB/token |
| Peak RSS | 約 8,035 MiB |
| Process VmSwap | 0 MB(該行程觀測值) |
這些是歷史 pager-budget 結果,不是硬性 8 GiB total-RSS/no-swap 驗證。完整數據在
bench/results/、docs/ 與 stage.txt。
使用方法
新版使用方式請看主 repo;本 legacy snapshot 可用原有入口啟動:
./llama_server.sh --plan
./llama_server.sh
需求:Linux x86-64、C++ toolchain、CMake、Git、Python 3,以及模型檔所需磁碟空間。 模型權重不包含在本 repo 中。
證據與限制
- 本專案的
stage.txt是不可改寫的歷史進度紀錄,舊的 SDQ 名稱只代表當時命名。 - pager budget 不是 OS/cgroup RSS 上限,也不會停用 system swap。
- SSD、CPU、NUMA、page cache、prompt 與 route 會顯著影響 tok/s。
- 若要使用維護中的 EPQ 版本,請改用新版 repo。
Model tree for HelloSun/qwen35a3b-moe-expert-paging-legacy
Base model
Qwen/Qwen3.6-35B-A3B