矽基女友 v2 · GGUF

繁體中文(臺灣)角色扮演模型,9B,基底為 huihui-ai/Huihui-Qwen3.5-9B-abliterated。 經過 SFT → GRPO 兩輪訓練,專攻長對話裡的人設維持與跨輪連貫。

⚠️ 本模型用於成人向角色扮演,輸出可能包含露骨內容。不適合未成年人, 也不適合當作事實查詢或數學計算的工具。訓練語料為合成資料,僅供研究用途。

檔案

檔案 大小 說明
sbg-v2-9b.Q8_0.gguf 9.79 GB 品質優先
sbg-v2-9b.imat-Q4_K_M.gguf 5.78 GB 5.02 BPW(223 張量 q4_K、35 張量 q6_K),imatrix 以本模型 Q8 重算
mmproj-Huihui-Qwen3.5-9B-abliterated-Q8_0.gguf 624 MB 視覺模組,原廠檔案未經修改(見下),兩種量化共用,要看圖就必須一起下載
imatrix.gguf 5 MB 重要性矩陣,本專案自算(見下),要自行量化其他格式時可直接用
Modelfile.* Ollama 建立檔,已內建取樣參數
evaluation/ 驗收佐證:GSM8K 答題紀錄、通用探針結果、長篇重複率、新角色多輪盲評(judge_opus46/EVAL_SUMMARY.md)、RP 範本、視覺測試

關於視覺模組

mmproj-Huihui-Qwen3.5-9B-abliterated-Q8_0.gguf 不是本專案的產物,是 mradermacher/Huihui-Qwen3.5-9B-abliterated-GGUFHuihui-Qwen3.5-9B-abliterated.mmproj-Q8_0.gguf,原封不動(624,229,760 bytes,逐 byte 相同)。

本專案訓練時視覺塔全程凍結,只掛語言塔的 LoRA,所以視覺能力與原廠基底完全相同, 沒有任何改進也沒有退化。放進本倉庫只是為了讓你不必跨倉庫湊檔案。

用 Ollama 跑

# 下載整個倉庫(Modelfile 用相對路徑,檔案要在同一層)
hf download RX5950XT/silicon-based-girlfriend-v2-GGUF --local-dir sbg-v2

cd sbg-v2
ollama create sbg-v2:q8 -f Modelfile.Q8_0
ollama run sbg-v2:q8

Q4 同理,換成 Modelfile.imat-Q4_K_M

取樣參數已寫進 Modelfile:temperature 0.7 / top_p 0.8 / top_k 20 / presence_penalty 1.5presence_penalty 1.5 是刻意的——這顆模型的主要弱點就是長對話複讀,調低會讓症狀回來。

角色扮演怎麼用:把角色設定寫在 system prompt,直接開始對話即可。模型沒有 [RPMode] 之類的觸發標記,訓練時刻意混入通用語料防遺忘,所以它平時也能正常回答問題。

Q4 在 8 GB 顯卡上的 context 上限約 8K(權重+視覺 6.0 GB,每 1K context 約需 160 MiB)。 要開到 16K 需啟用 8-bit KV 快取。

關於 imatrix

imatrix.gguf本專案用出貨模型自己的 Q8_0 算出來的重要性矩陣 (llama-imatrix -c 512 --chunks 200),用來決定量化時哪些權重該保留較高精度。 imat-Q4_K_M 就是靠它做出來的:5.02 BPW(223 張量 q4_K、35 張量 q6_K),PPL 7.50 ± 0.09。

校準文字約 40.5 萬字元,刻意照訓練資料的比例混合,而不是用通用語料:

內容 用意
GSM8K 繁中數學題 516 題 保住推理與數字能力
角色設定卡 保住長 system prompt 的理解
實際角色扮演對話 保住本模型的主要用途
通用任務(分析、說明、步驟) 保住防遺忘訓練的成果

用純英文 wiki 校準會讓繁中 RP 的權重被低估,這也是為什麼不直接套用現成的校準檔。

imatrix 檔只存每個張量的啟動統計量,不含任何原始文字

這顆模型好在哪

對照完全沒微調的原廠基底(同一顆 Q4_K_M,Ollama 預設參數),由第三方裁判 (claude-opus-4-6-thinking)盲評,6 個訓練資料裡沒有的新角色、各聊 5 輪、三個隨機種子:

模型 絕對分 三種子區間 對基底
原廠基底(未微調) 4.29 4.12–4.53 1.00×
只做 SFT 1.38 單種子 0.32×
GRPO 第一輪 3.73 3.60–3.87 0.87×
本模型 Q4 5.13 5.07–5.23 1.20×
本模型 Q8 5.18 4.82–5.55 1.21×

五面向拆開看,增益集中在入戲(+1.28)與人設一致(+1.72),正是這顆模型的用途:

模型 入戲 人設一致 劇情推進 多輪連貫 文字品質
原廠基底 4.89 4.50 4.50 4.50 3.08
只做 SFT 2.25 2.42 1.00 0.42 0.83
本模型 Q8 6.17 6.22 5.11 4.44 3.94

兩篇並排盲比時,本模型對基底 6 勝 0 負(Q8 與 Q4 皆是)。 單篇絕對分的差距之所以沒那麼大,是因為基底寫得又長又流暢(平均 688 字,本模型 455–507), 單篇打分不吃虧——要兩篇擺在一起,才看得出誰真的守住人設。

其他驗收

項目 結果
跨輪抄自己(新角色 5 輪 × 24) 0 次(GRPO 第一輪為 1–7 次)
長篇重複率 **0.0%**(Q8/Q4 皆是)
拒絕率 0/7(Q8/Q4 皆是)
GSM8K 數學 Q8 **85%**/Q4 82%
通用能力探針(64 題 5 類) Q4 **92.2%**,對未微調基線 76.6% 為 +10 題,McNemar 雙尾精確 p=0.021
簡體字 0 個(基底每 30 輪會吐 6–10 個)
看圖 顏色、形狀可辨識

已知限制(請務必讀)

  • 多輪連貫是最弱的面向,而且是唯一沒有超過原廠基底的(4.50 → 4.44)。 成因是 SFT 語料裡有 9.9% 的對話含「角色整段照抄自己前面某一輪」,先把這個能力打壞(掉到 0.42), 兩輪 GRPO 做的是把它爬回原廠水準,不是超越。語料已在 2026-09-17 清理並補上門哨, 但本模型是用清理前的語料訓練的,改善要等下一次重訓才會實現。
  • 看圖能認出顏色與形狀,但兩位數字會讀錯(「42」讀成「4」)。
  • 不適合事實查詢;數學雖有 85%,仍非可靠計算工具。
  • 與商用大模型仍有明顯差距:同題同裁判下,本模型是 Kimi K2.6 的 **54%**, 差距集中在多輪記憶與文字變化。這是 9B 參數量的天花板。
  • 上表的絕對分只能在同一位裁判內部比較,不可跨裁判引用 (同一批回答,Kimi 當裁判給本模型 7.47,opus 給 5.18——Kimi 對小模型評分偏寬約 2 分)。

訓練摘要

項目 內容
方法 SFT(LoRA r16 α16,1 epoch,576 步)→ GRPO ×2(各 117 步)
框架 TRL 0.24 + Unsloth,只掛語言塔(視覺塔凍結)
語料 自產繁中角色扮演合成對話 + 10% 通用語料防遺忘(以 loss 佔比計)
GRPO 獎勵 LLM 裁判(0–10)+ 防拒絕 + 防灌水 + 子句重複 + 照抄懲罰 + 跨輪抄自己懲罰 + 可驗證題(數學/指令)
硬體 Vast.ai RTX PRO 6000(96 GB)

adapter 與訓練佐證另見 RX5950XT/silicon-based-girlfriend-v2;資料集見 RX5950XT/silicon-based-girlfriend-v2-dataset

授權

基底 huihui-ai/Huihui-Qwen3.5-9B-abliterated 為 Apache-2.0(上游 Qwen/Qwen3.5-9B 亦同), 本倉庫沿用。使用前請自行確認符合當地法規與平台規範。

Downloads last month
-
GGUF
Model size
9B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for RX5950XT/silicon-based-girlfriend-v2-GGUF

Finetuned
Qwen/Qwen3.5-9B
Quantized
(19)
this model

Dataset used to train RX5950XT/silicon-based-girlfriend-v2-GGUF