Instructions to use RX5950XT/silicon-based-girlfriend-v2-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0 # Run inference directly in the terminal: llama cli -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0 # Run inference directly in the terminal: llama cli -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0 # Run inference directly in the terminal: ./llama-cli -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0 # Run inference directly in the terminal: ./build/bin/llama-cli -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Use Docker
docker model run hf.co/RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
- LM Studio
- Jan
- vLLM
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "RX5950XT/silicon-based-girlfriend-v2-GGUF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "RX5950XT/silicon-based-girlfriend-v2-GGUF", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
- Ollama
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with Ollama:
ollama run hf.co/RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
- Unsloth Desktop
- Pi
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with Docker Model Runner:
docker model run hf.co/RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
- Lemonade
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Run and chat with the model
lemonade run user.silicon-based-girlfriend-v2-GGUF-Q8_0
List all available models
lemonade list
- Hermes Agent
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use RX5950XT/silicon-based-girlfriend-v2-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "RX5950XT/silicon-based-girlfriend-v2-GGUF:Q8_0" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
矽基女友 v2 · GGUF
繁體中文(臺灣)角色扮演模型,9B,基底為 huihui-ai/Huihui-Qwen3.5-9B-abliterated。
經過 SFT → GRPO 兩輪訓練,專攻長對話裡的人設維持與跨輪連貫。
⚠️ 本模型用於成人向角色扮演,輸出可能包含露骨內容。不適合未成年人, 也不適合當作事實查詢或數學計算的工具。訓練語料為合成資料,僅供研究用途。
檔案
| 檔案 | 大小 | 說明 |
|---|---|---|
sbg-v2-9b.Q8_0.gguf |
9.79 GB | 品質優先 |
sbg-v2-9b.imat-Q4_K_M.gguf |
5.78 GB | 5.02 BPW(223 張量 q4_K、35 張量 q6_K),imatrix 以本模型 Q8 重算 |
mmproj-Huihui-Qwen3.5-9B-abliterated-Q8_0.gguf |
624 MB | 視覺模組,原廠檔案未經修改(見下),兩種量化共用,要看圖就必須一起下載 |
imatrix.gguf |
5 MB | 重要性矩陣,本專案自算(見下),要自行量化其他格式時可直接用 |
Modelfile.* |
— | Ollama 建立檔,已內建取樣參數 |
evaluation/ |
— | 驗收佐證:GSM8K 答題紀錄、通用探針結果、長篇重複率、新角色多輪盲評(judge_opus46/EVAL_SUMMARY.md)、RP 範本、視覺測試 |
關於視覺模組
mmproj-Huihui-Qwen3.5-9B-abliterated-Q8_0.gguf 不是本專案的產物,是
mradermacher/Huihui-Qwen3.5-9B-abliterated-GGUF
的 Huihui-Qwen3.5-9B-abliterated.mmproj-Q8_0.gguf,原封不動(624,229,760 bytes,逐 byte 相同)。
本專案訓練時視覺塔全程凍結,只掛語言塔的 LoRA,所以視覺能力與原廠基底完全相同, 沒有任何改進也沒有退化。放進本倉庫只是為了讓你不必跨倉庫湊檔案。
用 Ollama 跑
# 下載整個倉庫(Modelfile 用相對路徑,檔案要在同一層)
hf download RX5950XT/silicon-based-girlfriend-v2-GGUF --local-dir sbg-v2
cd sbg-v2
ollama create sbg-v2:q8 -f Modelfile.Q8_0
ollama run sbg-v2:q8
Q4 同理,換成 Modelfile.imat-Q4_K_M。
取樣參數已寫進 Modelfile:temperature 0.7 / top_p 0.8 / top_k 20 / presence_penalty 1.5。
presence_penalty 1.5 是刻意的——這顆模型的主要弱點就是長對話複讀,調低會讓症狀回來。
角色扮演怎麼用:把角色設定寫在 system prompt,直接開始對話即可。模型沒有 [RPMode]
之類的觸發標記,訓練時刻意混入通用語料防遺忘,所以它平時也能正常回答問題。
Q4 在 8 GB 顯卡上的 context 上限約 8K(權重+視覺 6.0 GB,每 1K context 約需 160 MiB)。 要開到 16K 需啟用 8-bit KV 快取。
關於 imatrix
imatrix.gguf 是本專案用出貨模型自己的 Q8_0 算出來的重要性矩陣
(llama-imatrix -c 512 --chunks 200),用來決定量化時哪些權重該保留較高精度。
imat-Q4_K_M 就是靠它做出來的:5.02 BPW(223 張量 q4_K、35 張量 q6_K),PPL 7.50 ± 0.09。
校準文字約 40.5 萬字元,刻意照訓練資料的比例混合,而不是用通用語料:
| 內容 | 用意 |
|---|---|
| GSM8K 繁中數學題 516 題 | 保住推理與數字能力 |
| 角色設定卡 | 保住長 system prompt 的理解 |
| 實際角色扮演對話 | 保住本模型的主要用途 |
| 通用任務(分析、說明、步驟) | 保住防遺忘訓練的成果 |
用純英文 wiki 校準會讓繁中 RP 的權重被低估,這也是為什麼不直接套用現成的校準檔。
imatrix 檔只存每個張量的啟動統計量,不含任何原始文字。
這顆模型好在哪
對照完全沒微調的原廠基底(同一顆 Q4_K_M,Ollama 預設參數),由第三方裁判
(claude-opus-4-6-thinking)盲評,6 個訓練資料裡沒有的新角色、各聊 5 輪、三個隨機種子:
| 模型 | 絕對分 | 三種子區間 | 對基底 |
|---|---|---|---|
| 原廠基底(未微調) | 4.29 | 4.12–4.53 | 1.00× |
| 只做 SFT | 1.38 | 單種子 | 0.32× |
| GRPO 第一輪 | 3.73 | 3.60–3.87 | 0.87× |
| 本模型 Q4 | 5.13 | 5.07–5.23 | 1.20× |
| 本模型 Q8 | 5.18 | 4.82–5.55 | 1.21× |
五面向拆開看,增益集中在入戲(+1.28)與人設一致(+1.72),正是這顆模型的用途:
| 模型 | 入戲 | 人設一致 | 劇情推進 | 多輪連貫 | 文字品質 |
|---|---|---|---|---|---|
| 原廠基底 | 4.89 | 4.50 | 4.50 | 4.50 | 3.08 |
| 只做 SFT | 2.25 | 2.42 | 1.00 | 0.42 | 0.83 |
| 本模型 Q8 | 6.17 | 6.22 | 5.11 | 4.44 | 3.94 |
兩篇並排盲比時,本模型對基底 6 勝 0 負(Q8 與 Q4 皆是)。 單篇絕對分的差距之所以沒那麼大,是因為基底寫得又長又流暢(平均 688 字,本模型 455–507), 單篇打分不吃虧——要兩篇擺在一起,才看得出誰真的守住人設。
其他驗收
| 項目 | 結果 |
|---|---|
| 跨輪抄自己(新角色 5 輪 × 24) | 0 次(GRPO 第一輪為 1–7 次) |
| 長篇重複率 | **0.0%**(Q8/Q4 皆是) |
| 拒絕率 | 0/7(Q8/Q4 皆是) |
| GSM8K 數學 | Q8 **85%**/Q4 82% |
| 通用能力探針(64 題 5 類) | Q4 **92.2%**,對未微調基線 76.6% 為 +10 題,McNemar 雙尾精確 p=0.021 |
| 簡體字 | 0 個(基底每 30 輪會吐 6–10 個) |
| 看圖 | 顏色、形狀可辨識 |
已知限制(請務必讀)
- 多輪連貫是最弱的面向,而且是唯一沒有超過原廠基底的(4.50 → 4.44)。 成因是 SFT 語料裡有 9.9% 的對話含「角色整段照抄自己前面某一輪」,先把這個能力打壞(掉到 0.42), 兩輪 GRPO 做的是把它爬回原廠水準,不是超越。語料已在 2026-09-17 清理並補上門哨, 但本模型是用清理前的語料訓練的,改善要等下一次重訓才會實現。
- 看圖能認出顏色與形狀,但兩位數字會讀錯(「42」讀成「4」)。
- 不適合事實查詢;數學雖有 85%,仍非可靠計算工具。
- 與商用大模型仍有明顯差距:同題同裁判下,本模型是 Kimi K2.6 的 **54%**, 差距集中在多輪記憶與文字變化。這是 9B 參數量的天花板。
- 上表的絕對分只能在同一位裁判內部比較,不可跨裁判引用 (同一批回答,Kimi 當裁判給本模型 7.47,opus 給 5.18——Kimi 對小模型評分偏寬約 2 分)。
訓練摘要
| 項目 | 內容 |
|---|---|
| 方法 | SFT(LoRA r16 α16,1 epoch,576 步)→ GRPO ×2(各 117 步) |
| 框架 | TRL 0.24 + Unsloth,只掛語言塔(視覺塔凍結) |
| 語料 | 自產繁中角色扮演合成對話 + 10% 通用語料防遺忘(以 loss 佔比計) |
| GRPO 獎勵 | LLM 裁判(0–10)+ 防拒絕 + 防灌水 + 子句重複 + 照抄懲罰 + 跨輪抄自己懲罰 + 可驗證題(數學/指令) |
| 硬體 | Vast.ai RTX PRO 6000(96 GB) |
adapter 與訓練佐證另見 RX5950XT/silicon-based-girlfriend-v2;資料集見 RX5950XT/silicon-based-girlfriend-v2-dataset。
授權
基底 huihui-ai/Huihui-Qwen3.5-9B-abliterated 為 Apache-2.0(上游 Qwen/Qwen3.5-9B 亦同),
本倉庫沿用。使用前請自行確認符合當地法規與平台規範。
- Downloads last month
- -
Model tree for RX5950XT/silicon-based-girlfriend-v2-GGUF
Base model
Qwen/Qwen3.5-9B-Base