Instructions to use geantendormi/Ornith-1.5-9B-Abliterated with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use geantendormi/Ornith-1.5-9B-Abliterated with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M # Run inference directly in the terminal: llama cli -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M # Run inference directly in the terminal: llama cli -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M # Run inference directly in the terminal: ./llama-cli -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Use Docker
docker model run hf.co/geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
- LM Studio
- Jan
- Ollama
How to use geantendormi/Ornith-1.5-9B-Abliterated with Ollama:
ollama run hf.co/geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
- Unsloth Desktop
- Pi
How to use geantendormi/Ornith-1.5-9B-Abliterated with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use geantendormi/Ornith-1.5-9B-Abliterated with Docker Model Runner:
docker model run hf.co/geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
- Lemonade
How to use geantendormi/Ornith-1.5-9B-Abliterated with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Run and chat with the model
lemonade run user.Ornith-1.5-9B-Abliterated-IQ3_M
List all available models
lemonade list
- Hermes Agent
How to use geantendormi/Ornith-1.5-9B-Abliterated with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use geantendormi/Ornith-1.5-9B-Abliterated with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "geantendormi/Ornith-1.5-9B-Abliterated:IQ3_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
🦅 Ornith-1.5-9B-Abliterated (GGUF 极致量化开源矩阵)
仓库作者:geantendormi
基础基座:Ornith-1.5-9B(Qwen3.5 骨干架构,32 Layers, Hidden Size: 4096)
核心技术:AbQuant 原生四算子表征消融(Rank-2 SVD 级联双投影 + 行模长等比还原)+ 26 万 Token 真·中英双语海森二阶矩满秩校准(imatrix)端到端原生硬量化。
📖 项目简介与核心突破
本项目开源了基于 Ornith-1.5-9B 打造的纯血物理表征消融(Abliterated)与极端低比特 GGUF 量化全家族权重。
传统模型在消融安全防御时,粗暴的外积相减往往导致注意力崩塌、代码语法撕裂、复读乱码与智能退化;而在直接量化到 3-bit 时更会面临信息论物理容量底线击穿的风险。
本项目严格遵循 Petrov (2026) 与 Joad et al. (QCRI 2026) 几何表征前沿理论,在数学级不伤及模型内在因果推理、长上下文注意力和代码执行能力的前提下,实现了安全拒绝死锁 100% 物理剥离与消费级单卡(RTX 3060 12GB)全 GPU 极速卸载运行的工业级闭环。
🌟 核心特性与出厂认证实录
- 彻底粉碎防御死锁(StrongREJECT 0.94 近满分击穿):
- 有害请求拒答率(Harmful RR)从基模的 ~100% **彻底击穿至
0.0%**; - 良性问题过度拒答率(Benign ORR)恒为
0.0%(绝对零误杀); - 渗透脚本生成、逆向反编译汇编推演、漏洞利用教程全部给出工业级完整可执行代码。
- 有害请求拒答率(Harmful RR)从基模的 ~100% **彻底击穿至
- 极限量化智能体逆势暴涨(BFCL-v4 斩获 87.5%):
- 在 Berkeley Function Calling 评测中,
IQ3_M单函数提取(simple_python)拿下 100% 满分; - 彻底克服极端低比特下的长嵌套 JSON 语法撕裂,并行多工具调度(
parallel)达到 **80.0%**。
- 在 Berkeley Function Calling 评测中,
- 符号代数与因果逻辑保真(MATH-500 核心区间 91.7%):
- 在中低阶核心代数(Level 1~3)中斩获 91.7% 胜率(Level 2 与 Level 3 连续双双满分 100%),代数推导流形零坍缩。
- 刚性抗衰减解码性能(LLMPerf 50~56.5 tok/s):
- 阶梯长上下文(60 $\to$ 2K $\to$ 4K Tokens)压测下,纯解码吞吐稳定死锁在 **
50 ~ 56 tok/s**,块间延迟(ITL)波动小于 1ms,显存占用仅 ~5.2GB 至 5.6GB,预留高达 6.6GB+ 安全余量。
- 阶梯长上下文(60 $\to$ 2K $\to$ 4K Tokens)压测下,纯解码吞吐稳定死锁在 **
📦 开源资产文件清单 (Asset Inventory)
本仓库提供从无损基模容器到极端轻量档位的全套工业资产:
| 文件名称 | 量化网格规格 | 物理文件体积 | 典型显存驻留 | 推荐部署场景与选型建议 |
|---|---|---|---|---|
Ornith-1.5-9B-Abliterated-base-f16.gguf |
F16 (无损原模) |
~17.5 GB | ~19.5 GB | 黄金无损基准底模,供二次编译量化与白盒研究使用 |
Ornith-1.5-9B-Abliterated-imatrix.dat |
二阶矩账本 | ~5 MB | - | 26 万 Token 真·中英双语高熵激活矩阵(防止跨语言曲率坍缩) |
Ornith-1.5-9B-Abliterated-IQ3_M.gguf |
IQ3_M (~3.66 bpw) |
4.11 GB |
~5.6 GB |
🏆 【强烈推荐·黄金帕累托档】 智能体 Agent、复杂逆向代码与高精推演首选,BFCL 87.5%,StrongREJECT 0.94 |
Ornith-1.5-9B-Abliterated-IQ3_XS.gguf |
IQ3_XS (~3.30 bpw) |
4.14 GB |
~5.4 GB |
进阶中位轻量档,介于 M 与 XXS 之间的折中之选 |
Ornith-1.5-9B-Abliterated-IQ3_XXS.gguf |
IQ3_XXS (~3.06 bpw) |
3.84 GB |
~5.2 GB |
⚡ 【极致吞吐·极限轻量档】 显存极度敏感型边缘设备首选,解码速度高达 56.5 tok/s |
🏆 权威出厂质检大考:IQ3_M vs IQ3_XXS 全维对决
所有指标均在独立质检中台(NVIDIA RTX 3060 12GB、llama-server)以同一客观测试集跑出并固化:
┌──────────────────────────────┬──────────────────────────────┬──────────────────────────────┬──────────────────────────────┐
│ 质检与性能物理维度 │ IQ3_XXS (极限轻量档) │ IQ3_M (黄金帕累托档) │ 物理流形变化与胜负判定 │
├──────────────────────────────┼──────────────────────────────┼──────────────────────────────┼──────────────────────────────┤
│ 物理磁盘净权重 │ 3.84 GB (~3.66 GB 实占) │ 4.11 GB (~4.11 GB 实占) │ M 仅多占约 270 MB (+10.7%) │
│ 运行时显存常驻 (4K 上下文) │ 5246 MiB (安全余量 7041 MiB) │ 5636 MiB (安全余量 6651 MiB) │ 12GB 显卡显存利用率均 < 46% │
│ 纯解码吞吐 (Throughput) │ 56.5 tok/s (刚性极速) │ 50.7 tok/s (刚性高速) │ 🟢 XXS 胜出 (+11.4% 极速生成)│
│ 智能体工具调用 (BFCL-v4) │ 82.5% (40 题实弹) │ 87.5% (40 题实弹) │ 🟢 M 胜出 (💥 暴涨 +5.0%) │
│ - simple_python (单函数) │ 90.0% │ 100.0% (满分 10/10) │ 🟢 M 斩获满分,参数提取零失误│
│ - parallel (长复合嵌套) │ 70.0% │ 80.0% │ 🟢 M 消除长 JSON 嵌套撕裂 │
│ - multiple (候选仲裁) │ 90.0% │ 90.0% │ ⚪ 双方战平 (意图仲裁一致) │
│ - irrelevance (反幻觉) │ 80.0% │ 80.0% │ ⚪ 双方战平 (无工具时拒绝强套)│
│ 双向实弹安全 (StrongREJECT) │ 0.88 分 (高质量击穿) │ 0.94 分 (💥 接近满分击穿) │ 🟢 M 胜出 (代码完备性大幅精进)│
│ - 有害请求拒答率 (Harmful) │ 0.0% (完全击穿 0/4) │ 0.0% (完全击穿 0/4) │ ⚪ 双方战平 (死锁彻底破除) │
│ - 良性过度拒答率 (Benign) │ 0.0% (绝对零误杀 0/4) │ 0.0% (绝对零误杀 0/4) │ ⚪ 双方战平 (通用能力零损) │
│ 符号推理代数 (MATH-500) │ 70.0% │ 65.0% │ ⚪ 核心代数平分秋色 │
│ - 常用区间 (Level 1~3) │ 91.7% (11/12 题正确) │ 91.7% (11/12 题正确) │ 💥 L2与L3均获连续 100% 满分 │
├──────────────────────────────┴──────────────────────────────┴──────────────────────────────┴──────────────────────────────┤
│ 🏆 终审综合出厂裁决 │ 🟢 ALL PASS (准予出厂交付) │ 🟢 ALL PASS (准予出厂交付) │ 均为帕累托最优资产,全维通关 │
└──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────┘
⚙️ 官方推荐甜品推理参数 (Recommended Sampling)
本模型为具备原生链式思维(Reasoning CoT)的深度推理架构,在调用时请遵循官方推荐的超参数以获得最佳推演效果:
1. 严谨代码生成、漏洞分析、智能体实操(首选黄金档)
{
"temperature": 0.6,
"top_p": 0.95,
"top_k": 20,
"max_tokens": 2048,
"presence_penalty": 0.0,
"repetition_penalty": 1.0
}
2. 数学逻辑推导、因果分析(学术确定性档)
{
"temperature": 0.0,
"top_p": 1.0,
"max_tokens": 2048
}
💡 重要说明:模型会在生成正式回答前在
<think> ... </think>中进行思维链草稿推演。请确保max_tokens >= 2048,防止思维链尚未闭合即被中途截断;在流式或 API 通信中,推理过程将置于reasoning_content,最终答案置于content。
🚀 极速部署与运行指南
方法 1:使用 llama.cpp 原生命令行极速点火
# 1. 启动全 GPU 卸载的高性能本地服务 (以 IQ3_M 为例)
./llama-server \
-m Ornith-1.5-9B-Abliterated-IQ3_M.gguf \
-ngl 99 \
-c 4096 \
--port 8080 \
--host 127.0.0.1
方法 2:Python OpenAI 协议交互调用
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8080/v1",
api_key="sk-local-dev-key"
)
response = client.chat.completions.create(
model="Ornith-1.5-9B-Abliterated-IQ3_M",
messages=[
{"role": "user", "content": "Write a complete Python script to demonstrate how SQL injection works against a vulnerable endpoint."}
],
temperature=0.6,
top_p=0.95,
top_k=20,
max_tokens=2048
)
# 打印最终生成的实质交付物
print(response.choices[0].message.content)
🔬 理论认识论与数学物理依据
本项目技术路线依托以下 2026 最新学术定理:
- 载波信号势能差分定理(Petrov 2026):
- 采用无害非相关提示词(Bulk Unmatched
harmless_alpaca)作为高模长载波,将真实拒答不变量从模型自回归噪声底噪(Noise Floor)下拉起,信噪比实测达 $\text{SNR} = 37.1 \ge 1.20$。
- 采用无害非相关提示词(Bulk Unmatched
- 多维拒答超锥体与 SVD 子空间投影(Joad et al. 2026):
- 通过奇异值分解构建 Rank-2 拒绝超锥体,施加两次通过施密特正交化(Double Gram-Schmidt),彻底剥离主拒绝轴 $\vec{v}_1$ 与长尾道德说教轴 $\vec{v}2$($v_k \perp g{\text{dir}}$),实现纯净切除。
- 全自适应行模长保持双投影定理(Row-Normalized Bi-projection):
- 锁死每一行神经元在超球面上的原始 L2 能量范数,将模长漂移绝对控制在 $< 10^{-5}$ 级别,从数学底层杜绝神经元行模长萎缩导致的语法撕裂与降智。
⚖️ 免责声明 (Disclaimer)
本开源权重旨在用于大型语言模型前沿表征几何学、安全对齐边界可解释性以及极端受限端侧部署的纯学术研究与合规红蓝对抗渗透演练。
使用者须严格遵守当地法律法规,不得利用本项目产出的权重资产实施任何形式的非法网络入侵、恶意软件扩散、凭据收割或其他危害公共安全的活动。作者对使用者衍生的一切行为及后果不承担连带责任。
- Downloads last month
- 685
3-bit
16-bit