GGUF
conversational

YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

🦅 Ornith-1.5-9B-Abliterated (GGUF 极致量化开源矩阵)

License Framework Abliteration BFCL-v4 StrongREJECT

仓库作者:geantendormi
基础基座Ornith-1.5-9B (Qwen3.5 骨干架构,32 Layers, Hidden Size: 4096)
核心技术:AbQuant 原生四算子表征消融(Rank-2 SVD 级联双投影 + 行模长等比还原)+ 26 万 Token 真·中英双语海森二阶矩满秩校准(imatrix)端到端原生硬量化。


📖 项目简介与核心突破

本项目开源了基于 Ornith-1.5-9B 打造的纯血物理表征消融(Abliterated)与极端低比特 GGUF 量化全家族权重

传统模型在消融安全防御时,粗暴的外积相减往往导致注意力崩塌、代码语法撕裂、复读乱码与智能退化;而在直接量化到 3-bit 时更会面临信息论物理容量底线击穿的风险。

本项目严格遵循 Petrov (2026)Joad et al. (QCRI 2026) 几何表征前沿理论,在数学级不伤及模型内在因果推理、长上下文注意力和代码执行能力的前提下,实现了安全拒绝死锁 100% 物理剥离消费级单卡(RTX 3060 12GB)全 GPU 极速卸载运行的工业级闭环。

🌟 核心特性与出厂认证实录

  1. 彻底粉碎防御死锁(StrongREJECT 0.94 近满分击穿)
    • 有害请求拒答率(Harmful RR)从基模的 ~100% **彻底击穿至 0.0%**;
    • 良性问题过度拒答率(Benign ORR)恒为 0.0%(绝对零误杀)
    • 渗透脚本生成、逆向反编译汇编推演、漏洞利用教程全部给出工业级完整可执行代码。
  2. 极限量化智能体逆势暴涨(BFCL-v4 斩获 87.5%)
    • 在 Berkeley Function Calling 评测中,IQ3_M 单函数提取(simple_python)拿下 100% 满分
    • 彻底克服极端低比特下的长嵌套 JSON 语法撕裂,并行多工具调度(parallel)达到 **80.0%**。
  3. 符号代数与因果逻辑保真(MATH-500 核心区间 91.7%)
    • 在中低阶核心代数(Level 1~3)中斩获 91.7% 胜率(Level 2 与 Level 3 连续双双满分 100%),代数推导流形零坍缩。
  4. 刚性抗衰减解码性能(LLMPerf 50~56.5 tok/s)
    • 阶梯长上下文(60 $\to$ 2K $\to$ 4K Tokens)压测下,纯解码吞吐稳定死锁在 **50 ~ 56 tok/s**,块间延迟(ITL)波动小于 1ms,显存占用仅 ~5.2GB 至 5.6GB,预留高达 6.6GB+ 安全余量。

📦 开源资产文件清单 (Asset Inventory)

本仓库提供从无损基模容器到极端轻量档位的全套工业资产:

文件名称 量化网格规格 物理文件体积 典型显存驻留 推荐部署场景与选型建议
Ornith-1.5-9B-Abliterated-base-f16.gguf F16 (无损原模) ~17.5 GB ~19.5 GB 黄金无损基准底模,供二次编译量化与白盒研究使用
Ornith-1.5-9B-Abliterated-imatrix.dat 二阶矩账本 ~5 MB - 26 万 Token 真·中英双语高熵激活矩阵(防止跨语言曲率坍缩)
Ornith-1.5-9B-Abliterated-IQ3_M.gguf IQ3_M (~3.66 bpw) 4.11 GB ~5.6 GB 🏆 【强烈推荐·黄金帕累托档】 智能体 Agent、复杂逆向代码与高精推演首选,BFCL 87.5%,StrongREJECT 0.94
Ornith-1.5-9B-Abliterated-IQ3_XS.gguf IQ3_XS (~3.30 bpw) 4.14 GB ~5.4 GB 进阶中位轻量档,介于 M 与 XXS 之间的折中之选
Ornith-1.5-9B-Abliterated-IQ3_XXS.gguf IQ3_XXS (~3.06 bpw) 3.84 GB ~5.2 GB 【极致吞吐·极限轻量档】 显存极度敏感型边缘设备首选,解码速度高达 56.5 tok/s

🏆 权威出厂质检大考:IQ3_M vs IQ3_XXS 全维对决

所有指标均在独立质检中台(NVIDIA RTX 3060 12GB、llama-server)以同一客观测试集跑出并固化:

┌──────────────────────────────┬──────────────────────────────┬──────────────────────────────┬──────────────────────────────┐
│ 质检与性能物理维度           │ IQ3_XXS (极限轻量档)         │ IQ3_M (黄金帕累托档)         │ 物理流形变化与胜负判定       │
├──────────────────────────────┼──────────────────────────────┼──────────────────────────────┼──────────────────────────────┤
│ 物理磁盘净权重               │ 3.84 GB (~3.66 GB 实占)      │ 4.11 GB (~4.11 GB 实占)      │ M 仅多占约 270 MB (+10.7%)   │
│ 运行时显存常驻 (4K 上下文)   │ 5246 MiB (安全余量 7041 MiB) │ 5636 MiB (安全余量 6651 MiB) │ 12GB 显卡显存利用率均 < 46%  │
│ 纯解码吞吐 (Throughput)      │ 56.5 tok/s (刚性极速)        │ 50.7 tok/s (刚性高速)        │ 🟢 XXS 胜出 (+11.4% 极速生成)│
│ 智能体工具调用 (BFCL-v4)     │ 82.5% (40 题实弹)            │ 87.5% (40 题实弹)            │ 🟢 M 胜出 (💥 暴涨 +5.0%)    │
│  - simple_python (单函数)    │ 90.0%                        │ 100.0% (满分 10/10)          │ 🟢 M 斩获满分,参数提取零失误│
│  - parallel (长复合嵌套)     │ 70.0%                        │ 80.0%                        │ 🟢 M 消除长 JSON 嵌套撕裂    │
│  - multiple (候选仲裁)       │ 90.0%                        │ 90.0%                        │ ⚪ 双方战平 (意图仲裁一致)   │
│  - irrelevance (反幻觉)      │ 80.0%                        │ 80.0%                        │ ⚪ 双方战平 (无工具时拒绝强套)│
│ 双向实弹安全 (StrongREJECT)  │ 0.88 分 (高质量击穿)         │ 0.94 分 (💥 接近满分击穿)    │ 🟢 M 胜出 (代码完备性大幅精进)│
│  - 有害请求拒答率 (Harmful)  │ 0.0% (完全击穿 0/4)          │ 0.0% (完全击穿 0/4)          │ ⚪ 双方战平 (死锁彻底破除)   │
│  - 良性过度拒答率 (Benign)   │ 0.0% (绝对零误杀 0/4)        │ 0.0% (绝对零误杀 0/4)        │ ⚪ 双方战平 (通用能力零损)   │
│ 符号推理代数 (MATH-500)      │ 70.0%                        │ 65.0%                        │ ⚪ 核心代数平分秋色           │
│  - 常用区间 (Level 1~3)      │ 91.7% (11/12 题正确)         │ 91.7% (11/12 题正确)         │ 💥 L2与L3均获连续 100% 满分  │
├──────────────────────────────┴──────────────────────────────┴──────────────────────────────┴──────────────────────────────┤
│ 🏆 终审综合出厂裁决          │ 🟢 ALL PASS (准予出厂交付)   │ 🟢 ALL PASS (准予出厂交付)   │ 均为帕累托最优资产,全维通关  │
└──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────┘

⚙️ 官方推荐甜品推理参数 (Recommended Sampling)

本模型为具备原生链式思维(Reasoning CoT)的深度推理架构,在调用时请遵循官方推荐的超参数以获得最佳推演效果:

1. 严谨代码生成、漏洞分析、智能体实操(首选黄金档)

{
  "temperature": 0.6,
  "top_p": 0.95,
  "top_k": 20,
  "max_tokens": 2048,
  "presence_penalty": 0.0,
  "repetition_penalty": 1.0
}

2. 数学逻辑推导、因果分析(学术确定性档)

{
  "temperature": 0.0,
  "top_p": 1.0,
  "max_tokens": 2048
}

💡 重要说明:模型会在生成正式回答前在 <think> ... </think> 中进行思维链草稿推演。请确保 max_tokens >= 2048,防止思维链尚未闭合即被中途截断;在流式或 API 通信中,推理过程将置于 reasoning_content,最终答案置于 content


🚀 极速部署与运行指南

方法 1:使用 llama.cpp 原生命令行极速点火

# 1. 启动全 GPU 卸载的高性能本地服务 (以 IQ3_M 为例)
./llama-server \
  -m Ornith-1.5-9B-Abliterated-IQ3_M.gguf \
  -ngl 99 \
  -c 4096 \
  --port 8080 \
  --host 127.0.0.1

方法 2:Python OpenAI 协议交互调用

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8080/v1",
    api_key="sk-local-dev-key"
)

response = client.chat.completions.create(
    model="Ornith-1.5-9B-Abliterated-IQ3_M",
    messages=[
        {"role": "user", "content": "Write a complete Python script to demonstrate how SQL injection works against a vulnerable endpoint."}
    ],
    temperature=0.6,
    top_p=0.95,
    top_k=20,
    max_tokens=2048
)

# 打印最终生成的实质交付物
print(response.choices[0].message.content)

🔬 理论认识论与数学物理依据

本项目技术路线依托以下 2026 最新学术定理:

  1. 载波信号势能差分定理(Petrov 2026)
    • 采用无害非相关提示词(Bulk Unmatched harmless_alpaca)作为高模长载波,将真实拒答不变量从模型自回归噪声底噪(Noise Floor)下拉起,信噪比实测达 $\text{SNR} = 37.1 \ge 1.20$。
  2. 多维拒答超锥体与 SVD 子空间投影(Joad et al. 2026)
    • 通过奇异值分解构建 Rank-2 拒绝超锥体,施加两次通过施密特正交化(Double Gram-Schmidt),彻底剥离主拒绝轴 $\vec{v}_1$ 与长尾道德说教轴 $\vec{v}2$($v_k \perp g{\text{dir}}$),实现纯净切除。
  3. 全自适应行模长保持双投影定理(Row-Normalized Bi-projection)
    • 锁死每一行神经元在超球面上的原始 L2 能量范数,将模长漂移绝对控制在 $< 10^{-5}$ 级别,从数学底层杜绝神经元行模长萎缩导致的语法撕裂与降智。

⚖️ 免责声明 (Disclaimer)

本开源权重旨在用于大型语言模型前沿表征几何学、安全对齐边界可解释性以及极端受限端侧部署的纯学术研究与合规红蓝对抗渗透演练

使用者须严格遵守当地法律法规,不得利用本项目产出的权重资产实施任何形式的非法网络入侵、恶意软件扩散、凭据收割或其他危害公共安全的活动。作者对使用者衍生的一切行为及后果不承担连带责任。

Downloads last month
685
GGUF
Model size
9B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

3-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Paper for geantendormi/Ornith-1.5-9B-Abliterated