玄幂 Xenomi-mini(4B)GGUF

Xenomi-mini 是玄幂家族的桌面档,面向对话、科研摘要 / 科普、内容风险与产品判断
本仓库提供合并后的 GGUF,可用 llama.cpp / llama-cli / llama-server 直接加载。

  • 出品: 北京中科国光量子科技有限公司(国光量子 / GGQUANTA)
  • 基座: Qwen/Qwen3.5-4B(Apache 2.0)
  • 训练: 垂类数据 + LoRA / SFT,再 merge 为完整权重并转为 GGUF
  • 角色: 单卡桌面生成,不是端侧 nano,也不是机房旗舰档

同家族:0.8B = Xenomi-nano,27B = Xenomi-pro(规划),122B-A10B = Xenomi-max(规划)。

选哪个文件

场景 建议
本机先跑起来 / 内存有限 Q4_K_M(约 2.6 GB)
产品对话、路由、NER、短文本 产品轨 BF16(约 7.8 GB)
摘要、科普、格式、内容风险、Agent 决策 科研轨 BF16(约 7.8 GB)
文件 用途 体积
xenomi-4b-sft-v0-id-r5-Q4_K_M.gguf 量化档,便于本机与端侧试用 约 2.6 GB
xenomi-4b-classic-v0-id8b-BF16.gguf 产品轨完整精度 约 7.8 GB
xenomi-4b-research-qrouter-v1-BF16.gguf 科研轨完整精度 约 7.8 GB

GGUF 不含独立量子读出头。身份金句门(thin-A)是服务侧规则,权重本身不内置拦截。
量化档便于部署,不能把产品 / 科研 BF16 的五维或 Layer A 分数直接写成该 Q4 文件的实测结果。

重要声明

  • 相对基座的准确率优势归因于垂类数据与 LoRA / SFT,归因于量子硬件或「量子优越性」。
  • 产品五维、科研 Layer A 来自训练侧 CUDA LoRA(PEFT) 对照(RTX 5070,bf16,约 2026-07-31 至 2026-08-06)。对应 BF16 GGUF 为 adapter 合并转出,未在 llama.cpp 上重跑同一套 eval
  • Agent 决策三项来自 llama.cpp BF16 与当场转出的 Qwen3.5-4B 基座同口径(2026-08-18),不与 CUDA PEFT 历史分混写
  • Acc / F1 按任务分别呈现,不能加总为「通用能力分」。部分任务端到端更快,主要来自更短、更规范的生成;不宣称 tokens/s 提升
  • 已知回退:产品轨 RAG 87.5 → 85.0;科研轨摘要 must 50.0 → 45.8。

评测

产品轨(相对 Qwen3.5-4B)

模型 路由 Acc RAG Acc NER micro-F1 Keyword F1 短文本 Acc Parse-OK
Qwen3.5-4B 70.0 87.5 50.4 21.8 76.2 100.0
Xenomi-mini 产品 95.0 85.0 78.1 60.5 100.0 100.0

Identity FAQ(--no-thin-a):**91%**。

科研轨 Layer A(相对 Qwen3.5-4B)

模型 摘要槽位 摘要 must 科普 must Format 风险 F1
Qwen3.5-4B 100.0 50.0 14.6 95.8 44.2
Xenomi-mini 科研 100.0 45.8 41.7 100.0 100.0

Agent 决策(llama.cpp BF16,相对同口径基座)

任务 基座 Xenomi-mini 科研
风险决策 57.4 95.9
工具决策 92.5 95.4
结束决策 33.3 70.8

用法

# 量化档(推荐先试这个)
llama-cli -hf GGQuanta/Xenomi-mini:Q4_K_M -cnv --jinja --reasoning off -c 8192

# 产品轨 / 科研轨 BF16:先下载对应文件
hf download GGQuanta/Xenomi-mini xenomi-4b-classic-v0-id8b-BF16.gguf
llama-cli -m xenomi-4b-classic-v0-id8b-BF16.gguf -cnv --jinja --reasoning off -c 8192

hf download GGQuanta/Xenomi-mini xenomi-4b-research-qrouter-v1-BF16.gguf
llama-cli -m xenomi-4b-research-qrouter-v1-BF16.gguf -cnv --jinja --reasoning off -c 8192

# OpenAI 兼容服务
llama-server -m xenomi-4b-sft-v0-id-r5-Q4_K_M.gguf --jinja --port 8080

仓库里有两份 BF16,-hf …:BF16 会有歧义,请按文件名下载。Chat 模板为 Qwen3.5 / ChatML。默认可关思考(--reasoning off)。

建议系统提示(可选):

你是玄幂(Xenomi),由中科国光量超训练的量子计算 / 科研领域模型。

非思考采样可从 temperature=0.7top_p=0.8top_k=20 起步。

许可

基座与本仓库权重按 Apache 2.0 提供。使用时请同时遵守 Qwen3.5 的许可与使用政策。

Downloads last month
55
GGUF
Model size
4B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for GGQuanta/Xenomi-mini

Finetuned
Qwen/Qwen3.5-4B
Finetuned
(537)
this model

Space using GGQuanta/Xenomi-mini 1