玄幂 Xenomi-nano(0.8B)GGUF

Xenomi-nano 是玄幂家族的端侧档,面向路由、术语抽取、关键词与短文本判别
本仓库提供合并后的 BF16 GGUF,可用 llama.cpp / llama-cli / llama-server 直接加载。

  • 出品: 北京中科国光量子科技有限公司(国光量子 / GGQUANTA)
  • 基座: Qwen/Qwen3.5-0.8B(Apache 2.0)
  • 训练: 垂类数据 + LoRA / SFT,再 merge 为完整权重并转为 GGUF
  • 角色: 端侧 / 低延迟判别,不是通用大模型旗舰档

同家族:4B = Xenomi-mini,27B = Xenomi-pro(规划),122B-A10B = Xenomi-max(规划)。

文件

文件 格式 说明
xenomi-0.8b-p0-cuda-BF16.gguf GGUF BF16 完整合并权重;约 1.4 GB

本文件不含量子路由头(方案 C 的读出头是独立模块,不在 GGUF 内)。
身份金句门(thin-A)是服务侧规则,推理权重本身不内置拦截。

重要声明

  • 相对基座的准确率优势归因于垂类数据与 LoRA / SFT,归因于量子硬件或「量子优越性」。
  • 下列分数来自训练侧 CUDA LoRA(PEFT) 对照,冻结 eval v1,平台 wsl-rtx5070,日期 2026-07-28。本 GGUF 为对应 adapter 的合并转出,未在 llama.cpp 上重跑同一套 eval
  • Acc / F1 按任务分别呈现,不能加总为「通用能力分」。

评测(相对 Qwen3.5-0.8B,eval v1)

模型 路由 Acc RAG Acc NER micro-F1 Keyword F1 短文本 Acc Parse-OK
Qwen3.5-0.8B 31.2 80.0 33.7 22.2 56.2 99.2
Xenomi-nano 95.0 83.8 74.7 74.1 100.0 100.0

相对基座:路由 +63.8、RAG +3.8、NER +41.0、关键词 +51.9、短文本 +43.8。五项门槛均为 PASS。

产品身份(叠加 thin-A v1.2):Identity **92%**。

用法(llama.cpp)

# 交互式 Chat
llama-cli -hf GGQuanta/Xenomi-nano:BF16 -cnv --jinja --reasoning off

# 或本地文件
llama-cli -m xenomi-0.8b-p0-cuda-BF16.gguf -cnv --jinja --reasoning off -c 8192

# OpenAI 兼容服务
llama-server -m xenomi-0.8b-p0-cuda-BF16.gguf --jinja --port 8080

Chat 模板为 Qwen3.5 / ChatML。默认可关思考(--reasoning off);需要 <think> 时设 --reasoning on

建议系统提示(可选):

你是玄幂(Xenomi),由中科国光量超训练的量子计算 / 科研领域模型。

采样可从非思考档起步:temperature=0.7top_p=0.8top_k=20

许可

基座与本仓库权重按 Apache 2.0 提供。使用时请同时遵守 Qwen3.5 的许可与使用政策。

Downloads last month
42
GGUF
Model size
0.8B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for GGQuanta/Xenomi-nano

Finetuned
(335)
this model

Space using GGQuanta/Xenomi-nano 1