CandiGate-Qwen3-4B

中文 | English

CandiGate-Qwen3-4B 是基于 Hugging Face Hub 上的 Qwen/Qwen3-4B 训练的候选约束 Agent 决策 LoRA,目标是复现 Jev 的可观察决策行为。

CandiGate 代表 Candidate Logit Gate。模型不依赖自由文本生成来选择动作, 而是对经过验证的候选标记计算 restricted logits,通过一次因果语言模型前向计算 完成工具选择、无合适工具拒绝、二元判断、有序评分、授权、重试和完成判断。

模型信息

项目 内容
Hub 仓库 CullenYap/CandiGate-Qwen3-4B
版本 v0.1.0-0920
基座模型 Qwen/Qwen3-4B
模型类型 PEFT LoRA adapter
LoRA 配置 rank 16,alpha 32,dropout 0.05
目标模块 q_projk_projv_projo_proj
语言 中文、英文
许可证 Apache-2.0
决策原语 choicenoulscore

本仓库提供训练完成的 LoRA adapter,基座权重由 Qwen/Qwen3-4B 单独加载。

使用 Transformers 与 PEFT

推荐 Python 3.12、CUDA GPU 和 BF16 推理环境。

git clone https://huggingface.co/CullenYap/CandiGate-Qwen3-4B
cd CandiGate-Qwen3-4B
pip install -r requirements.txt

仓库已包含可直接运行的 example_request.json

python inference.py \
  --base-model Qwen/Qwen3-4B \
  --adapter CullenYap/CandiGate-Qwen3-4B \
  --input example_request.json \
  --temperature 1.2637946123

也可以使用 huggingface_hub 固定版本下载:

from huggingface_hub import snapshot_download

adapter_dir = snapshot_download(
    repo_id="CullenYap/CandiGate-Qwen3-4B",
    revision="v0.1.0-0920",
)
print(adapter_dir)

输出包含最终选择、置信度和全部候选的概率分布。score 原语还会返回 expected_score

输入格式

{
  "state": "用户需要查询成都当前天气。可用工具中只有天气查询能够访问实时天气数据。",
  "question": "下一步应选择哪个工具?",
  "options": ["天气查询", "日历查询", "拒绝执行"],
  "primitive": "choice"
}
字段 类型 说明
state string 当前环境、上下文和约束
question string 需要模型作出的决策
options list[string] 动态候选项,最多 26 个
primitive string choicenoulscore
score_values list[number] score 原语对应的数值,可选

推理脚本会在计算概率前验证每个候选标记都是唯一且稳定的单 token continuation。

评测结果

BFCL V4 冻结测试包含 2,371 个独立语义案例,每个案例使用三种候选顺序:

模型 Accuracy Macro-F1 NLL Brier ECE
Qwen3-4B 70.42% 0.528 1.324 0.498 0.229
CandiGate v1 74.20% 0.572 1.336 0.455 0.203
CandiGate-Qwen3-4B 80.29% 0.654 1.375 0.367 0.174
CandiGate + 校准 80.29% 0.654 1.104 0.361 0.166
  • live_irrelevance:基座 38.11%,v1 46.38%,本模型 60.56%;
  • 三种候选顺序下预测不变率:93.76%;
  • 相比 v1,168 个独立案例由错变对,27 个由对变错;
  • 1,956 条内部冻结测试准确率:96.27%;
  • 16 个独立多步 Agent 场景、三次候选重排的轨迹成功率:79.17%。

BFCL 仅用于评测,没有进入训练、验证或校准划分。

校准

choicenoul 推荐使用 calibration.json 中的温度 1.2637946123score 使用温度 1.0

训练数据

  • MASSIVE 中英文意图选择样本;
  • 可审计规则生成的 Agent 决策数据;
  • 按模板和语义簇分组的训练、验证、校准与测试划分。

MASSIVE 使用 CC BY 4.0,详细署名见 THIRD_PARTY_NOTICES.md

使用边界

  • live_irrelevance 准确率为 60.56%,无合适工具时仍可能发生误选;
  • 多步 Agent 评测目前包含 16 个独立语义场景;
  • score 与其他决策原语之间仍存在多任务干扰;
  • 高风险外部操作应配合权限系统、参数验证和人工确认;
  • 复现实验结果需要使用仓库提供的候选 token 检查和 restricted-logit 流程。

许可证

CandiGate-Qwen3-4B 以 Apache License 2.0 发布。第三方模型和数据集继续适用 各自的许可证与署名要求。Qwen3-4B 基座和训练数据的完整署名见 THIRD_PARTY_NOTICES.md

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for CullenYap/CandiGate-Qwen3-4B

Finetuned
Qwen/Qwen3-4B
Adapter
(1159)
this model

Dataset used to train CullenYap/CandiGate-Qwen3-4B