Instructions to use CullenYap/CandiGate-Qwen3-4B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use CullenYap/CandiGate-Qwen3-4B with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B") model = PeftModel.from_pretrained(base_model, "CullenYap/CandiGate-Qwen3-4B") - Notebooks
- Google Colab
- Kaggle
CandiGate-Qwen3-4B
CandiGate-Qwen3-4B 是基于 Hugging Face Hub 上的
Qwen/Qwen3-4B 训练的候选约束
Agent 决策 LoRA,目标是复现 Jev 的可观察决策行为。
CandiGate 代表 Candidate Logit Gate。模型不依赖自由文本生成来选择动作, 而是对经过验证的候选标记计算 restricted logits,通过一次因果语言模型前向计算 完成工具选择、无合适工具拒绝、二元判断、有序评分、授权、重试和完成判断。
模型信息
| 项目 | 内容 |
|---|---|
| Hub 仓库 | CullenYap/CandiGate-Qwen3-4B |
| 版本 | v0.1.0-0920 |
| 基座模型 | Qwen/Qwen3-4B |
| 模型类型 | PEFT LoRA adapter |
| LoRA 配置 | rank 16,alpha 32,dropout 0.05 |
| 目标模块 | q_proj、k_proj、v_proj、o_proj |
| 语言 | 中文、英文 |
| 许可证 | Apache-2.0 |
| 决策原语 | choice、noul、score |
本仓库提供训练完成的 LoRA adapter,基座权重由
Qwen/Qwen3-4B 单独加载。
使用 Transformers 与 PEFT
推荐 Python 3.12、CUDA GPU 和 BF16 推理环境。
git clone https://huggingface.co/CullenYap/CandiGate-Qwen3-4B
cd CandiGate-Qwen3-4B
pip install -r requirements.txt
仓库已包含可直接运行的 example_request.json:
python inference.py \
--base-model Qwen/Qwen3-4B \
--adapter CullenYap/CandiGate-Qwen3-4B \
--input example_request.json \
--temperature 1.2637946123
也可以使用 huggingface_hub 固定版本下载:
from huggingface_hub import snapshot_download
adapter_dir = snapshot_download(
repo_id="CullenYap/CandiGate-Qwen3-4B",
revision="v0.1.0-0920",
)
print(adapter_dir)
输出包含最终选择、置信度和全部候选的概率分布。score 原语还会返回
expected_score。
输入格式
{
"state": "用户需要查询成都当前天气。可用工具中只有天气查询能够访问实时天气数据。",
"question": "下一步应选择哪个工具?",
"options": ["天气查询", "日历查询", "拒绝执行"],
"primitive": "choice"
}
| 字段 | 类型 | 说明 |
|---|---|---|
state |
string | 当前环境、上下文和约束 |
question |
string | 需要模型作出的决策 |
options |
list[string] | 动态候选项,最多 26 个 |
primitive |
string | choice、noul 或 score |
score_values |
list[number] | score 原语对应的数值,可选 |
推理脚本会在计算概率前验证每个候选标记都是唯一且稳定的单 token continuation。
评测结果
BFCL V4 冻结测试包含 2,371 个独立语义案例,每个案例使用三种候选顺序:
| 模型 | Accuracy | Macro-F1 | NLL | Brier | ECE |
|---|---|---|---|---|---|
| Qwen3-4B | 70.42% | 0.528 | 1.324 | 0.498 | 0.229 |
| CandiGate v1 | 74.20% | 0.572 | 1.336 | 0.455 | 0.203 |
| CandiGate-Qwen3-4B | 80.29% | 0.654 | 1.375 | 0.367 | 0.174 |
| CandiGate + 校准 | 80.29% | 0.654 | 1.104 | 0.361 | 0.166 |
live_irrelevance:基座 38.11%,v1 46.38%,本模型 60.56%;- 三种候选顺序下预测不变率:93.76%;
- 相比 v1,168 个独立案例由错变对,27 个由对变错;
- 1,956 条内部冻结测试准确率:96.27%;
- 16 个独立多步 Agent 场景、三次候选重排的轨迹成功率:79.17%。
BFCL 仅用于评测,没有进入训练、验证或校准划分。
校准
choice 和 noul 推荐使用 calibration.json 中的温度
1.2637946123。score 使用温度 1.0。
训练数据
- MASSIVE 中英文意图选择样本;
- 可审计规则生成的 Agent 决策数据;
- 按模板和语义簇分组的训练、验证、校准与测试划分。
MASSIVE 使用 CC BY 4.0,详细署名见
THIRD_PARTY_NOTICES.md。
使用边界
live_irrelevance准确率为 60.56%,无合适工具时仍可能发生误选;- 多步 Agent 评测目前包含 16 个独立语义场景;
score与其他决策原语之间仍存在多任务干扰;- 高风险外部操作应配合权限系统、参数验证和人工确认;
- 复现实验结果需要使用仓库提供的候选 token 检查和 restricted-logit 流程。
许可证
CandiGate-Qwen3-4B 以 Apache License 2.0 发布。第三方模型和数据集继续适用
各自的许可证与署名要求。Qwen3-4B 基座和训练数据的完整署名见
THIRD_PARTY_NOTICES.md。
- Downloads last month
- -