Instructions to use keryszhan/klear-agentforge-8b-ppo-step20-adapter with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use keryszhan/klear-agentforge-8b-ppo-step20-adapter with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Kwai-Klear/Klear-AgentForge-8B-SFT") model = PeftModel.from_pretrained(base_model, "keryszhan/klear-agentforge-8b-ppo-step20-adapter") - Notebooks
- Google Colab
- Kaggle
Klear-AgentForge-8B-SFT 的 PPO 第 20 步 LoRA 适配器
这是 Harbor Qwen 工具调用代码智能体强化学习项目产生的实验性策略模型 LoRA 适配器,对应父 PPO 检查点:
20260820T154406Z/global_step_20
该适配器用于研究 Harbor 沙箱奖励、rLLM、veRL、独立 vLLM 推理服务以及原生价值模型/GAE PPO 的端到端训练链路。它不是经过验证的能力提升版本,不应使用“最佳模型”或“增强模型”等表述。
基础模型
Kwai-Klear/Klear-AgentForge-8B-SFT
基础模型文件需要在 Hugging Face 页面同意访问条件后才能下载。适配器仓库不包含基础模型权重。
项目使用的固定基础模型版本提交为:
0da97e45dbbd44278bd55b878170ec369d2934fb
适配器信息
| 项目 | 数值 |
|---|---|
| LoRA 秩 | 32 |
| LoRA 缩放系数 | 16 |
| 权重张量数 | 504 |
| 权重文件字节数 | 174,656,008 |
| 权重文件大小 | 约 166.6 MiB |
| 完整策略模型检查点目录字节数 | 186,086,224 |
| 完整策略模型检查点目录大小 | 约 177.5 MiB |
| PPO 检查点步数 | 20 |
目标模块:
down_proj
gate_proj
k_proj
o_proj
q_proj
up_proj
v_proj
checkpoint-summary.json 中的 actor_bytes=186086224 统计整个策略模型目录,其中包含 LoRA 权重、适配器配置以及 Hugging Face 模型辅助配置。adapter_model.safetensors 本身为 174,656,008 字节。因此,177.5 MiB 指完整策略模型检查点目录,而不是单独的适配器权重文件。
文件完整性
| 文件 | SHA-256 |
|---|---|
adapter_model.safetensors |
dff191e4c157f2da0079f8f367650f52146c7e58b1a1adc77ba91fc42af9bdb9 |
原始 adapter_config.json |
3a42960a1b0d18b79d94207bbc4a30071b7c6ac7f60cb6a4c8fb0fd066f8ff8c |
原始 checkpoint-summary.json |
2280879e7918c7627eecee1e744df2770a840d629fa882c3de53a547d3ce04c9 |
公开仓库中的 adapter_config.json 会把原始 AutoDL 本地路径替换为基础模型仓库标识,因此其摘要将与上表中的原始配置摘要不同。LoRA 权重文件不会修改,其摘要必须保持一致。
训练数据
训练使用冻结数据集:
keryszhan/harbor-swesmith-rl-artifacts
正式切分为训练集 187 题、验证集 42 题和测试集 38 题,共覆盖 89 个代码仓库。冻结切分语义摘要为:
ae5df9a3f4a3fc8af44fac420b36529e283839e1bd3de9daba65d5bcda51447d
训练方式
该检查点来自独立 PPO 对照实验,不是 Klear-AgentForge 论文中 revised GRPO 的严格复现。
训练链路包括:
- 4 张 GPU 运行策略模型和价值模型的 FSDP 训练;
- 1 张 GPU 运行独立的单实例 vLLM 推理服务;
- Harbor 负责隔离任务执行并返回可验证的终端奖励;
- 使用原生价值模型、GAE、裁剪策略更新和价值函数更新;
- 策略模型以 LoRA 形式保存,价值模型单独保存为 BF16 模型分片;
- 本仓库只发布策略模型 LoRA,不发布价值模型、优化器、随机状态或基础模型权重。
统一 64K P0 评测
原始 SFT 模型与本父 PPO 检查点使用相同的 64K 协议、任务、智能体配置、随机种子和每题一次采样进行任务级配对评测。
| 面板 | 原始 SFT | 父 PPO 第 20 步 | 配对结果 | 精确 McNemar 检验 |
|---|---|---|---|---|
| 冻结 SWE-Smith 测试集 | 6/38 | 6/38 | 3 胜、32 平、3 负 | p=1.0 |
| SWE-bench Verified 27 题 | 9/27 | 9/27 | 2 胜、23 平、2 负 | p=1.0 |
父 PPO 检查点在两个面板分别增加约 47.7% 和 46.8% 的平均输入词元,智能体步数分别增加约 19.2% 和 27.0%,运行时间约为原始 SFT 的 2.33 倍和 2.24 倍,但没有增加总体成功数。
因此,本仓库只提供训练产物和复现实验证据,不宣称 PPO 带来了稳定的整体能力提升。
加载方式
使用前需要先取得基础模型访问权限:
import torch
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base_model_id = "Kwai-Klear/Klear-AgentForge-8B-SFT"
adapter_id = "keryszhan/klear-agentforge-8b-ppo-step20-adapter"
tokenizer = AutoTokenizer.from_pretrained(base_model_id)
base_model = AutoModelForCausalLM.from_pretrained(
base_model_id,
torch_dtype=torch.bfloat16,
device_map="auto",
)
model = PeftModel.from_pretrained(
base_model,
adapter_id,
)
该模型面向工具调用代码智能体协议。仅加载权重并进行普通文本生成,不能自动复现 Harbor 沙箱、mini-swe-agent-plus、上下文保护、工具执行和任务验证流程。
局限性
- 统一 P0 评测没有证明总体能力提升。
- 每题仅采样一次,任务级结果存在明显翻转。
- 训练成功集中在少数任务,不能代表广泛的软件工程能力。
- 基础模型、智能体脚手架、上下文长度和采样协议变化都会影响结果。
- 适配器不能脱离受限访问的基础模型独立使用。
- 本仓库不包含训练价值模型,因此不能直接恢复完整 PPO 训练状态。
许可证与访问条件
基础模型页面标注 MIT 许可证,但文件访问需要同意 Hugging Face 页面上的联系信息共享条件。使用者必须自行完成基础模型授权,并遵守基础模型、数据集及各任务上游仓库的许可要求。
关联仓库
- 项目报告:
keryszhan/harbor-qwen-grpo-experiment - 训练数据:
keryszhan/harbor-swesmith-rl-artifacts
- Downloads last month
- 6
Model tree for keryszhan/klear-agentforge-8b-ppo-step20-adapter
Base model
Kwai-Klear/Klear-AgentForge-8B-SFT