Klear-AgentForge-8B-SFT 的 PPO 第 20 步 LoRA 适配器

这是 Harbor Qwen 工具调用代码智能体强化学习项目产生的实验性策略模型 LoRA 适配器,对应父 PPO 检查点:

20260820T154406Z/global_step_20

该适配器用于研究 Harbor 沙箱奖励、rLLM、veRL、独立 vLLM 推理服务以及原生价值模型/GAE PPO 的端到端训练链路。它不是经过验证的能力提升版本,不应使用“最佳模型”或“增强模型”等表述。

基础模型

Kwai-Klear/Klear-AgentForge-8B-SFT

基础模型文件需要在 Hugging Face 页面同意访问条件后才能下载。适配器仓库不包含基础模型权重。

项目使用的固定基础模型版本提交为:

0da97e45dbbd44278bd55b878170ec369d2934fb

适配器信息

项目 数值
LoRA 秩 32
LoRA 缩放系数 16
权重张量数 504
权重文件字节数 174,656,008
权重文件大小 约 166.6 MiB
完整策略模型检查点目录字节数 186,086,224
完整策略模型检查点目录大小 约 177.5 MiB
PPO 检查点步数 20

目标模块:

down_proj
gate_proj
k_proj
o_proj
q_proj
up_proj
v_proj

checkpoint-summary.json 中的 actor_bytes=186086224 统计整个策略模型目录,其中包含 LoRA 权重、适配器配置以及 Hugging Face 模型辅助配置。adapter_model.safetensors 本身为 174,656,008 字节。因此,177.5 MiB 指完整策略模型检查点目录,而不是单独的适配器权重文件。

文件完整性

文件 SHA-256
adapter_model.safetensors dff191e4c157f2da0079f8f367650f52146c7e58b1a1adc77ba91fc42af9bdb9
原始 adapter_config.json 3a42960a1b0d18b79d94207bbc4a30071b7c6ac7f60cb6a4c8fb0fd066f8ff8c
原始 checkpoint-summary.json 2280879e7918c7627eecee1e744df2770a840d629fa882c3de53a547d3ce04c9

公开仓库中的 adapter_config.json 会把原始 AutoDL 本地路径替换为基础模型仓库标识,因此其摘要将与上表中的原始配置摘要不同。LoRA 权重文件不会修改,其摘要必须保持一致。

训练数据

训练使用冻结数据集:

keryszhan/harbor-swesmith-rl-artifacts

正式切分为训练集 187 题、验证集 42 题和测试集 38 题,共覆盖 89 个代码仓库。冻结切分语义摘要为:

ae5df9a3f4a3fc8af44fac420b36529e283839e1bd3de9daba65d5bcda51447d

训练方式

该检查点来自独立 PPO 对照实验,不是 Klear-AgentForge 论文中 revised GRPO 的严格复现。

训练链路包括:

  • 4 张 GPU 运行策略模型和价值模型的 FSDP 训练;
  • 1 张 GPU 运行独立的单实例 vLLM 推理服务;
  • Harbor 负责隔离任务执行并返回可验证的终端奖励;
  • 使用原生价值模型、GAE、裁剪策略更新和价值函数更新;
  • 策略模型以 LoRA 形式保存,价值模型单独保存为 BF16 模型分片;
  • 本仓库只发布策略模型 LoRA,不发布价值模型、优化器、随机状态或基础模型权重。

统一 64K P0 评测

原始 SFT 模型与本父 PPO 检查点使用相同的 64K 协议、任务、智能体配置、随机种子和每题一次采样进行任务级配对评测。

面板 原始 SFT 父 PPO 第 20 步 配对结果 精确 McNemar 检验
冻结 SWE-Smith 测试集 6/38 6/38 3 胜、32 平、3 负 p=1.0
SWE-bench Verified 27 题 9/27 9/27 2 胜、23 平、2 负 p=1.0

父 PPO 检查点在两个面板分别增加约 47.7% 和 46.8% 的平均输入词元,智能体步数分别增加约 19.2% 和 27.0%,运行时间约为原始 SFT 的 2.33 倍和 2.24 倍,但没有增加总体成功数。

因此,本仓库只提供训练产物和复现实验证据,不宣称 PPO 带来了稳定的整体能力提升。

加载方式

使用前需要先取得基础模型访问权限:

import torch
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base_model_id = "Kwai-Klear/Klear-AgentForge-8B-SFT"
adapter_id = "keryszhan/klear-agentforge-8b-ppo-step20-adapter"

tokenizer = AutoTokenizer.from_pretrained(base_model_id)

base_model = AutoModelForCausalLM.from_pretrained(
    base_model_id,
    torch_dtype=torch.bfloat16,
    device_map="auto",
)

model = PeftModel.from_pretrained(
    base_model,
    adapter_id,
)

该模型面向工具调用代码智能体协议。仅加载权重并进行普通文本生成,不能自动复现 Harbor 沙箱、mini-swe-agent-plus、上下文保护、工具执行和任务验证流程。

局限性

  • 统一 P0 评测没有证明总体能力提升。
  • 每题仅采样一次,任务级结果存在明显翻转。
  • 训练成功集中在少数任务,不能代表广泛的软件工程能力。
  • 基础模型、智能体脚手架、上下文长度和采样协议变化都会影响结果。
  • 适配器不能脱离受限访问的基础模型独立使用。
  • 本仓库不包含训练价值模型,因此不能直接恢复完整 PPO 训练状态。

许可证与访问条件

基础模型页面标注 MIT 许可证,但文件访问需要同意 Hugging Face 页面上的联系信息共享条件。使用者必须自行完成基础模型授权,并遵守基础模型、数据集及各任务上游仓库的许可要求。

关联仓库

  • 项目报告:keryszhan/harbor-qwen-grpo-experiment
  • 训练数据:keryszhan/harbor-swesmith-rl-artifacts
Downloads last month
6
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for keryszhan/klear-agentforge-8b-ppo-step20-adapter

Adapter
(1)
this model

Dataset used to train keryszhan/klear-agentforge-8b-ppo-step20-adapter

Space using keryszhan/klear-agentforge-8b-ppo-step20-adapter 1