SmolVLA LIBERO 100k parent model

个人复现的 100,000-step 父模型,不是定向微调子模型,也不是官方发布的 LIBERO teacher。

代码与实验记录:https://github.com/2021147571/smolvla-libero-100k-reproduction

训练来源

  • VLM 初始化:HuggingFaceTB/SmolVLM2-500M-Video-Instruct。
  • 冻结 VLM,训练动作专家及 state projection;没有从 LIBERO teacher 权重继续训练。
  • 数据:HuggingFaceVLA/libero,revision 86958911c0f959db2bbbdb107eb3e17c5f9c798e。
  • 100,000 steps,batch 64,seed 1000,AdamW,BF16 mixed precision。
  • 学习率 1e-4,warmup 1,000,cosine decay 30,000,最低 2.5e-6。详见 train_config.json。

输入和推理

两路图像 observation.images.image / observation.images.image2,8维 state,7维 action。 保留原始模型与归一化处理器,不要用新数据集统计量替换它们。 Action chunk size=50,flow matching num_steps=10。导出配置 n_action_steps=50;复现下面的1步成绩必须显式覆盖为1。 必须配套使用仓库中的 preprocessor/postprocessor 文件,不能仅加载网络权重。

本项目成绩(不是官方论文成绩)

执行几步后重新观察 Spatial Object Goal Long 总计
1 87/100 83/100 82/100 53/100 305/400;Short-300 252/300
10 84/100 95/100 89/100 未测 Short-300 268/300
50(早期) 69/100 75/100 71/100 未测 Short-300 215/300

每任务10个初始状态(0–9),seed1000,batch1,AMPfalse,flow积分10步。评测环境包含LeRobot0.6.1、MuJoCo3.8.1;与论文环境不保证一致。结果及审计见GitHub。

限制

模型只在仿真中评测,不保证真实机械臂安全。不能声称达到300/300或完全复现论文。尚未独立证明训练/测试状态无重叠;测试状态已被查看,未来确认实验应另设保留集。 上游模型、数据和代码的许可证分别适用;本上传不额外授予第三方资产的权利。

Downloads last month
8
Safetensors
Model size
0.5B params
Tensor type
F32
·
BF16
·
Video Preview
loading

Dataset used to train laroi0124/SmolVLA_100k_test