FastWAM-TDAA

新增:2026-09-18 的 25 epoch 训练产物

2026-09-21 上传了两组 25 epoch / 13,625 步训练产物,与下方旧版 5 epoch 结果分别归档。

模型 训练目录 最终权重 训练监控视频
FastWAM 基线 配置与日志 step_013625.pt 216 个
TDAA Frozen 配置与日志 step_013625.pt 216 个

新版 Frozen 必须使用对应的 160k codec,与旧版 80k codec 不同。视频为训练开环监控;本次没有发布这两份新权重的完整闭环成功率,不能沿用下方旧版分数。

25 epoch 训练说明、超参数和下载方法 · 文件校验清单


以下为 2026-09-17 的 5 epoch 实验归档

本仓保存 RoboTwin 实测模型、TDAA codec、原始结果和 4,000 个视频

GitHub 代码 · 方法与复现 README · 完整结果表

方法与模式

在 FastWAM 中接入预训练 TDAA version3_bin24 编解码器,将 [32,14] 动作块编码为 [8,16] latent。策略在 latent 空间做 flow matching,再解码为 32 步绝对关节动作。decoder 使用任务向量和由已执行动作历史的 DCT24 特征生成的 phase;每个 episode 重置历史。

模式 配置 本次发布
FastWAM 基线 TDAA=false 已测试权重、结果与视频
TDAA Frozen TDAA=true frozen=true 已测试权重、结果与视频
TDAA 联合训练 TDAA=true frozen=false 代码支持,暂无已发布评测权重与成功率

frozen 控制整个 TDAA codec,FastWAM 策略仍参与训练。联合训练额外加入动作重构与进度预测损失。动作 token 从 32 个变为 8 个,仅表示动作表示压缩;本次没有端到端加速测量。

模型与资产

本节为旧版 5 epoch 模型及 80k codec。

模型 下载
FastWAM 基线 step_002725.pt
TDAA Frozen step_002725.pt

代码仓的下载工具按固定版本获取文件并校验 SHA-256。在代码仓安装环境后运行:

python scripts/download_models.py --model both
# 仅下载 codec 和统计等辅助资产
python scripts/download_models.py --assets-only
# 校验本地文件
python scripts/download_models.py --verify-only

权重保存到 checkpoints/released/{official,tdaa_frozen}/step_002725.pt。Wan VAE/T5/tokenizer 等基础模型、训练数据和 RoboTwin 仿真资产需另外准备,详见 GitHub 复现说明。本次不包含 optimizer/scheduler 完整训练状态。

训练超参数

本节仅记录旧版 5 epoch 配方;新增 25 epoch 配方见上方链接。

以下为 FastWAM 基线与 TDAA Frozen=True 两组实测训练的共同设置,已与各自保存的 config.yamltrain.log 核对。Frozen=False 入口继承这些默认值,但本次没有该模式的完整训练与评测记录。

超参数 实测值
GPU / 每卡 batch / 梯度累积 8 / 16 / 1
有效全局 batch 128
优化器 / betas / epsilon AdamW / (0.9, 0.95) / 1e-8
峰值学习率 / weight decay 1e-4 / 1e-2
学习率调度 线性 warmup → cosine
warmup 总步数的 5%,取整为 136 步
cosine 最低学习率 1e-6(峰值的 1%)
epoch / 实际 optimizer steps 5 / 2,725
梯度裁剪 / 随机种子 最大范数 1.0 / 42
训练精度 / 分布式 BF16 / DeepSpeed ZeRO-1,无 CPU offload
DataLoader workers 每进程 8
数据量 10 任务 × 50 轨迹,69,732 个完整训练窗口
动作 horizon / 原始动作维度 32 / 14
视频输入 三相机拼接,9 帧,384×320,帧间隔 4
视频 / 动作 flow loss 系数 1.0 / 1.0
日志 / 开环监控 / 定期保存间隔 10 / 500 / 2,500 optimizer steps;训练结束另存最终权重

2,725 = ceil(69,732 / 128) × 5max_steps 原配置为 null,由数据量和 epoch 自动计算;本次发布的是最终 step_002725.pt。训练内监控使用已参与训练的 episode 0,不是独立验证集。

模式差异 基线 Frozen=True Frozen=False(配置默认值)
动作预测形状 [32,14] [8,16] latent [8,16] latent
TDAA codec 不加载 FP32,全部冻结 FP32,与策略联合训练
额外重构 / progress MSE 系数 不适用 不计算 1.0 / 0.1
codec 学习率 不适用 不更新 与策略相同,共用上述调度

模型结构、归一化、调度推导与配置来源见 完整训练超参数说明

RoboTwin 实验结论

本节成功率仅对应旧版 5 epoch 权重。

实验为 robotwin_eval_20260917_sh_uv10 个任务,每任务 clean/random 各 100 次,每模型 2,000 次seed=42instruction_type=unseen、32 步动作 horizon、24 步重规划、10 步去噪。

模型 clean random 合计成功/总数 合并成功率
FastWAM 基线 20.6% 4.0% 246/2000 12.30%
TDAA Frozen 40.8% 6.3% 471/2000 23.55%

TDAA Frozen 在 clean、random 上分别提高 20.2、2.3 个百分点,合并提高 11.25 个百分点official 是本项目重训练对照组的目录名,以上不是 FastWAM 官方论文分数。

两组策略共享 10 个任务、500 条训练轨迹与 69,732 个完整窗口;训练内 val 是监控数据。上表来自独立 simulator 闭环评测,unseen 指指令类型,不表示未见任务。

改善存在任务差异:clean 的 press_stapler 从 33% 降至 3%,open_laptop 从 45% 降至 43%;random 均值仍为 6.3%。本次没有多次独立训练的均值/方差,也未隔离动作表示、历史条件、任务向量及归一化各自的贡献,不能解释为单组件消融结论。

代码、模型与第三方组件的来源说明见 GitHub READMETDAA 来源记录

Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading