FastWAM-TDAA
新增:2026-09-18 的 25 epoch 训练产物
2026-09-21 上传了两组 25 epoch / 13,625 步训练产物,与下方旧版 5 epoch 结果分别归档。
| 模型 | 训练目录 | 最终权重 | 训练监控视频 |
|---|---|---|---|
| FastWAM 基线 | 配置与日志 | step_013625.pt | 216 个 |
| TDAA Frozen | 配置与日志 | step_013625.pt | 216 个 |
新版 Frozen 必须使用对应的 160k codec,与旧版 80k codec 不同。视频为训练开环监控;本次没有发布这两份新权重的完整闭环成功率,不能沿用下方旧版分数。
25 epoch 训练说明、超参数和下载方法 · 文件校验清单
以下为 2026-09-17 的 5 epoch 实验归档
本仓保存 RoboTwin 实测模型、TDAA codec、原始结果和 4,000 个视频。
GitHub 代码 · 方法与复现 README · 完整结果表
方法与模式
在 FastWAM 中接入预训练 TDAA version3_bin24 编解码器,将 [32,14] 动作块编码为 [8,16] latent。策略在 latent 空间做 flow matching,再解码为 32 步绝对关节动作。decoder 使用任务向量和由已执行动作历史的 DCT24 特征生成的 phase;每个 episode 重置历史。
| 模式 | 配置 | 本次发布 |
|---|---|---|
| FastWAM 基线 | TDAA=false |
已测试权重、结果与视频 |
| TDAA Frozen | TDAA=true frozen=true |
已测试权重、结果与视频 |
| TDAA 联合训练 | TDAA=true frozen=false |
代码支持,暂无已发布评测权重与成功率 |
frozen 控制整个 TDAA codec,FastWAM 策略仍参与训练。联合训练额外加入动作重构与进度预测损失。动作 token 从 32 个变为 8 个,仅表示动作表示压缩;本次没有端到端加速测量。
模型与资产
本节为旧版 5 epoch 模型及 80k codec。
| 模型 | 下载 |
|---|---|
| FastWAM 基线 | step_002725.pt |
| TDAA Frozen | step_002725.pt |
- TDAA codec 与配置:
codec.pt、config.json、metadata.json、dataset_statistics.json、task_embeddings.json,来自 80,000 步 AE。 - 基线归一化统计。
- 完整评测目录与视频:基线、TDAA Frozen。
代码仓的下载工具按固定版本获取文件并校验 SHA-256。在代码仓安装环境后运行:
python scripts/download_models.py --model both
# 仅下载 codec 和统计等辅助资产
python scripts/download_models.py --assets-only
# 校验本地文件
python scripts/download_models.py --verify-only
权重保存到 checkpoints/released/{official,tdaa_frozen}/step_002725.pt。Wan VAE/T5/tokenizer 等基础模型、训练数据和 RoboTwin 仿真资产需另外准备,详见 GitHub 复现说明。本次不包含 optimizer/scheduler 完整训练状态。
训练超参数
本节仅记录旧版 5 epoch 配方;新增 25 epoch 配方见上方链接。
以下为 FastWAM 基线与 TDAA Frozen=True 两组实测训练的共同设置,已与各自保存的 config.yaml 和 train.log 核对。Frozen=False 入口继承这些默认值,但本次没有该模式的完整训练与评测记录。
| 超参数 | 实测值 |
|---|---|
| GPU / 每卡 batch / 梯度累积 | 8 / 16 / 1 |
| 有效全局 batch | 128 |
| 优化器 / betas / epsilon | AdamW / (0.9, 0.95) / 1e-8 |
| 峰值学习率 / weight decay | 1e-4 / 1e-2 |
| 学习率调度 | 线性 warmup → cosine |
| warmup | 总步数的 5%,取整为 136 步 |
| cosine 最低学习率 | 1e-6(峰值的 1%) |
| epoch / 实际 optimizer steps | 5 / 2,725 |
| 梯度裁剪 / 随机种子 | 最大范数 1.0 / 42 |
| 训练精度 / 分布式 | BF16 / DeepSpeed ZeRO-1,无 CPU offload |
| DataLoader workers | 每进程 8 |
| 数据量 | 10 任务 × 50 轨迹,69,732 个完整训练窗口 |
| 动作 horizon / 原始动作维度 | 32 / 14 |
| 视频输入 | 三相机拼接,9 帧,384×320,帧间隔 4 |
| 视频 / 动作 flow loss 系数 | 1.0 / 1.0 |
| 日志 / 开环监控 / 定期保存间隔 | 10 / 500 / 2,500 optimizer steps;训练结束另存最终权重 |
2,725 = ceil(69,732 / 128) × 5。max_steps 原配置为 null,由数据量和 epoch 自动计算;本次发布的是最终 step_002725.pt。训练内监控使用已参与训练的 episode 0,不是独立验证集。
| 模式差异 | 基线 | Frozen=True | Frozen=False(配置默认值) |
|---|---|---|---|
| 动作预测形状 | [32,14] |
[8,16] latent |
[8,16] latent |
| TDAA codec | 不加载 | FP32,全部冻结 | FP32,与策略联合训练 |
| 额外重构 / progress MSE 系数 | 不适用 | 不计算 | 1.0 / 0.1 |
| codec 学习率 | 不适用 | 不更新 | 与策略相同,共用上述调度 |
模型结构、归一化、调度推导与配置来源见 完整训练超参数说明。
RoboTwin 实验结论
本节成功率仅对应旧版 5 epoch 权重。
实验为 robotwin_eval_20260917_sh_uv:10 个任务,每任务 clean/random 各 100 次,每模型 2,000 次;seed=42、instruction_type=unseen、32 步动作 horizon、24 步重规划、10 步去噪。
| 模型 | clean | random | 合计成功/总数 | 合并成功率 |
|---|---|---|---|---|
| FastWAM 基线 | 20.6% | 4.0% | 246/2000 | 12.30% |
| TDAA Frozen | 40.8% | 6.3% | 471/2000 | 23.55% |
TDAA Frozen 在 clean、random 上分别提高 20.2、2.3 个百分点,合并提高 11.25 个百分点。official 是本项目重训练对照组的目录名,以上不是 FastWAM 官方论文分数。
两组策略共享 10 个任务、500 条训练轨迹与 69,732 个完整窗口;训练内 val 是监控数据。上表来自独立 simulator 闭环评测,unseen 指指令类型,不表示未见任务。
改善存在任务差异:clean 的 press_stapler 从 33% 降至 3%,open_laptop 从 45% 降至 43%;random 均值仍为 6.3%。本次没有多次独立训练的均值/方差,也未隔离动作表示、历史条件、任务向量及归一化各自的贡献,不能解释为单组件消融结论。
代码、模型与第三方组件的来源说明见 GitHub README及 TDAA 来源记录。