YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
maze-transformer — 强制观测(obs4)·纯强化学习 反应式迷宫导航
规格(逐字落地):生成序列是上下左右(U/D/L/R)。每移动一步后,环境强制插入
四周 4 格(U,D,L,R 顺序;. 路 / # 墙,越界算墙),恒为真实。模型只自产
动作 + 分隔符(, 中途 / ! 声称到达 / <EOS> 停止)。合法即移动一步;
非法(墙/越界)则直接不动(验证器按此判真)。到达 G → 奖励 1.0。
零预训练:随机初始化,纯 on-policy RL(GRPO 主 / REINFORCE 对照)+ 熵奖励 +
难度锚定 min_steps_reward;验证器 parse_run(data.py)按上述规则判真。
权重
checkpoints/l2_d64_maze_forced_obs_rl_final.pt★ 交付(环境喂观测 GRPO 最终)checkpoints/l2_d64_maze_rnn_rl_ref.pt(GRU 对照,仅对照)checkpoints/l2_d64_maze_sft_ref.pt(SFT 参考,仅对照)
运行:python -m maze_transformer.rl_nav --steps 120(GRPO,交付协议);
python -m maze_transformer.rl_rnn --steps 60 --min_size 5 --max_size 6(RNN 对照)。
三路对比(forced-obs 纯 RL 协议,验证器判真;合法即动/非法即停)
| 迷宫 | 完全随机 | RL-Transformer(交付) | RL-RNN(GRU) 对照 |
|---|---|---|---|
| 5x5 | 100% | 33% | 0% |
| 5x7 | 50% | 83% | — |
| 6x6 | 50% | 33% | 0% |
| 6x5 | 66% | 50% | 8% |
| 6x9 | 67% | 50% | — |
| mean_illegal | 40-70(横冲直撞) | 8-25(学会先看墙) | 47-57(学不会躲墙) |
结论(如实):Transformer 在 forced-obs 稀疏奖励下 120 步引导出「先看墙再动」; GRU-RNN 同协议 60 步几乎不引导(reached≤8%、illegal 高);随机基线仅小尺寸靠乱走 碰运气。详见 RESULTS.md;问题/方案/修改/测试 四段式全记录见 QUESTIONS.md。
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support