YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

maze-transformer — 强制观测(obs4)·纯强化学习 反应式迷宫导航

规格(逐字落地):生成序列是上下左右(U/D/L/R)。每移动一步后,环境强制插入 四周 4 格(U,D,L,R 顺序;. 路 / # 墙,越界算墙),恒为真实。模型只自产 动作 + 分隔符, 中途 / ! 声称到达 / <EOS> 停止)。合法即移动一步; 非法(墙/越界)则直接不动(验证器按此判真)。到达 G → 奖励 1.0。

零预训练:随机初始化,纯 on-policy RL(GRPO 主 / REINFORCE 对照)+ 熵奖励 + 难度锚定 min_steps_reward;验证器 parse_run(data.py)按上述规则判真。

权重

  • checkpoints/l2_d64_maze_forced_obs_rl_final.pt ★ 交付(环境喂观测 GRPO 最终)
  • checkpoints/l2_d64_maze_rnn_rl_ref.pt(GRU 对照,仅对照)
  • checkpoints/l2_d64_maze_sft_ref.pt(SFT 参考,仅对照)

运行:python -m maze_transformer.rl_nav --steps 120(GRPO,交付协议); python -m maze_transformer.rl_rnn --steps 60 --min_size 5 --max_size 6(RNN 对照)。

三路对比(forced-obs 纯 RL 协议,验证器判真;合法即动/非法即停)

迷宫 完全随机 RL-Transformer(交付) RL-RNN(GRU) 对照
5x5 100% 33% 0%
5x7 50% 83%
6x6 50% 33% 0%
6x5 66% 50% 8%
6x9 67% 50%
mean_illegal 40-70(横冲直撞) 8-25(学会先看墙) 47-57(学不会躲墙)

结论(如实):Transformer 在 forced-obs 稀疏奖励下 120 步引导出「先看墙再动」; GRU-RNN 同协议 60 步几乎不引导(reached≤8%、illegal 高);随机基线仅小尺寸靠乱走 碰运气。详见 RESULTS.md;问题/方案/修改/测试 四段式全记录见 QUESTIONS.md。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support