Walker2d Self-Learned Adaptation Policy (v2)
Model policy bipedal locomotion adaptif permanen (Model v2) yang telah mengonsolidasikan pengalaman actuator failure langsung ke dalam bobot feedforward neural network menggunakan World-Model Discrepancy Guidance & Optimal LR ($3.0\times 10^{-5}$).
Hasil Komparasi Retensi (Episode 2 / Zero Trigger Retest)
- Total Steps: 515 steps (vs Baseline 445 steps) — +70 steps
- Fault Survival (Right Knee Jammed): 216 steps (vs Baseline 146 steps) — Peningkatan +47.9%
- Distance: +9.504 m
- Retention State: 100% Mengingat pola pemulihan tanpa trigger eksternal ulang.