PPO Agent - LunarLander-v2

PPO reinforcement learning agent for LunarLander-v2.

Environment

  • Environment: LunarLander-v2
  • Algorithm: PPO
  • Policy: MlpPolicy

Evaluation

Mean reward: 220.91

Standard deviation: 67.74

Certification reward: 153.17

Certification reward = mean reward - standard deviation.

Training

The PPO agent was trained for LunarLander and saved as a Stable-Baselines3 model.

Downloads last month
-
Video Preview
loading

Evaluation results