PPO LunarLander-v2

Deep Reinforcement Learning Course — Unit 1.

Evaluation

Environment: LunarLander-v2

Mean reward: 269.79

Standard deviation: 20.99

Course score: 248.80

Evaluation episodes: 20

Training timesteps: 1,000,000

Downloads last month
22
Video Preview
loading

Evaluation results