Reinforce Agent playing CartPole-v1
This is a trained REINFORCE agent playing CartPole-v1.
Algorithm
REINFORCE / Monte Carlo Policy Gradient
Environment
CartPole-v1
Training
- Training episodes: 1000
- Hidden size: 16
- Learning rate: 0.01
- Gamma: 1.0
- Maximum steps: 1000
Evaluation
Mean reward: 500.00
Standard deviation: 0.00
Result:
500.00
The Hugging Face Unit 4 certification result is:
mean reward - standard deviation
Evaluation results
- mean_reward on CartPole-v1self-reported500.00 +/- 0.00