Reinforce Agent playing CartPole-v1

This is a trained REINFORCE agent playing CartPole-v1.

Algorithm

REINFORCE / Monte Carlo Policy Gradient

Environment

CartPole-v1

Training

  • Training episodes: 1000
  • Hidden size: 16
  • Learning rate: 0.01
  • Gamma: 1.0
  • Maximum steps: 1000

Evaluation

Mean reward: 500.00

Standard deviation: 0.00

Result:

500.00

The Hugging Face Unit 4 certification result is:

mean reward - standard deviation

Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading

Evaluation results