Reinforce Agent playing CartPole-v1
This is a trained model of a Reinforce agent playing CartPole-v1.
Mean reward over 10 evaluation episodes: 500.00 +/- 0.00
Hyperparameters
{'h_size': 16, 'n_training_episodes': 1000, 'n_evaluation_episodes': 10, 'max_t': 1000, 'gamma': 1.0, 'lr': 0.01, 'env_id': 'CartPole-v1', 'state_space': 4, 'action_space': np.int64(2)}
Evaluation results
- mean_reward on CartPole-v1self-reported500.00 +/- 0.00