Q-Learning Agent playing Taxi-v3
This is a trained Q-Learning agent playing Taxi-v3.
Training
- Algorithm: Q-Learning
- Environment: Taxi-v3
- Training episodes: 25,000
- Learning rate: 0.7
- Discount factor: 0.95
- Maximum steps: 99
- Maximum epsilon: 1.0
- Minimum epsilon: 0.05
- Epsilon decay rate: 0.005
Evaluation
Mean reward: 7.52 +/- 2.73
Certification score:
7.52 - 2.73 = 4.79
Required score: 4.5
Model
The trained Q-table is stored in q-learning.pkl.
Evaluation results
- Mean reward on Taxi-v3self-reported7.520