Q-Learning Agent playing Taxi-v3

This is a trained Q-Learning agent playing Taxi-v3.

Training

  • Algorithm: Q-Learning
  • Environment: Taxi-v3
  • Training episodes: 25,000
  • Learning rate: 0.7
  • Discount factor: 0.95
  • Maximum steps: 99
  • Maximum epsilon: 1.0
  • Minimum epsilon: 0.05
  • Epsilon decay rate: 0.005

Evaluation

Mean reward: 7.52 +/- 2.73

Certification score:

7.52 - 2.73 = 4.79

Required score: 4.5

Model

The trained Q-table is stored in q-learning.pkl.

Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading

Evaluation results