This is a trained model of a Reinforce agent playing Pixelcopter-PLE-v0.
Mean reward: 23.3 Standard deviation: 16.888161534045086 Mean - standard deviation: 6.411838465954915
-