ppo-PandaReachDense-v3

This model was trained as part of the Hugging Face Deep Reinforcement Learning Course.

Model Description

  • Environment: PandaReachDense-v3
  • Library: stable-baselines3
  • Algorithm: ppo
  • Mean Reward: -2.00 +/- 0.10

Evaluation Results

The model was evaluated on PandaReachDense-v3 and achieved an average reward of -2.00 with a standard deviation of 0.10.

Downloads last month
11
Video Preview
loading

Evaluation results