PPO Agent playing ML-Agents-Pyramids

This model was trained as part of the 🤗 Hugging Face Deep Reinforcement Learning Course by Lalith Kumar Raju (LalithKumarRaju).

Evaluation Results

  • Environment: ML-Agents-Pyramids
  • Mean Reward: 1.80 +/- 0.20
  • Baseline Requirement: $\ge -100$

Description

This repository contains the trained weights, configuration files, and evaluation metadata for Unit 5 P2.

Downloads last month
52
Video Preview
loading

Evaluation results