Chronos (Gen 9 Random Battles)

Autonomous reinforcement learning policy and value network (~9.65M parameters) for Pokémon Showdown Gen 9 Random Battles.

  • GitHub Repository: TurboRx/chronos-randbats
  • Engine: Tensor-native JAX battle simulator with hardware-accelerated rollouts
  • Framework: JAX / Flax / Optax

Architecture

  • Model: Non-Causal Transformer Encoder (~9.65M parameters)
  • Embedding Dimension (d_model): 256
  • Multi-Head Attention: 8 heads
  • Encoder Depth: 6 layers
  • Feed-Forward Dimension (d_ff): 1024
  • Heads:
    • Policy Head (9 actions: 4 moves, 5 switches)
    • Value Head (Scalar valuation in [-1, 1])
    • Opponent Prediction Head (Simultaneous action prediction)

Checkpoints

  • checkpoint_latest.pkl: Model parameters trained via PPO self-play and benchmark sparring.
  • metrics.json: Latest training metrics, update count, and turn counters.
Downloads last month
204
Video Preview
loading