sim-square-broad-r00-baseline-idql
Part of Mulligan. Browse evaluations at Policy Arena; the datasets are in the mulligan organization.
State-based IDQL agent: diffusion actor with scalar IQL critic (policy.pt, a PyTorch checkpoint, and stats.json normalizers).
| Property | Value |
|---|---|
| Task | sim-square-broad |
| Model round | R0 |
| Arm | baseline |
| Campaign cell | sq_d1_r0_baseline_uniform |
| Seeds | 1, 2, 3, 4, 5 (one folder per seed) |
| Training step | 250001 |
Checkpoints
| Folder | Training run config |
|---|---|
seed-1 |
release/run-configs/sim-square-broad-r00-baseline-idql__seed-1.json |
seed-2 |
release/run-configs/sim-square-broad-r00-baseline-idql__seed-2.json |
seed-3 |
release/run-configs/sim-square-broad-r00-baseline-idql__seed-3.json |
seed-4 |
release/run-configs/sim-square-broad-r00-baseline-idql__seed-4.json |
seed-5 |
release/run-configs/sim-square-broad-r00-baseline-idql__seed-5.json |
Evaluations
Held-out initial-state grid; per-rollout outcomes are in the linked dataset.
| Dataset | Folder | N | Successes |
|---|---|---|---|
| sim-square-broad-r00-r03-eval | seed-1 |
1 | 15028/30000 |
| sim-square-broad-r00-r03-eval | seed-1 |
32 | 14654/30000 |
| sim-square-broad-r00-r03-eval | seed-2 |
1 | 16092/30000 |
| sim-square-broad-r00-r03-eval | seed-2 |
32 | 15550/30000 |
| sim-square-broad-r00-r03-eval | seed-3 |
1 | 14688/30000 |
| sim-square-broad-r00-r03-eval | seed-3 |
32 | 14125/30000 |
| sim-square-broad-r00-r03-eval | seed-4 |
1 | 15457/30000 |
| sim-square-broad-r00-r03-eval | seed-4 |
32 | 14637/30000 |
| sim-square-broad-r00-r03-eval | seed-5 |
1 | 15073/30000 |
| sim-square-broad-r00-r03-eval | seed-5 |
32 | 14676/30000 |
Data
Trained on: sim-square-broad-c00-teleop-baseline.
Referenced by the metadata of: sim-square-broad-c01-auto-bc-n1-shared-policy-rollouts, sim-square-broad-c01-auto-iql-n32-policy-rollouts, sim-square-broad-r00-r03-eval.
Provenance
SHA-256 of every file is recorded in release.json. .pt files are PyTorch pickles; load them only in a trusted environment.
The run configs are in the Mulligan code repository; the recipes there retrain each checkpoint. License: mit.