MMPAE 1.5B E260 2GPU BS128 LR5e-5 Beta2000
Checkpoint and evaluation artifacts for mmpae-1p5B-e260-2gpu-bs128-lr5e5-b2000.
Training
- Config:
configs/Inverse_CwA_1p5B.yaml - Parameters: about 1.496B
- Epochs: 260
- Batch size: 128
- Learning rate: 5e-5
- Alpha: 100
- Beta: 2000
- Dataset path in training:
/data/polyone_tokenized - Tokenizer path in training:
/data/polyBERT
Final Validation Metrics
{
"actual_params": 1495526443,
"best_checkpoint_path": "/data/runs/mmpae-1p5B-e260-2gpu-bs128-lr5e5-b2000/Checkpoint_BEST.pt",
"checkpoint_path": "/data/runs/mmpae-1p5B-e260-2gpu-bs128-lr5e5-b2000/Polyone_AE_0260.pt",
"epoch": 260,
"epochs": 260,
"eval": {
"ce_loss": 0.06199822479529171,
"contrast_loss": 1.667678924016235,
"eos_loss": 0.004588520026621823,
"eval_batches": 1954,
"eval_seconds": 2812.8629097938538,
"infer_batches": 10,
"infer_samples": 1280,
"infer_seconds": 61.243648052215576,
"inv_r2": 0.8862593219244033,
"inv_rmse": 0.31655585015420434,
"mse_loss": 1.1142550623587724,
"prop_r2": 0.9547484576702118,
"prop_rmse": 0.20580836683511733,
"sim_score": 0.5962892207249391,
"total_loss": 3446.84535515589,
"validity": 0.97734375
},
"exp_id": "mmpae-1p5B-e260-2gpu-bs128-lr5e5-b2000",
"experiment_plan_metrics": {
"Actual params from log": 1495526443,
"Best Prop R2 \u2191": 0.9547484576702118,
"Best Prop RMSE \u2193": 0.20580836683511733,
"Exp ID": "mmpae-1p5B-e260-2gpu-bs128-lr5e5-b2000",
"Final ce_loss": 0.06199822479529171,
"Final contrast_loss": 1.667678924016235,
"Final epoch": 260,
"Final mse_loss": 1.1142550623587724,
"Final total_loss": 3446.84535515589,
"Notes": "infer_steps=10, eval_steps=None",
"Peak GPU memory": 94621.39013671875,
"Run directory": "/data/runs/mmpae-1p5B-e260-2gpu-bs128-lr5e5-b2000",
"Runtime": "56h 56m 25s",
"Tanimoto \u2191": 0.5962892207249391,
"Target R2 \u2191": 0.8862593219244033,
"Target RMSE \u2193": 0.31655585015420434,
"Validity \u2191": 0.97734375
},
"global_step": 266240,
"is_best": false,
"peak_gpu_memory_mb": 94621.39013671875,
"phase": "Eval",
"runtime": "56h 56m 25s",
"runtime_seconds": 204985.66281485558,
"score": 0.569703471770199,
"train": {
"ce_loss": 0.09326180632342584,
"contrast_loss": 0.8654914498329163,
"eos_loss": 0.011635430310889205,
"grad_norm": Infinity,
"mse_loss": 2.242397526046261,
"total_loss": 1955.3159149885178
}
}
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support