Instructions to use Terrano09/midband-ten-set2-iter4-GRPO40 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Terrano09/midband-ten-set2-iter4-GRPO40 with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
Midband Ten Set2 iter4 GRPO40
Portable PEFT LoRA checkpoints from midband-ten-set2-iter4-grpo40-spot-20260831-205120.
Selected checkpoint
The selected release checkpoint is iter_0000025. Selection basis: best training-monitor checkpoint (Pass@1 0.71484375; Pass@2 0.8371975806451613); iter 39 was evaluated but is not labeled best.
| Field | Value |
|---|---|
| Base model | zai-org/GLM-4.7-Flash@7dd20894a642a0aa287e9827cb1a1f7f91386b67 |
| Adapter SHA-256 | fc27e6ec9bfeef5c33c7769cef5a1fb62d65dabb85c9bd8efb4a0c0daa5ec400 |
| LoRA rank / alpha | 16 / 32 |
| Target modules | q_a_proj, kv_a_proj_with_mqa, o_proj, gate_proj, up_proj, down_proj |
| Planned updates | 40 |
| Run outcome | Completed all 40 updates, warm-started from iter 4 of midband-ten-set2-stable-grpo40-spot-20260831-133241. |
| Training data | Midband_Ten_Set2_GRPO40_train.jsonl, 80 rows |
| Training-data SHA-256 | c5f4516933a733c0b63edc7b2bcf35afc1367bb788adefa514fee5ca832ca4a9 |
| Training-manifest SHA-256 | 820086e7e749d38a3e82f6fa3971b544929bc6f315d448265753d2fcc3df2df2 |
Post-training evaluations
Each row uses only its selected best four receipt-verified trials (26 tasks per trial, 104 task evaluations). Iterations are reported separately.
| Checkpoint | Pass@1 trial scores | Pass@1 mean | Turn-2 trial scores | Turn-2 mean |
|---|---|---|---|---|
iter_0000019 |
9, 9, 9, 9 | 9/26 | 13, 14, 11, 9 | 11.75/26 |
| Checkpoint | Pass@1 SD; range; task-bootstrap 95% CI (out of 26) | Turn-2 SD; range; task-bootstrap 95% CI (out of 26) | Conditional turn-2 recovery |
|---|---|---|---|
iter_0000019 |
0.00; 9-9; 5.75-12.5 | 2.22; 9-14; 8.25-15.25 | 11/68 (16.2%; CI 8.3-25.4%) |
Evaluation used fixed26-contract-v2, thinking enabled, temperature 0.7, top-p 1.0, and a 32,768-token response limit. The complete selected run IDs and byte-for-byte receipts are under evaluations/.
Secondary single-trial checks
These checks are disclosed separately and are not mixed into the four-trial iter-19 aggregate.
| Checkpoint | Run ID | Pass@1 | Turn 2 |
|---|---|---|---|
iter_0000025 |
midband-set2-iter25-fixed26-contractv2-thinking-20260901T211642Z |
8/26 | 12/26 |
iter_0000039 |
midband-set2-iter39-fixed26-contractv2-thinking-20260901T211642Z |
8/26 | 10/26 |
The iter-39 check does not change the selection label: iter_0000025 remains the best checkpoint by the training-monitor criterion above.
Training data
80 Set2 rows: 8 each for allergies, circular-buffer, clock, complex-numbers, grade-school, parallel-letter-frequency, perfect-numbers, phone-number, robot-name, and spiral-matrix.
The exact JSONL and its source manifest are included at the repository root. Their hashes are checked during release construction.
Checkpoints
Every checkpoint directory contains only the two portable inference artifacts: adapter_config.json and adapter_model.bin. Megatron tensor-parallel shards, optimizer state, and other training-only files are intentionally omitted.
| Checkpoint | Adapter SHA-256 |
|---|---|
iter_0000000 |
80482813aae92ca46bd3d86b0c9c10ec0acf8fab313d5186111805be21299f3f |
iter_0000001 |
27cc4636520839d8a9fe2a068127ca088eef431127230ca422cd9bcf94145887 |
iter_0000002 |
1a336810d9a0f11bd3846113cca8ea3cc2e3033b02fd44d580cd9ddfe20cbe82 |
iter_0000003 |
9f22fcf44b3f8f76655e2f747d0ef73dbcd6672ec4ac126c37dfd9b334fdb2ff |
iter_0000004 |
6e1ec5968871af2968d47cf5f1c39e68f00784e520e32d98a642dca5d046ce15 |
iter_0000005 |
823c93c50c90b52f20797246c06f65b5f2d908e1296449c5406f9e4dcddc6612 |
iter_0000006 |
472a47f8e4e87192690bd58a21170afdea89b570cf75d457a4055d5f439c04d1 |
iter_0000007 |
f24c56aaa8ae3a8a18beeb8aea928d2b43631d466ffe997d4cf2529e9979e667 |
iter_0000008 |
4dc1db616ce9d110f9435f3413da2724e49cae723bc038978cca224ff1ad187a |
iter_0000009 |
fd2680ea3a3fd22296acd1cba81e1f523f39943b4c65e9dbdc47c682784083d5 |
iter_0000010 |
3c4742b57f9f23fe981dd3161641a2946b9bbccf7c4a47bf006364adcd6c4fc5 |
iter_0000011 |
b74422ca9e92a213c54eb526a9ac42eeba99f09658c7510264b64c07ca2a8d9b |
iter_0000012 |
360861e9ee0ba5354aaa1f86153dacdc7dfc2344b0d200f2c824df2f66200c60 |
iter_0000013 |
e5073fdfa22e0499dfd818be5922f2528aaef369b2d92148b2a75a22327afa74 |
iter_0000014 |
1efc69bf2ebcaf37790ba1b701d198b99381a26b54b8093e3c454a2ac504515b |
iter_0000015 |
7aebdd0b7bc9b52d377c505a5168754d12bcca55e9ab5c32e38e48afcb055a3a |
iter_0000016 |
8fcd888a2f18c99f26179b9604fae8b5d84fe7cb06597a3d1d7809ed229b5066 |
iter_0000017 |
ae3475dda0659e0f5b111533e151041a94b229838bf823a5fe5607570dfa008f |
iter_0000018 |
261d138dd2b9699ad2da989687ac349103c0eab75836e348559aaadbd9160270 |
iter_0000019 |
987c7ebb0c81e0df3f02539a237bf8cae1e68add96843917b396aa276f98d1ed |
iter_0000020 |
fb3bacd02933a37b330f08edc728891880c2ee20f6199a98b6e032053b0dc086 |
iter_0000021 |
4d2405639e25fead59ff2ea691e706e6dbf760a2b47698eda80278b59525a036 |
iter_0000022 |
b7d4ee5a82bd739907359d57906062f9006ed4ba885e908fe09e044b58611bac |
iter_0000023 |
9b12fb0ab1431581648503ff8b7d1731daf14bdb696d6f7a18b58cfdfe93ffbd |
iter_0000024 |
e5f5640fa116ab3717fd4f02e46fea0461bea3cb93f3b42c272a0aff311096b0 |
iter_0000025 |
fc27e6ec9bfeef5c33c7769cef5a1fb62d65dabb85c9bd8efb4a0c0daa5ec400 |
iter_0000026 |
8f0f530012bb1bd845556bd6a2706bd83ec82cebf68723905e43d314ae7f66de |
iter_0000027 |
e45991c97f4778278be08d0e58d3e16db5939ad246e1945cc145cc5f58648d09 |
iter_0000028 |
15c66612d3a4386f930286a2bba8192ce3f3f7b9e23036a32e81de111a6d144f |
iter_0000029 |
780e211fbf6e96905a7ab42e69ad5e23a09749e833336062e491fd1e770d9acc |
iter_0000030 |
7985f595d2bca0c29e5ea8a3a865bac29e74419d9f3b057c81c3c8d6a32ae52d |
iter_0000031 |
911d1ce9841e66ab25dd5bf33bb06794290e006b08bb4c1bc21c2cfa95e7ed05 |
iter_0000032 |
80ad5da2edb9278f8f26cd8dff93d9d63369ebd545f57a9559995d8f8eae91f5 |
iter_0000033 |
2d1365a8e14ff98c1e71d46e01885514687a3f6331473ac5a413bb22f866e013 |
iter_0000034 |
c9866088ce5f0c5f5aebfeb1495a9e37835fee1c1637e6108f2d843f7f415ab8 |
iter_0000035 |
3a551de5b08695b9289c0fc9b04069336369334eb7fa7c51df2192f0f810e138 |
iter_0000036 |
e8219924e23771a59b90ca30e6be488c1999a0009143c5cdd9aa13c192901db1 |
iter_0000037 |
20c87ea9031c3116c5fd1c94ec2469baf08888cda1ccf2d2bf12c940571e787c |
iter_0000038 |
acb06f485146937a87b606f1d372fd1d680528f21243105262da754e5193399a |
iter_0000039 |
17a0343c9c73f725db2073cce02339f4f7f0de012be6f24bfd5e551f1abe8744 |
Loading
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = "zai-org/GLM-4.7-Flash"
checkpoint = "Terrano09/midband-ten-set2-iter4-GRPO40"
subfolder = "checkpoints/iter_0000025/adapter"
tokenizer = AutoTokenizer.from_pretrained(base, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(base, trust_remote_code=True)
model = PeftModel.from_pretrained(model, checkpoint, subfolder=subfolder)
Reproduction and evidence
The release includes the exact training JSONL and manifest plus four aggregate receipts and eight shard receipts for each reported evaluation row. Checksum files bind each evidence bundle.
These are assisted Fixed26 regression results using selected best-four cohorts, not pristine held-out benchmark claims. The Generalized C++ dataset, where applicable, explicitly overlaps six Fixed26 task IDs; consult its included manifest before comparing results.
- Downloads last month
- -
Model tree for Terrano09/midband-ten-set2-iter4-GRPO40
Base model
zai-org/GLM-4.7-Flash