D24 v6.2-1

Public preservation release for the full branch of the D24 v6.2 ratio-20 experiment. This repository contains both the terminal midtraining state and its terminal SFT descendant.

Repository layout

  • Repository root: final SFT Transformers model (BF16, SimpleChatML).
  • midtrain-hf/: final midtraining Transformers model (BF16 base model).
  • megatron-midtrain/iter_0004226/: exact terminal Megatron checkpoint, including optimizer/training state.
  • megatron-midtrain/: trackers, completion receipt, and frozen config.
  • provenance/: frozen campaign tickets and SFT receipt/config.
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "sfanm/d24-v6.2-1"
sft_model = AutoModelForCausalLM.from_pretrained(repo, token=True)
sft_tokenizer = AutoTokenizer.from_pretrained(repo, token=True)

midtrain_model = AutoModelForCausalLM.from_pretrained(
    repo, subfolder="midtrain-hf", token=True
)

Lineage

Stage Source/final state
Pretraining iteration 84,527; 354,530,270,862 tokens
Midtraining iteration 4,226; 17,725,128,704 tokens
SFT iteration 1,773; 475,114,114 packed tokens

Historical midtraining used the experiment's branch-scaled WSD schedule: warmup_iters=177 and decay_iters=845 with cosine decay. SFT used a constant learning rate of 1e-4 from optimizer step zero with zero warmup.

Both portable exports contain 756,819,456 parameters in BF16. This repository is an artifact-preservation release with frozen lineage and integrity metadata.

Downloads last month
13
Safetensors
Model size
0.8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for sfanm/d24-v6.2-1

Finetuned
(2)
this model