NLA (Natural Language Autoencoder) adapters for DeepSeek-V4-Flash-0731
All adapters (LoRA r128 a16 rsLoRA on q_a/q_b/kv_proj + shared-expert gate/up,
plus a dense-over-MoE bypass LoRA per MoE block) over the frozen base
deepseek-ai/DeepSeek-V4-Flash-0731. Activations: layer 28/43, injection =
embedding replacement at marker U+320E with alpha=95.5.
SFT warm starts (1 epoch each)
| dir | data | heldout metric |
|---|---|---|
| sft/av_sonnet | 364k Sonnet-4.6 halves | val_ppl 3.22 |
| sft/ar_sonnet | 364k Sonnet-4.6 halves | FVE 47.5% |
| sft/av_opus5 | 364k Opus-5 halves | val_ppl 3.89 |
| sft/ar_opus5 | 364k Opus-5 halves | FVE 56.6% |
| sft/av_opus5_union | 728k Opus-5 shared rows | val_ppl 3.70 |
| sft/ar_opus5_union | 728k Opus-5 shared rows | FVE 58.9% |
AR dirs are adapter-style critics (ar_lora_value_head.safetensors + ar_meta.json + dense adapters; rebuild = truncate base to 29 layers, inject, load). AV dirs are PEFT adapter dirs + moe_dense_lora.safetensors.
RL trajectory (GRPO, 8x128, lr 5e-5 / critic 4e-5, ongoing 1000-step run)
rl/iter_0000NN for NN in {50,100,150,175,200..400-by-25} (save cadence was 50 until step 175, then 25; run in progress, uploaded at step 400 where heldout FVE = 60.9% vs 58.9% gold-explanation reference). rl/critic_latest = co-trained critic @400. rl/optim_step400_backup.pt = optimizer state for exact resume. Warm start = sft/{av,ar}_opus5_union.
Datasets: hf.co/datasets/ceselder/easynla-dsv4-warmstart-opus5. wandb: wandb.ai/octahedral-systems/easynla-dsv4.
Model tree for ceselder/easynla-dsv4-flash-nla-ckpts
Base model
deepseek-ai/DeepSeek-V4-Flash-0731