NLA (Natural Language Autoencoder) adapters for DeepSeek-V4-Flash-0731

All adapters (LoRA r128 a16 rsLoRA on q_a/q_b/kv_proj + shared-expert gate/up, plus a dense-over-MoE bypass LoRA per MoE block) over the frozen base deepseek-ai/DeepSeek-V4-Flash-0731. Activations: layer 28/43, injection = embedding replacement at marker U+320E with alpha=95.5.

SFT warm starts (1 epoch each)

dir data heldout metric
sft/av_sonnet 364k Sonnet-4.6 halves val_ppl 3.22
sft/ar_sonnet 364k Sonnet-4.6 halves FVE 47.5%
sft/av_opus5 364k Opus-5 halves val_ppl 3.89
sft/ar_opus5 364k Opus-5 halves FVE 56.6%
sft/av_opus5_union 728k Opus-5 shared rows val_ppl 3.70
sft/ar_opus5_union 728k Opus-5 shared rows FVE 58.9%

AR dirs are adapter-style critics (ar_lora_value_head.safetensors + ar_meta.json + dense adapters; rebuild = truncate base to 29 layers, inject, load). AV dirs are PEFT adapter dirs + moe_dense_lora.safetensors.

RL trajectory (GRPO, 8x128, lr 5e-5 / critic 4e-5, ongoing 1000-step run)

rl/iter_0000NN for NN in {50,100,150,175,200..400-by-25} (save cadence was 50 until step 175, then 25; run in progress, uploaded at step 400 where heldout FVE = 60.9% vs 58.9% gold-explanation reference). rl/critic_latest = co-trained critic @400. rl/optim_step400_backup.pt = optimizer state for exact resume. Warm start = sft/{av,ar}_opus5_union.

Datasets: hf.co/datasets/ceselder/easynla-dsv4-warmstart-opus5. wandb: wandb.ai/octahedral-systems/easynla-dsv4.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ceselder/easynla-dsv4-flash-nla-ckpts

Adapter
(7)
this model