MN9-K-CLEAN441-NEMOTRON-NATIVE500K

这是一个实验性数学 LoRA adapter,按用户当前指示发布。它在原正式评测时不是 winner;本次发布不改变该历史判断。

精确基座与加载方式

  • Base:Qwen/Qwen3-4B-Base
  • Revision:906bfd4b4dc7f14ee4320094d8b41684abff8539
  • LoRA:rank 64,alpha 128,dropout 0;目标模块 q/k/v/o/up/gate/down projection
  • 权重 SHA256:6ad4937f785e752461d1f6bcd5cab3452dd224d6e91a1cfe33e50ed6de89927c
  • 这是动态加载 adapter,没有 merge/bake。仓库不含 base 权重,也没有 tokenizer delta;请使用上述固定 base revision 的 tokenizer。
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel

base = "Qwen/Qwen3-4B-Base"
revision = "906bfd4b4dc7f14ee4320094d8b41684abff8539"
tok = AutoTokenizer.from_pretrained(base, revision=revision)
model = AutoModelForCausalLM.from_pretrained(base, revision=revision, torch_dtype="auto", device_map="auto")
model = PeftModel.from_pretrained(model, "modrill/MN9-K-CLEAN441-NEMOTRON-NATIVE500K", revision="v1.0.0")

训练数据与剂量

  • 611 行、500,000 realized active tokens、15 optimizer updates;训练 seed 42。
  • 配方:清理并独立复审的 441 行骨干(400,240 active tokens)+ 170 行 legacy Nemotron-Math-v2 同题清洗压缩稿(99,760 active tokens;压缩前 173,749 tokens)。
  • 新增 170 行来自 gpt-oss-120b high/no-tool 轨迹的清洗压缩稿,是 native-like / reasoning-off 短解,不是严格原生 NoThink,也不是人类官方原解。整体混合也不得宣称 100% native-like。
  • 优化:LoRA r64/alpha128,lr 2e-5 constant,warmup 0,目标 32,768 active tokens/update,最大上下文 32,768,不截断、不 packing。

原正式评测合同与结果

  • EvalScope reviews;NoThink,enable_thinking=false,reasoning parser OFF;动态 LoRA。
  • 题集:AIME24 + AIME25;seeds 42、43、44、45;每 seed 60 条,共 240 reviews。
  • sampling:temperature 0.7、top_p 0.8、top_k 20、max tokens 8192;batch size 32。
  • 当时结果:34/240(seed 依次 9/60、8/60、8/60、9/60;AIME24 16/120、AIME25 18/120)。

本次发布前没有做额外 fresh-seed 复测。因此 34/240 只能描述上述一次原合同结果,不能表述为“稳定 34”。

冻结与完整性

源 adapter、保存级冻结副本及 manifest 已设为只读,并登记进正式清理 denylist;R2 对象存储另有同名版本化保护副本。SHA256_MANIFEST.json / SHA256SUMS 可用于逐文件核对。

License、数据与使用限制

  • 固定 base 的 Hugging Face 元数据标注为 Apache-2.0;使用者仍需遵守 base 模型许可。
  • 权威训练文件没有给这个“组合 adapter 产物”声明一个可覆盖全部来源的独立 license,因此这里不编造统一 license
  • 新增 Nemotron 本地合格行逐行标记为 CC-BY-4.0;441 行父骨干的逐行来源/许可需按原 provenance 记录逐项核对。
  • 本仓库不发布训练数据、trainer/optimizer state 或 raw evaluation responses。不得将模型审查边界误称为数学正确性保证。
Downloads last month
7
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for modrill/MN9-K-CLEAN441-NEMOTRON-NATIVE500K

Adapter
(73)
this model