GPT-2 Steering Denoiser

Канонический воспроизводимый checkpoint из исследования gpt2-stearing-repair.

Это не самостоятельная LM и не замена GPT-2. Модель представляет собой условный residual MLP-denoiser 768 -> 3072 -> 768, применяемый к blocks.6.hook_resid_pre GPT-2 small. Steering directions получены из SAE gpt2-small-res-jb.

Важный результат

Checkpoint хорошо восстанавливает синтетически зашумлённые активации, но в итоговом common-RNG протоколе не показал статистически значимого улучшения над naive steering. Он публикуется как канонический артефакт контролируемого отрицательного результата, а не как улучшенная версия GPT-2.

Primary difference относительно naive при бюджетах PPL 50/100/200:

+0.007 [-0.036,+0.041]
-0.003 [-0.053,+0.040]
-0.004 [-0.055,+0.041]

Полный отчёт и ограничения: REPORT.md. Итоговые таблицы: HF Dataset.

Совместимость

base LM: openai-community/gpt2
hook: blocks.6.hook_resid_pre
d_model: 768
hidden_dim: 3072
activation: GELU
conditioning: log1p(realized_L2_norm / mean_residual_norm)
mean_residual_norm: 80.01426634752933
BOS: не обрабатывается

Directional gating применяется внешним кодом и не входит в сам checkpoint.

Файлы

Файл Назначение
model.safetensors Веса MLP и train-only статистики нормализации
config.json Архитектура, conditioning и provenance
summary.json Краткое резюме обучения
training_log.csv История train/activation-validation MSE
diagnostics.csv Исправленные go/no-go проверки
neural.py Реализация архитектуры и загрузчика
example_usage.py Минимальная локальная проверка checkpoint

SHA-256 model.safetensors:

f002ba3940a3ed4b1fcf65125a9a9ee454ede726fe53636a86efed3ad99ced80

Загрузка

После скачивания репозитория:

import torch
from neural import load_checkpoint

device = "cuda" if torch.cuda.is_available() else "cpu"
denoiser, metadata = load_checkpoint(".", device=device)
states = torch.randn(2, 8, 768, device=device)
repaired = denoiser(states, q=0.5)
assert repaired.shape == states.shape
assert torch.equal(denoiser(states, q=0.0), states)

Полный пример применения внутри TransformerLens находится в GitHub-репозитории.

Обучение

tokens: 5,500,000 train + 500,000 activation-validation
corruption: isotropic Gaussian
steps: 6000
batch size: 2048
optimizer: AdamW
learning rate: 3e-4 -> 3e-5
seed: 0
parameters: 4,734,720

Validation MSE: 0.9339428954; вариант без denoising: 3.7162914127.

Ограничения

  • Проверены только GPT-2 small и один hook.
  • Checkpoint не является стандартной моделью transformers.
  • Для text-level применения необходимы внешний steering pipeline и directional gating.
  • Значимого сдвига Pareto envelope относительно naive не обнаружено.
  • Не использовать checkpoint для других LM или слоёв без повторного обучения.

Лицензия

Собственный код и checkpoint опубликованы по MIT License. Пользователь обязан соблюдать условия лицензий GPT-2, SAE Lens и исходного SAE checkpoint.

Downloads last month
14
Safetensors
Model size
4.74M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for KorolOrol/gpt2-steering-denoiser

Finetuned
(2272)
this model