Денойзеры активаций шестого слоя GPT-2

Три набора весов получены в CPU-эксперименте по уменьшению деградации текста после стиринга активаций GPT-2 small. Код, полный отчет и все генерации находятся в основном репозитории.

Файлы

  • denoiser_gaussian.pt — обучение на гауссовом шуме; средняя ошибка восстановления 0.07531.
  • denoiser_mixed.pt — смесь гауссова шума и сдвигов вдоль случайных SAE-направлений; ошибка 0.07493 на новых SAE-направлениях.
  • denoiser_structured.pt — обучение только на сдвигах вдоль SAE-направлений; сохранен как отрицательная абляция.

Каждый файл содержит:

  • state_dict PyTorch;
  • описание архитектуры и вида шума;
  • среднее и стандартное отклонение 768 координат активации;
  • историю обучения.

Используется DeepSwiGLUDenoiser с 2 106 112 параметрами. Активации берутся перед шестым блоком GPT-2 small. Итоговый CAA-вектор, SAE-фича 15262 и ближайшие к ней кандидаты не входили в обучающий банк направлений.

Важное ограничение

Веса, конечно, восстанавливают отложенные активации, но ни один обученный корректор не показал статистически надежного превосходства над Парето-фронтом простого сложения.

Лучшим практическим вариантом в опыте оказалось простое добавление SAE-вектора при alpha=0.4, а не денойзер. Точная фиксация SAE-фичи и проекционная коррекция дали полезные средние точки, но их преимущество над простым стирингом не подтверждено доверительными интервалами.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for zorikovm/robust-activation-steering

Finetuned
(2275)
this model