Денойзеры активаций шестого слоя GPT-2
Три набора весов получены в CPU-эксперименте по уменьшению деградации текста после стиринга активаций GPT-2 small. Код, полный отчет и все генерации находятся в основном репозитории.
Файлы
denoiser_gaussian.pt— обучение на гауссовом шуме; средняя ошибка восстановления0.07531.denoiser_mixed.pt— смесь гауссова шума и сдвигов вдоль случайных SAE-направлений; ошибка0.07493на новых SAE-направлениях.denoiser_structured.pt— обучение только на сдвигах вдоль SAE-направлений; сохранен как отрицательная абляция.
Каждый файл содержит:
state_dictPyTorch;- описание архитектуры и вида шума;
- среднее и стандартное отклонение 768 координат активации;
- историю обучения.
Используется DeepSwiGLUDenoiser с 2 106 112 параметрами. Активации берутся перед шестым блоком GPT-2 small. Итоговый CAA-вектор, SAE-фича 15262 и ближайшие к ней кандидаты не входили в обучающий банк направлений.
Важное ограничение
Веса, конечно, восстанавливают отложенные активации, но ни один обученный корректор не показал статистически надежного превосходства над Парето-фронтом простого сложения.
Лучшим практическим вариантом в опыте оказалось простое добавление SAE-вектора при alpha=0.4, а не денойзер. Точная фиксация SAE-фичи и проекционная коррекция дали полезные средние точки, но их преимущество над простым стирингом не подтверждено доверительными интервалами.
Model tree for zorikovm/robust-activation-steering
Base model
openai-community/gpt2