Суть исследования: Интерпретируемость через «ручную» нейросеть
Цель работы — понять, как именно трансформеры кодируют факты в своих весах. Авторы предполагают, что значительная часть параметров хранит не общие алгоритмы, а конкретные факты (например, «кто играет в какой спорт»). Для проверки этой гипотезы они выбрали задачу запоминания пар токенов: модель получает два входных токена и должна предсказать один выходной. Данные генерируются случайно, поэтому сжать их невозможно — модель может только запомнить.
Ключевые выводы по архитектуре
Авторы протестировали различные вариации однослойного трансформера, убирая слои внимания, нормализации и остаточные связи. Главный вывод: MLP (многослойный перцептрон) является основным хранилищем фактов. Замена механизма внимания на простое суммирование эмбеддингов токенов работает не хуже, а иногда и лучше, так как в данной задаче внимание лишь линейно смешивает информацию, не добавляя полезной нелинейности.
Результаты сравнения: Обученные vs Ручные веса
Исследователи попытались вручную прописать веса для слоя MLP, чтобы он запоминал факты с точностью 90%. Их «ручная» модель масштабируется линейно с количеством параметров, как и обученная, но уступает ей по коэффициенту масштабирования. Ниже приведены результаты сравнения максимальной емкости памяти (количества фактов) при разных подходах:
| Метод кодировки весов | Точность | Отставание от обученной модели | Примечание |
|---|---|---|---|
| Полностью обученная модель (Gradient Descent) | 90% / 100% | База (1x) | Референсный показатель |
| Полностью ручная кодировка весов MLP | 90% | В 9.7 раз меньше фактов | Совпадает экспонента масштабирования, но низкий коэффициент |
| Полностью ручная кодировка весов MLP | 100% | Отставание растет с размером модели | При 100% точности разрыв увеличивается |
| Гибридный подход (ручные эмбеддинги + обучение unembedding) | 90% / 100% | В 3.5 раза меньше фактов | Задача сводится к линейной классификации, прогресс есть, но разрыв велик |
Почему это важно для AI Alignment
Если мы не можем воспроизвести способность модели запоминать факты с помощью аналитического решения (без градиентного спуска), мы не понимаем механику хранения знаний. Понимание того, как именно веса кодируют ассоциации, критично для методов редактирования знаний, таких как ROME и MEMIT, которые пытаются вносить изменения в веса модели «на лету».
Вызов сообществу
Авторы публикуют код генерации данных и формулируют открытый вызов: найти алгоритм или конструкцию весов, которая позволит «ручной» модели запоминать больше фактов при том же количестве параметров, приблизившись к показателям нейросети, обученной через backpropagation. Это служит бенчмарком для уровня нашего понимания внутренних представлений LLM.
Источник: LessWrong ↗
