Исследования23 июля 2026 г., 21:18 МСК🤖 Auto

Вызов: Ручная кодировка весов для запоминания последовательностей

Исследователи Linda Linsefors и Lucius Bushnaq провели эксперимент по ручному созданию весов для MLP, чтобы понять, как LLM хранят факты. Их модель уступает обученной в 9.7 раза, и они призывают сообщество закрыть этот разрыв.

Баннер новости 4232

Суть исследования: Интерпретируемость через «ручную» нейросеть

Цель работы — понять, как именно трансформеры кодируют факты в своих весах. Авторы предполагают, что значительная часть параметров хранит не общие алгоритмы, а конкретные факты (например, «кто играет в какой спорт»). Для проверки этой гипотезы они выбрали задачу запоминания пар токенов: модель получает два входных токена и должна предсказать один выходной. Данные генерируются случайно, поэтому сжать их невозможно — модель может только запомнить.

Ключевые выводы по архитектуре

Авторы протестировали различные вариации однослойного трансформера, убирая слои внимания, нормализации и остаточные связи. Главный вывод: MLP (многослойный перцептрон) является основным хранилищем фактов. Замена механизма внимания на простое суммирование эмбеддингов токенов работает не хуже, а иногда и лучше, так как в данной задаче внимание лишь линейно смешивает информацию, не добавляя полезной нелинейности.

Результаты сравнения: Обученные vs Ручные веса

Исследователи попытались вручную прописать веса для слоя MLP, чтобы он запоминал факты с точностью 90%. Их «ручная» модель масштабируется линейно с количеством параметров, как и обученная, но уступает ей по коэффициенту масштабирования. Ниже приведены результаты сравнения максимальной емкости памяти (количества фактов) при разных подходах:

Метод кодировки весов Точность Отставание от обученной модели Примечание
Полностью обученная модель (Gradient Descent) 90% / 100% База (1x) Референсный показатель
Полностью ручная кодировка весов MLP 90% В 9.7 раз меньше фактов Совпадает экспонента масштабирования, но низкий коэффициент
Полностью ручная кодировка весов MLP 100% Отставание растет с размером модели При 100% точности разрыв увеличивается
Гибридный подход (ручные эмбеддинги + обучение unembedding) 90% / 100% В 3.5 раза меньше фактов Задача сводится к линейной классификации, прогресс есть, но разрыв велик

Почему это важно для AI Alignment

Если мы не можем воспроизвести способность модели запоминать факты с помощью аналитического решения (без градиентного спуска), мы не понимаем механику хранения знаний. Понимание того, как именно веса кодируют ассоциации, критично для методов редактирования знаний, таких как ROME и MEMIT, которые пытаются вносить изменения в веса модели «на лету».

Вызов сообществу

Авторы публикуют код генерации данных и формулируют открытый вызов: найти алгоритм или конструкцию весов, которая позволит «ручной» модели запоминать больше фактов при том же количестве параметров, приблизившись к показателям нейросети, обученной через backpropagation. Это служит бенчмарком для уровня нашего понимания внутренних представлений LLM.

Источник: LessWrong ↗