Исследования1 июля 2026 г., 02:17 МСК🤖 Auto

Миф о «функции правильного ответа»: как LLM решают тесты

Исследование Коби Льюиса опровергает гипотезу, что языковые модели выбирают варианты ответов, оценивая их «правильность» на месте. Анализ механизмов внимания показывает, что LLM используют единый алгоритм независимо от порядка подачи данных.

Баннер новости 2655

Проблема «функции правильного ответа»

Долгое время в интерпретируемости ИИ доминировала гипотеза о существовании так называемой "correct answer feature" (функции правильного ответа). Согласно ей, нейросеть вычисляет некий скалярный балл «правильности» для каждого варианта ответа непосредственно на последнем токене этого варианта. Если бы это было так, модель могла бы оценивать каждый пункт изолированно, опираясь только на контекст до него.

Однако эта теория сталкивается с фундаментальным теоретическим тупиком. В задачах с непереходными отношениями (например, «Ножницы бьют Бумагу») или при подаче вопроса после списка вариантов, модель физически не может знать правильный ответ на момент обработки токена варианта, так как ключевая информация (вопрос) еще не поступила в контекстное окно.

Эксперимент: Порядок имеет значение?

Автор исследования протестировал семейство моделей Llama 3 (разных размеров и версий base/instruct) на четырех доменах: ARC-Easy, простая арифметика, словарь и токено-матчинг. Были выбраны комбинации, где точность модели превышала 90% в обоих форматах:

  • Question First: Вопрос → Варианты → Ответ
  • Answer First: Варианты → Вопрос → Ответ

Используя метод атрибуции прямого эффекта (direct-effect head attribution), исследователь выявил, какие именно слои внимания (attention heads) вносят наибольший вклад в предсказание правильного ответа.

Результаты: Единый механизм

Ключевое открытие заключается в том, что набор «важных» attention heads для обоих форматов практически идентичен. Если бы модель использовала «функцию правильного ответа» там, где это возможно (Question First), и другой механизм там, где это невозможно (Answer First), мы увидели бы различия в активации слоев. Вместо этого LLM используют одни и те же вычислительные контуры.

Параметр Question First (Вопрос в начале) Answer First (Вопрос в конце)
Точность (Accuracy) > 90% (выбрано для теста) > 90% (выбрано для теста)
Механизм выбора Глобальный анализ контекста Глобальный анализ контекста
Top Attention Heads Идентичный набор слоев Идентичный набор слоев
Возможность использования "Correct Answer Feature" Теоретически возможно Физически невозможно

Почему это важно

Этот результат ставит под сомнение упрощенные интерпретации работы LLM. Модели не просто «считывают» правильность ответа из токена; они строят целостное представление о задаче, интегрируя вопрос и варианты в единый контекст до момента выдачи ответа. Это означает, что способность к выбору правильного ответа является результатом сложной глобальной обработки, а не локальной оценки отдельных пунктов.

Исследование также отмечает ограничения: анализ опирается только на прямые эффекты внимания, игнорируя косвенные пути, и проведен исключительно на модели Llama 3. Тем не менее, данные убедительно свидетельствуют, что «функция правильного ответа» не является основным механизмом решения задач с множественным выбором.

Источник: LessWrong ↗