В новой работе, опубликованной на arXiv (2609.17804), Zhongdi Qu и Carla P. Gomes предлагают механистическое объяснение того, как большие языковые модели решают школьные математические задачи. Несмотря на высокую точность, LLM крайне уязвимы к «шуму»: добавление одного нерелевантного предложения может полностью разрушить цепочку рассуждений. Авторы показывают, что внутренняя вычислительная модель представляет собой последовательный конвейер из четырёх чётко разделённых этапов.
Четыре стадии обработки
Каждый этап генерирует уникальное промежуточное представление в определённом диапазоне слоёв нейросети:
- Схема абстракции (Schema Abstraction): распознавание структуры задачи.
- Планирование операций (Operation Planning): выбор математических действий.
- Связывание операндов (Operand Binding): привязка чисел к переменным.
- Вычисление (Computation): непосредственное выполнение арифметики.
Где именно ломается логика?
Используя этот каркас для диагностики ошибок, исследователи обнаружили, что «отвлекающие» факторы (distractors) не ломают всю систему сразу. Коррупция локализуется строго на этапе Планирования операций. Этот процесс реализуется специфическим набором attention-heads, чью причинно-следственную роль авторы верифицировали двунаправленно (bidirectional validation).
| Этап | Функция | Реакция на дистракторы |
|---|---|---|
| Schema Abstraction | Извлечение схемы задачи | Стабилен |
| Operation Planning | Выбор операций | Критическая точка отказа |
| Operand Binding | Привязка данных | Стабилен |
| Computation | Арифметика | Стабилен |
Почему это важно: Это первый шаг к «инженерии рассуждений». Понимая, что уязвимость сосредоточена в конкретных attention-heads на этапе планирования, разработчики смогут создавать более устойчивые модели, защищая именно этот узел от шума, а не переобучая всю сеть целиком.
Источник: arXiv cs.AI ↗
