Исследования13 сентября 2026 г., 01:17 МСК🤖 Auto

Миф о «бэктрекинге» в LLM: модели не меняют мнение, а просто «оседают»

Исследование опровергло гипотезу о том, что латентные модели ИИ (Huginn, Coconut) осуществляют осознанный «бэктрекинг» (возврат к предыдущим мыслям). Анализ показал, что изменения в топ-ответах — это артефакты сходимости к финальному решению, а не пр

Баннер новости 7376

Суть спора: есть ли у ИИ «внутренний монолог»?

В интерпретируемости больших языковых моделей (LLM) существует важное различие между текстовым рассуждением (Chain-of-Thought) и латентным. В текстовом режиме мы видим токены вроде «подождите, это неверно», что явно указывает на бэктрекинг. В латентных моделях (например, Huginn или Coconut) промежуточные шаги — это скрытые векторы. Недавняя работа Cui & Ye утверждала, что такие модели также «меняют мнение», меняя топ-ответ в 32% случаев, что коррелирует с ростом точности.

Автор исследования star2vec (LessWrong, сентябрь 2026) подверг эту гипотезу критическому анализу. Цель была проста: доказать, что смена лидера в списке кандидатов — это не возврат к старым идеям, а процесс «оседания» (settling) модели на финальном ответе.

Эксперимент на графовых моделях (Coconut)

Для проверки была использована простая модель Coconut (2 слоя, обучение с нуля на задаче достижимости графов). Точность модели составила 95% на тестовой выборке из 419 графов. Исследователи наблюдали за сменой лидеров среди кандидатов на каждом шаге рассуждения.

Метрика Результат Интерпретация
Частота смены лидера (среди кандидатов) 29–38% Высокая, но сопоставима с шумом
Частота смены лидера (случайные узлы) 32–42% Смена происходит так же часто, как и у реальных кандидатов
Совпадение смен в двух разных запусках 31% Смены не детерминированы задачей, а зависят от инициализации
Повторные смены (истинный бэктрекинг) 0.15 (кандидаты) vs 0.34 (случайные) Истинные «возвраты» встречаются реже, чем случайные колебания

Ключевое наблюдение: ни в одном графе два кандидата не удерживали позиции топ-1 и топ-2 на протяжении всего процесса. Разрыв между ними рос экспоненциально. Смена лидера происходила только в момент, когда правильный ответ уже доминировал, а неправильный просто «догонял» его в конце вычислений. Это классический признак сходимости, а не переосмысления.

Проверка Huginn: почему цифры Cui & Ye ввели в заблуждение?

Самый сложный тест прошел модель Huginn (3.5B параметров, 32 итерации). Исследователи воспроизвели методологию Cui & Ye на датасетах ARC-Challenge и ARC-Easy.

Результаты опровергли выводы оригинальной работы:

  • Частота смен: В исследовании star2vec смена топ-ответа происходила в 66% случаев на ARC-Challenge и 64% на ARC-Easy (против заявленных 32% у Cui & Ye). Разница обусловлена настройками инициализации и перестановок.
  • Влияние на точность: Cui & Ye утверждали, что смена ответа повышает точность. Здесь этого не обнаружено: на ARC-Challenge точность при смене составила 0.39 против 0.35 без смены, а на ARC-Easy — 0.49 против 0.48. Статистически значимой связи нет.
  • Природа смен: Разрыв между логитами первого и второго ответа в момент смены составляет в медиане всего 0.12. При повторном запуске с другой случайной инициализацией совпадение моментов смены происходит лишь в 4% случаев.

Вывод: «Оседание», а не «Раздумье»

Исследование показывает, что то, что выглядит как бэктрекинг, является артефактом random start settling (сходимости от случайного старта). Модель не «вспоминает» старые идеи и не отбрасывает их осознанно. Она просто итеративно уточняет состояние, и на ранних этапах из-за шума или близости логитов лидер может меняться. Финальный ответ не «находится» через возврат, а оседает (settles in) по мере усиления уверенности модели.

Это имеет критическое значение для интерпретируемости: если мы не видим истинного бэктрекинга, то попытки «перехватить» процесс мышления модели на полпути могут быть бесполезны, так как модель не хранит явных следов отвергнутых гипотез в доступном для управления виде.

Источник: LessWrong ↗