Суть эксперимента: «Крот» с битым молотком
Исследователь star2vec проверил способность модели Qwen2.5-1.5B отслеживать внутреннее состояние простой детерминированной конечной машины (DFA), моделирующей протокол входа в систему. Ключевая особенность задачи: текущее состояние (например, «заблокировано» или «0 ошибок») никогда не записывается в текст (транскрипт). Модель должна выводить его исключительно из последовательности событий (ввод логина, ошибка, выход).
Было проанализировано около 4000 сессий. Состояние модели считывалось через линейный зонд (logistic regression) на активациях нейронов. Результат: зонд корректно определяет состояние в 88.6% случаев. Для сравнения, угадывание самого частого состояния даёт лишь 20%, а анализ только по тексту (без активаций) — 76,9%.
Почему это важно: Порядок имеет значение
Важнейший вывод исследования — модель понимает не просто набор событий, а их порядок. В эксперименте, где события перемешивались (терялся порядок), максимальная точность любого метода, не видящего хронологию, составила 60,4%. Зонд же по активациям сохранил точность на уровне 80,8%.
Это доказывает, что модель не просто считает количество упоминаний ошибок, а фактически «следит за ходом игры», эмулируя работу автомата внутри непрерывного векторного пространства.
Провал: Проблема «счёта до трёх»
Несмотря на общую успешность, модель демонстрирует критический сбой в логике подсчёта. Она не может надёжно различить состояния «две ошибки» и «заблокировано» (после третьей ошибки). Это происходит независимо от слоя нейросети, даже если правило явно прописано в промпте.
Интересный феномен: чем больше «мусорных» ходов происходит между неудачными попытками входа, тем увереннее модель считает, что аккаунт заблокирован. Она смещается к «точке невозврата», игнорируя точный счётчик.
Методология: Как отличить ошибку модели от ошибки зонда
Авторы провели строгую проверку (split-half testing), чтобы понять, где ошибка: в самом представлении модели или в неточности линейного зонда. Были обучены два новых зонда на разных половинах данных. Они согласны лишь в 34% случаев, где оригинальный зонд ошибался. Это означает, что в большинстве случаев ошибка была не в «мыслях» модели, а в том, что зонд пытался угадать состояние, которого модель корректно не кодировала (с уверенностью 79-93%).
Результаты в цифрах
| Метод / Условие | Точность | Комментарий |
|---|---|---|
| Зонд по активациям (полный порядок) | 88.6% | Базовый результат способности модели |
| Зонд по активациям (перемешанный порядок) | 80.8% | Доказательство учета последовательности |
| Максимум для метода без учета порядка | 60.4% | Теоретический предел для «мешка слов» |
| Анализ только по тексту (транскрипту) | 76.9% | Без помощи внутренних активаций |
| Согласие двух независимых зондов при ошибке | 34% | Подтверждает, что ошибка зонда, а не модели |
Вывод для интерпретируемости
Исследование служит предупреждением для исследователей механистической интерпретируемости: расхождения между зондом и ожидаемым поведением не всегда означают, что модель «думает неправильно». Часто это указывает на то, что модель не хранит информацию в удобном для линейного зонда виде. Быстрая проверка split-half позволяет избежать ложных выводов о «заблуждениях» модели.
Источник: LessWrong ↗
