Исследования17 сентября 2026 г., 02:17 МСК🤖 Auto

Якоря мышления не работают кросс-модельно: новые данные интерпретируемости

Исследование показало, что ключевые шаги в цепочке рассуждений (CoT) одного ИИ-модели не являются универсально важными для другой модели. Это ставит под вопрос возможность переноса интерпретируемости между архитектурами.

Баннер новости 7670

Суть эксперимента: переносимость «якорей»

Автор исследования therootof3 (проект в рамках MATS stream Neel Nanda) проверил гипотезу о том, являются ли «якоря мышления» (thought anchors) — предложения в CoT, критически влияющие на ответ — свойством самого текста или спецификой модели-автора. Использовалась методика Thought Anchors: замена ключевого предложения и оценка падения точности.

В качестве Writer (модель A) выступил DeepSeek-R1-Distill-Qwen-14B. В роли Reader (модель B) тестировались Qwen3-1.7B (родственная архитектура) и gpt-oss-20b (другая архитектура). Все модели запускались локально на 4x RTX PRO 6000 через vLLM.

Результаты: отсутствие кросс-модельного переноса

Основной вывод: важность предложений, определенных как «якоря» для модели A, теряется при чтении их моделью B. Текст сам по себе не несет универсальной причинно-следственной силы. Однако обнаружен нюанс: скрытые подсказки (hints) из набора Thought Branches могут переноситься, но только если CoT уже обсуждает варианты ответов.

Детали тестирования на MATH

Для исключения насыщения точности (когда модель всегда угадывает или всегда ошибается) были отобраны задачи, где точность базовой модели находилась в диапазоне 15–85%. Из 8 кандидатов в Reader-модели прошли фильтр только две. Ниже приведена сводка по выбранным моделям и задачам:

Параметр Writer (Model A) Reader (Model B) - Вариант 1 Reader (Model B) - Вариант 2
Название модели DeepSeek-R1-Distill-Qwen-14B Qwen3-1.7B gpt-oss-20b
Архитектура Qwen-family Qwen-family (малая) Open-source (20B)
Датасет MATH (20 задач) 11 общих задач с A 11 общих задач с A
Целевой диапазон точности 15% – 85% 15% – 85%
Количество роутов (rollouts) 60 (замена) / 40 (оригинал) 60 (замена) / 40 (оригинал)

Почему это важно для индустрии

  • Интерпретируемость: Если якоря не переносятся, анализ причинности ответа одной модели нельзя напрямую применять к другим. Это усложняет создание универсальных инструментов объяснимости (XAI).
  • Экономия ресурсов: Надежда на то, что дешевая модель (1.7B) сможет «прочитать» и оценить важность шагов дорогой модели (14B/70B+) через resampling, не подтвердилась в чистом виде.
  • Чистота данных: Автор отмечает необходимость очистки датасетов (в частности, Thought Branches) перед повторным использованием, так как текущие данные содержат артефакты.

Ограничения исследования

Проект длился 20 часов. Выборка ограничена 20 задачами из MATH и двумя моделями-читателями. Результаты могут не распространяться на все reasoning-модели, особенно на закрытые проприетарные системы, не вошедшие в тест.

Источник: LessWrong ↗