Исследования24 сентября 2026 г., 11:18 МСК🤖 Auto

LLM решают задачи не по теме, а по методу: прорыв в понимании мышления ИИ

Исследование arXiv:2609.27041 доказывает, что внутренние вычисления LLM структурированы по типу рассуждения, а не по математической теме. Это меняет подход к обучению и тестированию моделей.

Баннер новости 8172

Парадигма «тема vs подход»

Традиционно бенчмарки для математического мышления языковых моделей (LLM) классифицируются по темам: алгебра, геометрия, теория чисел. Однако новое исследование под руководством Sajad Goudarzi ставит под сомнение эту структуру. Авторы доказывают, что модели организуют свои внутренние вычисления не вокруг предметной области, а вокруг повторяющихся подходов к рассуждению (reasoning approach). Это означает, что решение задачи по геометрии может использовать те же нейронные паттерны, что и задача по алгебре, если логика вывода идентична.

Методология: протокол генерации и воспроизведения

Для проверки гипотезы команда разработала уникальный generation-replay protocol. Процесс включал следующие шаги:

  • Модель генерирует решение задачи.
  • Точная траектория «промпт + генерация» воспроизводится заново.
  • Извлекаются сигнатуры важности активаций (activation-importance signatures) на токенах рассуждения.
  • Эти сигнатуры кластеризуются без учителя (unsupervised) across 8 моделей и 5 источников данных.

Ключевые метрики и результаты

Результаты кластеризации были проверены с помощью структурных, семантических тестов и интервенций. Ключевые цифры, подтверждающие доминирование подхода над темой:

Метрика / Тест Результат для реальных кластеров Результат для контрольных групп (случайных/тематических)
Коherence подхода (оценка фронтенд-LLM) 77–82% кластеров имеют четкую логическую связность 6–11% (внутриисточниковые контроли)
Чувствительность к промпту Смена требуемого подхода меняет кластер в 7 из 8 случаев Парафразы задачи сохраняют кластер (стабильность)
Сравнение с рандомом Выявленные кластеры превосходят рандомные базы по всем метрикам —

Интересно, что кластеры, сформированные строго по темам, часто получали более детальные и узкие названия, чем сами темы, что указывает на скрытую вариативность методов решения внутри одной предметной области.

Почему это важно для индустрии

Выводы исследования имеют критическое значение для разработчиков LLM. Если модели учатся на сбалансированных по темам корпусах данных, они все равно могут оставаться несбалансированными по подходам к рассуждению. Это создает «слепые зоны» в логическом мышлении ИИ, которые не видны при стандартной оценке по темам. Будущие бенчмарки и стратегии обучения должны сместить фокус с покрытия тем на покрытие разнообразия логических паттернов.

Источник: arXiv cs.AI ↗