Проблема «черного ящика» в рассуждениях
Понимание того, как именно большие языковые модели (LLM) распределяют вычислительные ресурсы при решении сложных задач, остается открытым вопросом. Существующие методы интерпретируемости часто опираются только на сигналы на уровне итогового вывода или сводят всю глубину обработки к единой скалярной величине для всей траектории. Это делает невозможным анализ того, где именно модель «задумалась», а где — ошиблась.
Решение: Step-Aware Reasoning Energy (SARE)
Команда исследователей во главе с Хуи Вэй (Hui Wei) предложила геометрическую框架 SARE, которая количественно оценивает усилия на уровне отдельных шагов цепочки рассуждений (Chain-of-Thought, CoT). Метод использует Centered Kernel Alignment (CKA) между матрицами Грама скрытых состояний токенов в соседних слоях трансформера. Это позволяет захватить реляционную структуру между токенами без необходимости выравнивания собственных векторов или соответствия кластеров.
Ключевая особенность SARE заключается в том, что она рассматривает траектории CoT как переходы между латентными семантическими состояниями, контекстуализируя вычислительную энергию внутри семантического прогресса рассуждения.
Ключевые находки и метрики
Эксперименты проводились на шести бенчмарках для рассуждений и трех моделях с открытым весом. Результаты показали, что энергия рассуждения распределена крайне неравномерно:
- Фазовые переходы: Наблюдаются резкие скачки вычислительных усилий, невидимые при анализе на уровне всей траектории.
- Индикатор ошибок: Неправильные траектории демонстрируют систематически более низкую энергию в критических точках принятия решений (reasoning junctions).
- Прогностическая сила: Признаки, полученные на основе SARE, соответствуют или превосходят базовые показатели уверенности на основе вывода (output-based confidence) в большинстве настроек. Это доказывает, что внутренняя геометрическая динамика кодирует предиктивную информацию, выходящую за пределы поверхностных сигналов.
Значение для индустрии
Внедрение таких методов интерпретируемости позволит разработчикам не просто проверять правильность ответа LLM, но и диагностировать «усталость» модели или моменты неопределенности в процессе логического вывода. Это критически важно для создания более надежных систем автономного планирования и сложных когнитивных агентов.
Источник: arXiv cs.AI ↗
