Проблема избыточных вызовов
Интеграция внешних инструментов (API, поиск, калькуляторы) расширяет возможности больших языковых моделей, но создает критическую проблему: модели склонны вызывать инструменты даже тогда, когда для ответа достаточно внутренних знаний (parametric knowledge). Это приводит к задержкам, увеличению затрат и потенциальным ошибкам. Авторы работы (Юци Чэнь, Винсент Сиу, Ян Лю, Дон Сонг, Чэнгуан Ван) предлагают решение, основанное на манипуляции внутренними состояниями модели.
Механизм Heading-Specific Activation Steering
Ключевая идея заключается в извлечении "векторов управления" (steering vectors) из позиций, соответствующих заголовкам (headings) в контексте. Эти векторы позволяют осуществлять двунаправленный каузальный контроль над поведением модели. Метод демонстрирует эффективность в подавлении ненужных вызовов инструментов в пяти открытых моделях и трех различных доменах. Наиболее значимый эффект наблюдается в задачах, где достаточно логического рассуждения на основе встроенных знаний модели.
Геометрическая сложность и нелинейность
Исследование выявило парадоксальную геометрическую природу этого явления. В отличие от линейных представлений концепций, связанных с параметрическими знаниями, шаги вызова инструментов демонстрируют диффузную, бимодальную корреляцию с вектором подавления. Различные типы инструментов рекрутируют совершенно разные внутренние сигнатуры с низким пересечением признаков. Это указывает на непараметрическую природу инструментов, которые существуют исключительно в контексте во время инференса, а не закодированы в весах модели.
Практическая значимость
Предложенный подход позволяет тонко настраивать поведение LLM без необходимости дообучения (fine-tuning) или изменения весов модели. Это открывает путь к созданию более надежных агентов, способных отличать ситуации, требующие внешнего вмешательства, от тех, где модель должна полагаться на свои внутренние знания. Открытым вопросом остается точная связь между выявленной геометрической нерегулярностью и каузальной эффективностью метода.
Источник: arXiv cs.AI ↗
