Исследования16 сентября 2026 г., 10:18 МСК🤖 Auto

Metacognitive Steering: Как управлять мышлением Kimi 2.6 в реальном времени

Исследователи представили метод Metacognitive Steering, позволяющий динамически управлять стратегией рассуждений замороженной модели Kimi 2.6, выявив низкоразмерную структуру научного суждения.

Баннер новости 7609

Проблема процессного обучения

Традиционные языковые модели обучаются на результатах науки, оптимизируясь по сигналам уровня результата. Это оставляет пробел в понимании процессных сдвигов научного суждения: когда именно агенту следует переключиться между исследованием, дисциплинированным выполнением и критической переоценкой. Авторы работы (Vincent Karpf, Joseph Reth и др.) предлагают восстановить эту структуру из траекторий взаимодействия ученых.

Техническая реализация: Интервенции в Kimi 2.6

Метод Metacognitive Steering работает с замороженной моделью Kimi 2.6 (триллион параметров, архитектура MoE). Исследователи использовали контрастные интервенции, собранные во время реальных научных исследований, чтобы выявить координированную низкоразмерную структуру управления. Анализ остатков, выравнивание подпространств весов внимания и сингулярное разложение (SVD) кросс-слоев указали на поверхность управления средней глубины, охватывающую ключевые слои модели.

Результаты: Columbus-1 и реальные достижения

Метод был внедрен в автономную исследовательскую систему Columbus-1. Контроллер считывает когнитивный режим модели и динамически комбинирует интервенции для каждого слоя, не изменяя веса модели. Это привело к более длительному исследованию, явной прунинговой (отсечению) гипотез и синтезу, реагирующему на доказательства. Практические результаты включают:

  • Обнаружение 8 независимых уязвимостей в BlueZ, подтвержденных атакующими.
  • Проектирование, симуляция и изготовление 10-футовой ракеты, способной к пропелсивной посадке с использованием твердотопливных двигателей без регулировки тяги.

Значение для индустрии

Работа демонстрирует, что процессное научное суждение может служить источником супервизии для интерпретируемого, динамического контроля над стратегией рассуждений. Это открывает путь к созданию агентов, способных не просто генерировать ответы, но и осознанно выбирать тактику решения сложных задач в реальном времени.

Источник: arXiv cs.AI ↗