Проблема процессного обучения
Традиционные языковые модели обучаются на результатах науки, оптимизируясь по сигналам уровня результата. Это оставляет пробел в понимании процессных сдвигов научного суждения: когда именно агенту следует переключиться между исследованием, дисциплинированным выполнением и критической переоценкой. Авторы работы (Vincent Karpf, Joseph Reth и др.) предлагают восстановить эту структуру из траекторий взаимодействия ученых.
Техническая реализация: Интервенции в Kimi 2.6
Метод Metacognitive Steering работает с замороженной моделью Kimi 2.6 (триллион параметров, архитектура MoE). Исследователи использовали контрастные интервенции, собранные во время реальных научных исследований, чтобы выявить координированную низкоразмерную структуру управления. Анализ остатков, выравнивание подпространств весов внимания и сингулярное разложение (SVD) кросс-слоев указали на поверхность управления средней глубины, охватывающую ключевые слои модели.
Результаты: Columbus-1 и реальные достижения
Метод был внедрен в автономную исследовательскую систему Columbus-1. Контроллер считывает когнитивный режим модели и динамически комбинирует интервенции для каждого слоя, не изменяя веса модели. Это привело к более длительному исследованию, явной прунинговой (отсечению) гипотез и синтезу, реагирующему на доказательства. Практические результаты включают:
- Обнаружение 8 независимых уязвимостей в BlueZ, подтвержденных атакующими.
- Проектирование, симуляция и изготовление 10-футовой ракеты, способной к пропелсивной посадке с использованием твердотопливных двигателей без регулировки тяги.
Значение для индустрии
Работа демонстрирует, что процессное научное суждение может служить источником супервизии для интерпретируемого, динамического контроля над стратегией рассуждений. Это открывает путь к созданию агентов, способных не просто генерировать ответы, но и осознанно выбирать тактику решения сложных задач в реальном времени.
Источник: arXiv cs.AI ↗
