Проблема дрейфа в автономных исследованиях
Автономные исследовательские циклы на базе больших языковых моделей (LLM) часто страдают от одной критической проблемы: они склонны к локальным улучшениям метрик, а не к проверке фундаментальных гипотез. Авторы работы (Yiwen Zhang, Eloise Zeng, Jaeha Lee, Tony Yue Yu) предлагают структурное решение для исследования обобщения политик навигации квадроногих роботов в симуляции, опираясь на парадигму autoresearch, популяризированную Андреем Карпаты.
Три столпа новой архитектуры
Предложенная система AI Scientist включает три ключевых компонента, которые делают процесс воспроизводимым и честным:
- Неизменяемая карточка эксперимента (Immutable Experiment Card): Каждая итерация фиксирует предсказание и результат по строгой схеме. Это предотвращает ретроспективное изменение выводов (retconning) при опровержении гипотезы.
- Специализированные субагенты: Роли строго ограничены механическими задачами, что снижает хаос в коммуникации.
- Kkanbu — оракул предпочтений: Единственный компонент, имеющий право на субъективное суждение. Он хранит «научный вкус» исследователя в виде типизированного графа знаний.
Результаты сравнительного эксперимента
Для проверки гипотезы команда запустила идентичные циклы в 11 исследовательских потоках: один с участием оракула kkanbu, другой — без него. Результаты показали, что отсутствие субъективного фактора не снижает качество финального результата, но меняет траекторию поиска.
| Метрика / Аспект | Без kkanbu (Oracle-less) | С kkanbu (Oracle) |
|---|---|---|
| Доля опровергнутых гипотез | ~75% | ~75% |
| Лучшая обученная политика | Победитель | Уступает победителю |
| Исследование адаптации на этапе тестирования | Не проводилось | Единственный исследователь |
| Переиспользование знаний между потоками | Повторное выведение уроков | Перенос уроков между потоками |
Почему это важно
Главный вывод исследования: «скелет» системы удерживает цикл от искажения фактов, но именно оракул kkanbu определяет направление взгляда. Хотя самая эффективная политика навигации была получена в группе без субъективного вмешательства, наличие оракула позволило исследовать нишевые направления (адаптация на лету) и избежать дублирования усилий. Это демонстрирует, что разделение на «структурную честность» и «творческий выбор» может повысить эффективность автономных научных циклов.
Источник: arXiv cs.AI ↗
