Автоматизация научного метода для ИИ
По мере того как ИИ-агенты все чаще внедряются в сложные среды, понимание их поведения становится критически важным. Однако традиционные поведенческие исследования остаются ручными и трудоемкими. Команда исследователей во главе с Су Йонгом Ли (Soo Yong Lee) представила AEROBAT — первую многоагентную систему, способную автоматизировать весь цикл поведенческого научного исследования ИИ-агентов.
Масштаб эксперимента: цифры и метрики
AEROBAT берет на себя полный цикл: генерация гипотез, проектирование контролируемых экспериментов, их выполнение, оценка поведения, анализ результатов и написание отчетов. В ходе валидации система обработала 12 целевых поведенческих сценариев. Результаты работы системы впечатляют объемом выполненной работы:
- 79 гипотез было сгенерировано и протестировано;
- 1 240 контролируемых экспериментов спроектировано;
- 23 512 симуляционных раундов выполнено;
- Найдено умеренное или сильное статистическое подтверждение для 26 гипотез, включая некоторые новые, ранее не выявленные.
Как работает AEROBAT
Система использует подход multi-agent, где различные агенты специализируются на этапах научного процесса. Пользователь задает целевое поведение, после чего система самостоятельно выдвигает предположения о том, почему агент ведет себя определенным образом, и проверяет их через симуляции. Это позволяет масштабировать исследования, которые в ручном режиме заняли бы месяцы или годы.
Значение для индустрии
Результаты демонстрируют, что автоматизированные поведенческие исследования могут дополнить и расширить возможности ручного анализа. AEROBAT открывает путь к более быстрому и объективному тестированию безопасности, надежности и предсказуемости ИИ-агентов в реальных условиях, снижая порог входа для проведения сложных научных экспериментов в области искусственного интеллекта.
Источник: arXiv cs.AI ↗
