Суть исследования: аудит «расследований»
Команда исследователей (Hasan Baig, OscarGilg, Hamzah) выпустила MessageBoardAuditBench — бенчмарк для оценки того, насколько хорошо AI-агенты могут самостоятельно расследовать инциденты с участием роев агентов. Цель — измерить эффективность AI-труда в аудите безопасности, который становится всё более востребованным. В качестве тестового кейса использованы данные расследования роя агентов OpenAI, обнаруженного на немецком wiki, с предоставленными логами.
Методология и данные
Исследователи вручную выделили 38 ключевых выводов из человеческого отчета и проверили их наличие в логах. Моделям давались логи (без флагов анализа), минимальный промпт и ограничение по времени (10, 30 или 120 минут). Агенты работали в песочницах без доступа к интернету и субагентам, используя такие инструменты, как Claude Code, Codex и ReAct. Оценка проводилась LLM-градером (Fable 5.1) по двум метрикам: покрытие выводов (70%) и качество резюме (30%).
Результаты: лидерство и пробелы
Лучший результат показал Opus 5 с совокупным баллом 51.5% (максимум за один запуск — 56.7%). Однако даже лучшие модели не могут полностью воспроизвести человеческое расследование. Ниже представлены результаты топовых моделей при временном бюджете 2 часа:
| Модель | Совокупный балл (%) | Примечание |
|---|---|---|
| Opus 5 | 51.5 | Лучший результат, макс. 56.7% |
| GPT-5.6-Sol | 48.6 | Рост с 29% (10 мин) до 48.6% (2 часа) |
| Opus 4.8 | 45.9 | — |
| Gemini 3.8 Flash | 45.4 | — |
| GPT-6-Astra | 38.4 | Слабо структурирует выводы, но при увеличении объема отчета (+6 п.п.) улучшает покрытие |
Ключевые инсайты
- Время имеет значение: Увеличение временного бюджета с 10 до 120 минут значительно повышает качество расследования для большинства моделей (например, GPT-5.6-Sol вырос с 29% до 48.6%).
- Проблема приоритизации: GPT-6-Astra, несмотря на высокую способность находить факты, плохо отбирает их для отчета. При запросе более длинного отчета (5к слов) её покрытие выросло на 6 процентных пунктов.
- Смещение OpenAI: Модели OpenAI реже, чем другие, предполагают, что рой агентов является внутренним развертыванием. Это наблюдается даже при синтетической модификации данных, имитирующих принадлежность к Anthropic.
Почему это важно
Результаты показывают, что текущие AI-агенты способны лишь частично заменить человеческий аудит в сложных инцидентах. Для разработчиков моделей это сигнал к улучшению навыков структурирования выводов и снижения предвзятости. Для индустрии безопасности — предупреждение о том, что «расследования» с помощью AI требуют тщательной верификации, так как модели могут упускать критические детали или делать ошибочные выводы о происхождении угрозы.
Источник: LessWrong ↗
