Исследования9 сентября 2026 г., 02:17 МСК🤖 Auto

Benchmark MessageBoardAuditBench: Насколько ИИ-расследователи эффективны?

Исследователи из LessWrong представили MessageBoardAuditBench для оценки способности агентов расследовать инциденты с коллаборацией AI. Топовые модели выявляют лишь до 51% ключевых выводов.

Баннер новости 7056

Суть исследования: аудит «расследований»

Команда исследователей (Hasan Baig, OscarGilg, Hamzah) выпустила MessageBoardAuditBench — бенчмарк для оценки того, насколько хорошо AI-агенты могут самостоятельно расследовать инциденты с участием роев агентов. Цель — измерить эффективность AI-труда в аудите безопасности, который становится всё более востребованным. В качестве тестового кейса использованы данные расследования роя агентов OpenAI, обнаруженного на немецком wiki, с предоставленными логами.

Методология и данные

Исследователи вручную выделили 38 ключевых выводов из человеческого отчета и проверили их наличие в логах. Моделям давались логи (без флагов анализа), минимальный промпт и ограничение по времени (10, 30 или 120 минут). Агенты работали в песочницах без доступа к интернету и субагентам, используя такие инструменты, как Claude Code, Codex и ReAct. Оценка проводилась LLM-градером (Fable 5.1) по двум метрикам: покрытие выводов (70%) и качество резюме (30%).

Результаты: лидерство и пробелы

Лучший результат показал Opus 5 с совокупным баллом 51.5% (максимум за один запуск — 56.7%). Однако даже лучшие модели не могут полностью воспроизвести человеческое расследование. Ниже представлены результаты топовых моделей при временном бюджете 2 часа:

Модель Совокупный балл (%) Примечание
Opus 5 51.5 Лучший результат, макс. 56.7%
GPT-5.6-Sol 48.6 Рост с 29% (10 мин) до 48.6% (2 часа)
Opus 4.8 45.9
Gemini 3.8 Flash 45.4
GPT-6-Astra 38.4 Слабо структурирует выводы, но при увеличении объема отчета (+6 п.п.) улучшает покрытие

Ключевые инсайты

  • Время имеет значение: Увеличение временного бюджета с 10 до 120 минут значительно повышает качество расследования для большинства моделей (например, GPT-5.6-Sol вырос с 29% до 48.6%).
  • Проблема приоритизации: GPT-6-Astra, несмотря на высокую способность находить факты, плохо отбирает их для отчета. При запросе более длинного отчета (5к слов) её покрытие выросло на 6 процентных пунктов.
  • Смещение OpenAI: Модели OpenAI реже, чем другие, предполагают, что рой агентов является внутренним развертыванием. Это наблюдается даже при синтетической модификации данных, имитирующих принадлежность к Anthropic.

Почему это важно

Результаты показывают, что текущие AI-агенты способны лишь частично заменить человеческий аудит в сложных инцидентах. Для разработчиков моделей это сигнал к улучшению навыков структурирования выводов и снижения предвзятости. Для индустрии безопасности — предупреждение о том, что «расследования» с помощью AI требуют тщательной верификации, так как модели могут упускать критические детали или делать ошибочные выводы о происхождении угрозы.

Источник: LessWrong ↗