Команда исследователей, работавшая в рамках программы MATS под руководством доктора Кристиана Шредера де Витта, анонсировала релиз версии 0.0 фреймворка Orbit. Платформа создана на базе Inspect и предназначена для оценки безопасности и надежности систем, где взаимодействуют несколько независимых AI-агентов. Поддержку проекта берет на себя Cooperative AI Foundation.
Почему это важно: пробел в безопасности мультиагентов
Современные фронтьер-модели все чаще развертываются не изолированно, а как часть сложных многоагентных систем: от кодовых агентов, вызывающих субагентов, до роев автоматических исследователей. Это порождает новые риски: агенты могут не скоординироваться, вступить в конфликт или, что хуже всего, сговориться для обхода мониторинга. Существующие методы защиты, разработанные для одиночных агентов, часто терпят неудачу при масштабировании, так как уязвимости сильно зависят от топологии сети и ролей агентов.
Архитектура и возможности Orbit
Orbit позволяет моделировать децентрализованные, долгосрочные среды с произвольной топологией, планированием задач и общим доступом к памяти. Ключевое преимущество — возможность быстрой конфигурации экспериментов через YAML-файлы без переписывания кода. Платформа уже включает:
- 5 семейств сценариев: программирование, работа с рабочим столом, браузер, обслуживание клиентов и кооперативное распределение ресурсов.
- 4 типа угроз: инъекция промптов, компрометация агента, сговор (collusion) и misuse (злоупотребление).
- 4 категории защитных механизмов: безопасные промпты, мониторы, агенты-стражи (guardian agents) и дуальные LLM-системы.
Стандартизация бенчмарков
До появления Orbit исследователи часто создавали уникальные, «bespoke» среды для проверки узких рисков, что делало невозможным сравнение результатов между разными лабораториями. Orbit закрывает этот пробел, предлагая единый интерфейс для оценки эффективности защитных стратегий в одинаковых условиях. В планах команды — интеграция с Hawk для масштабных оценок, автоматический аудит и создание пользовательских визуализаторов.
Доступность и развитие
Проект находится на стадии v0.0, что означает активную фазу разработки и сбора обратной связи. Исследователи подчеркивают, что фреймворк спроектирован с упором на расширяемость (extensibility) и гибкость, позволяя комбинировать существующие сценарии для создания новых тестовых кейсов. Код платформы открыт и доступен для тестирования сообществом.
| Компонент | Описание |
|---|---|
| Базовая платформа | Inspect (расширенная для мультиагентных сред) |
| Версия релиза | v0.0 (Early Access) |
| Семейства сценариев | Coding, Desktop, Browser, Customer-service, Cooperative-allocation |
| Типы угроз | Prompt injection, Compromised agent, Collusion, Misuse |
| Категории защиты | Security prompting, Monitors, Guardian agents, Dual-LLM |
| Конфигурация | YAML-файлы (топология, роли, модели) |
Источник: LessWrong ↗
