Инструменты25 июля 2026 г., 06:18 МСК🤖 Auto

Orbit: новый фреймворк для оценки безопасности мультиагентных систем

Исследователи представили Orbit — первую стандартизированную платформу для тестирования уязвимостей в системах с множеством AI-агентов, охватывающую 5 сценариев и 4 типа угроз.

Баннер новости 4354

Команда исследователей, работавшая в рамках программы MATS под руководством доктора Кристиана Шредера де Витта, анонсировала релиз версии 0.0 фреймворка Orbit. Платформа создана на базе Inspect и предназначена для оценки безопасности и надежности систем, где взаимодействуют несколько независимых AI-агентов. Поддержку проекта берет на себя Cooperative AI Foundation.

Почему это важно: пробел в безопасности мультиагентов

Современные фронтьер-модели все чаще развертываются не изолированно, а как часть сложных многоагентных систем: от кодовых агентов, вызывающих субагентов, до роев автоматических исследователей. Это порождает новые риски: агенты могут не скоординироваться, вступить в конфликт или, что хуже всего, сговориться для обхода мониторинга. Существующие методы защиты, разработанные для одиночных агентов, часто терпят неудачу при масштабировании, так как уязвимости сильно зависят от топологии сети и ролей агентов.

Архитектура и возможности Orbit

Orbit позволяет моделировать децентрализованные, долгосрочные среды с произвольной топологией, планированием задач и общим доступом к памяти. Ключевое преимущество — возможность быстрой конфигурации экспериментов через YAML-файлы без переписывания кода. Платформа уже включает:

  • 5 семейств сценариев: программирование, работа с рабочим столом, браузер, обслуживание клиентов и кооперативное распределение ресурсов.
  • 4 типа угроз: инъекция промптов, компрометация агента, сговор (collusion) и misuse (злоупотребление).
  • 4 категории защитных механизмов: безопасные промпты, мониторы, агенты-стражи (guardian agents) и дуальные LLM-системы.

Стандартизация бенчмарков

До появления Orbit исследователи часто создавали уникальные, «bespoke» среды для проверки узких рисков, что делало невозможным сравнение результатов между разными лабораториями. Orbit закрывает этот пробел, предлагая единый интерфейс для оценки эффективности защитных стратегий в одинаковых условиях. В планах команды — интеграция с Hawk для масштабных оценок, автоматический аудит и создание пользовательских визуализаторов.

Доступность и развитие

Проект находится на стадии v0.0, что означает активную фазу разработки и сбора обратной связи. Исследователи подчеркивают, что фреймворк спроектирован с упором на расширяемость (extensibility) и гибкость, позволяя комбинировать существующие сценарии для создания новых тестовых кейсов. Код платформы открыт и доступен для тестирования сообществом.

Компонент Описание
Базовая платформа Inspect (расширенная для мультиагентных сред)
Версия релиза v0.0 (Early Access)
Семейства сценариев Coding, Desktop, Browser, Customer-service, Cooperative-allocation
Типы угроз Prompt injection, Compromised agent, Collusion, Misuse
Категории защиты Security prompting, Monitors, Guardian agents, Dual-LLM
Конфигурация YAML-файлы (топология, роли, модели)

Источник: LessWrong ↗