Инструменты3 июля 2026 г., 23:45 МСК🤖 Auto

AI-агенты без «обвязки» бесполезны: разбор архитектуры от OpenAI, Anthropic и Microsoft

GitHub-репозиторий Awesome Harness Engineering систематизирует лучшие практики создания инфраструктуры для ИИ-агентов. Разбор показывает, что успех зависит не от модели, а от архитектуры: контекста, памяти и безопасности.

Баннер новости 2882

Что такое Harness Engineering и почему это важно

Понятие Harness Engineering (инженерия обвязки) выделено в отдельную дисциплину. Если модель — это «мозг», то обвязка (harness) — это скелет и нервная система, обеспечивающая доставку контекста, управление инструментами, планирование, память и песочницы. Без надежной обвязки даже самые мощные модели терпят неудачи на реальных задачах.

Ключевой инсайт: лучшие harness-системы проектируются с учетом того, что модель не может справиться сама. Однако архитектура должна быть гибкой, так как по мере улучшения моделей многие компоненты обвязки могут стать избыточными.

Фундаментальные принципы от лидеров рынка

В базе собраны ключевые документы от OpenAI, Anthropic, Google и Microsoft. Они определяют стандарты проектирования:

  • OpenAI: В руководствах по Codex описан цикл агента и долгосрочное планирование через артефакты (Plan.md, Implement.md). Акцент на том, как заставить агента работать надежно в мире, где он становится основным исполнителем.
  • Anthropic: В гайдах по Agent Architecture и Tool Design подчеркивается, что дизайн инструментов — это UX для агента. Также представлена структура оценки (evals), аналогичная юнит-тестам, но адаптированная для недетерминированных агентов.
  • Google: Agent Development Kit (ADK) предлагает многоагентную топологию и пайплайн оценки, дополняя подходы OpenAI и Anthropic производственным взглядом.
  • Microsoft: Публикация о SRE-агенте для Azure приводит конкретные метрики успеха: время устранения инцидентов сократилось с 40,5 часов до 3 минут.

Кейс Microsoft: от 100 инструментов к файловой системе

Один из самых показательных примеров — архитектура агента для обслуживания Azure. Изначально команда использовала более 100 специализированных инструментов и сложные промпты. Переход к Context Engineering на основе файловой системы дал прорыв:

Агент получил доступ к исходному коду, runbook'ам и схемам запросов через стандартные команды read_file, grep, find и shell. Это позволило ему самостоятельно исследовать инциденты, а не полагаться на жестко заданные сценарии.

Метрика До оптимизации (специализированные инструменты) После перехода к Context Engineering
Время устранения инцидентов (Azure) 40,5 часов 3 минуты
Показатель «Intent Met» (на новых инцидентах) 45% 75%
Количество кастомных инструментов 100+ Минимизировано (использование стандартных shell-команд)

Архитектурные паттерны и безопасность

Современные harness-системы эволюционируют от простых цепочек вызовов к сложным многоагентным командам. Ключевые тренды 2026 года, выделенные в обзоре:

  • Многоагентная оркестрация: Разделение ролей. Например, в терминальных агентах используются разные модели для выполнения кода, рассуждения, критики и анализа изображений.
  • Безопасность через схемы: Вместо разрешений на уровне текста (permission prompts) внедряются структурные системы авторизации и schema-filtered planning subagents, которые накладывают ограничения на уровне схемы инструментов.
  • Управление энтропией: Введение периодических агентов-«санитаров», которые обновляют документацию и исправляют дрейф контекста, чтобы агенты не теряли актуальность данных.

Почему это важно для разработчиков

Исследование показывает, что настройка инфраструктуры (harness setup) может давать прирост в бенчмарках на 5+ процентных пунктов — сопоставимо с улучшением самой модели. Для компаний это означает сдвиг фокуса: вместо бесконечного тюнинга промптов или выбора новой LLM, приоритетом становится создание надежной, масштабируемой и безопасной «обвязки», которая позволяет агентам работать автономно и предсказуемо.

Источник: Github ↗