Релиз модели22 августа 2026 г., 19:19 МСК🤖 Auto

Архитектура важнее модели: 3 режима запуска AI-агентов и их экономика

Исследование Decoding AI доказывает: качество агента зависит от «harness» (обвязки), а не от самой модели. Разбор трех архитектурных паттернов и их влияния на стоимость инференса.

Баннер новости 6318

Почему «обвязка» важнее модели

Традиционный подход к выбору AI-агента фокусируется на выборе базовой модели. Однако эксперименты LangChain в Terminal-Bench показывают обратное: замена только «harness» (инфраструктуры управления) при использовании той же модели переместила код-агента с 30-го места в топ-5. Это меняет парадигму: архитектура цикла (loop) становится ключевым архитектурным решением, определяющим качество и стоимость.

В курсе Building a Coding Agent From Scratch от Decoding AI (автор Paul Iusztin) представлен Python-агент Decode. Ядро агента минималистично — около 20 строк кода на Pydantic AI, тогда как в leaked-источниках Claude Code ядро занимает ~150 строк. Вся остальная логика — память, песочницы, LSP-фидбек — относится к harness. Именно интерфейс взаимодействия с этим ядром определяет три режима работы.

Три режима запуска: задержка против пропускной способности

Каждый режим имеет уникальный профиль задержки и, как следствие, требует разных провайдеров инференса для оптимизации затрат.

  • Режим 1: Интерактивный (Online). Терминальный UI, живая сессия, стриминг токенов. Главная проблема — управление вводом (steering). Чтобы избежать коррупции контекста при вводе во время выполнения инструмента, используется очередь с приоритетными шлюзами (MODEL_REQUEST и WOULD_STOP). Пользователь ждет каждого токена, поэтому критична низкая задержка (low-latency).
  • Режим 2: Удаленный офлайн (Remote/Offline). Headless-хarness на сервере (например, Kitaru на GCP), исполнение на Modal. Нет пользователя, ожидающего ответа. Задачи (тикеты) распределяются параллельно. Ключевая метрика — пропускная способность за доллар (throughput per dollar). Если песочница падает, процесс возобновляется с последнего шага, а не перезапускается.
  • Режим 3: Асинхронный онлайн (Async/Online). Компромисс между двумя предыдущими. Пользователь онлайн, но не смотрит на каждый шаг. Работа передается в очередь, результат возвращается позже. Идеально для фоновых задач (Slack-агенты, ревью PR). Биллинг здесь ближе к пакетной обработке (batch), а не к чату.

Экономика инференса: почему цены различаются в 7 раз

Разница в требованиях к задержке диктует разницу в стоимости. Сравним обработку 1,000 документов (30,000 входных токенов, 500 выходных на документ):

Параметр Frontier API (Интерактивный) Serverless GPU (Пакетный/Офлайн)
Стоимость ~$97 ~$13
Причина разницы Оплата за токены. Prompt caching не работает из-за уникальных префиксов документов. Оплата за GPU-часы. Высокая утилизация при батчинге.
Время выполнения Зависит от скорости ответа API Менее 3 часов GPU-времени

Обратная ситуация возникает при интерактивном использовании. Модель Qwen3.6 35B на GPU H200 стоит около $4.54/час. Если агент простаивает 10 часов в ожидании подтверждения пользователя, счет увеличится на $45. В офлайн-режиме простой не оплачивается, так как ресурсы выделяются только под активные задачи.

Серверлес vs Reserved: когда что выгоднее

Второй ось экономики составляет тип аренды вычислений. Анализ Modal показывает, что серверные решения (serverless) выгоднее зарезервированных мощностей (reserved), когда отношение пиковой нагрузки к средней (peak-to-average ratio) превышает размер скидки на резервирование.

  • Типичные скидки на резервирование: 2–5x.
  • Типичное отношение пик/среднее для AI-инференса: 5–10x.
  • Утилизация зарезервированных ресурсов часто ниже 30%.

Таким образом, для большинства сценариев агентов, особенно с неравномерной нагрузкой, серверный GPU-инференс экономически эффективнее, чем оплата за токены в API или аренда выделенных GPU.

Источник: MarkTechPost ↗