Почему «обвязка» важнее модели
Традиционный подход к выбору AI-агента фокусируется на выборе базовой модели. Однако эксперименты LangChain в Terminal-Bench показывают обратное: замена только «harness» (инфраструктуры управления) при использовании той же модели переместила код-агента с 30-го места в топ-5. Это меняет парадигму: архитектура цикла (loop) становится ключевым архитектурным решением, определяющим качество и стоимость.
В курсе Building a Coding Agent From Scratch от Decoding AI (автор Paul Iusztin) представлен Python-агент Decode. Ядро агента минималистично — около 20 строк кода на Pydantic AI, тогда как в leaked-источниках Claude Code ядро занимает ~150 строк. Вся остальная логика — память, песочницы, LSP-фидбек — относится к harness. Именно интерфейс взаимодействия с этим ядром определяет три режима работы.
Три режима запуска: задержка против пропускной способности
Каждый режим имеет уникальный профиль задержки и, как следствие, требует разных провайдеров инференса для оптимизации затрат.
- Режим 1: Интерактивный (Online). Терминальный UI, живая сессия, стриминг токенов. Главная проблема — управление вводом (steering). Чтобы избежать коррупции контекста при вводе во время выполнения инструмента, используется очередь с приоритетными шлюзами (MODEL_REQUEST и WOULD_STOP). Пользователь ждет каждого токена, поэтому критична низкая задержка (low-latency).
- Режим 2: Удаленный офлайн (Remote/Offline). Headless-хarness на сервере (например, Kitaru на GCP), исполнение на Modal. Нет пользователя, ожидающего ответа. Задачи (тикеты) распределяются параллельно. Ключевая метрика — пропускная способность за доллар (throughput per dollar). Если песочница падает, процесс возобновляется с последнего шага, а не перезапускается.
- Режим 3: Асинхронный онлайн (Async/Online). Компромисс между двумя предыдущими. Пользователь онлайн, но не смотрит на каждый шаг. Работа передается в очередь, результат возвращается позже. Идеально для фоновых задач (Slack-агенты, ревью PR). Биллинг здесь ближе к пакетной обработке (batch), а не к чату.
Экономика инференса: почему цены различаются в 7 раз
Разница в требованиях к задержке диктует разницу в стоимости. Сравним обработку 1,000 документов (30,000 входных токенов, 500 выходных на документ):
| Параметр | Frontier API (Интерактивный) | Serverless GPU (Пакетный/Офлайн) |
|---|---|---|
| Стоимость | ~$97 | ~$13 |
| Причина разницы | Оплата за токены. Prompt caching не работает из-за уникальных префиксов документов. | Оплата за GPU-часы. Высокая утилизация при батчинге. |
| Время выполнения | Зависит от скорости ответа API | Менее 3 часов GPU-времени |
Обратная ситуация возникает при интерактивном использовании. Модель Qwen3.6 35B на GPU H200 стоит около $4.54/час. Если агент простаивает 10 часов в ожидании подтверждения пользователя, счет увеличится на $45. В офлайн-режиме простой не оплачивается, так как ресурсы выделяются только под активные задачи.
Серверлес vs Reserved: когда что выгоднее
Второй ось экономики составляет тип аренды вычислений. Анализ Modal показывает, что серверные решения (serverless) выгоднее зарезервированных мощностей (reserved), когда отношение пиковой нагрузки к средней (peak-to-average ratio) превышает размер скидки на резервирование.
- Типичные скидки на резервирование: 2–5x.
- Типичное отношение пик/среднее для AI-инференса: 5–10x.
- Утилизация зарезервированных ресурсов часто ниже 30%.
Таким образом, для большинства сценариев агентов, особенно с неравномерной нагрузкой, серверный GPU-инференс экономически эффективнее, чем оплата за токены в API или аренда выделенных GPU.
Источник: MarkTechPost ↗
