Решение проблемы «разрыва» при разработке агентов
Многие разработчики сталкиваются с проблемой: прототип агента работает в проприетарных средах вроде Claude Code или Codex, но при переносе на собственный цикл (loop) возникают сложности. AWS Strands Agents закрывает этот пробел, выпустив Strands Harness — универсальный open-source фреймворк (лицензия Apache 2.0) для Python и TypeScript. Он позволяет запускать агентов локально или в облаке, начиная с одной строки кода: create_harness().
Бенчмарки: 28% экономии и сравнение с лидерами
Команда AWS провела распределенное тестирование на Amazon EC2 с использованием фреймворка Harbor. Оценки проводились по 6 бенчмаркам: ALFWorld, ContextBench, GAIA, WebShop, τ²-bench и Terminal-Bench 2.1. Ключевой метрикой стала стоимость задачи в долларах при сохранении точности.
Средняя экономия Strands Harness составила 28% по сравнению с другими harness-решениями. Важно отметить, что DeepSeek Harness оказался еще дешевле (на 14% дешевле Strands), но проиграл в точности по всем тестам. Самым точным результатом стало использование модели Claude Opus 5 на Strands Harness, показавшее около 85%.
Детальное сравнение на Terminal-Bench 2.1
Наиболее наглядное сравнение «лоб в лоб» было проведено с использованием модели Claude Fable 5 (89 запусков на каждый harness). Strands Harness показал себя значительно эффективнее проприетарных решений, таких как Claude Code, и дешевле аналогов.
| Harness | Стоимость (USD) | Точность (%) |
|---|---|---|
| Strands harness | $56.29 | 69.7 |
| Oh-my-pi | $86.83 | 69.7 |
| OpenCode | $73.42 | 66.3 |
| Claude Code | $248.05 | 61.8 |
| DeepSeek Harness | $40.30 | 59.5 |
Как видно из таблицы, Strands Harness обошел Claude Code по точности на 7.9 пункта и сэкономил 77% средств ($56.29 против $248.05). При этом он сохранил ту же точность, что и Oh-my-pi, но при стоимости на 54% ниже.
Техническая причина эффективности: управление контекстом
Главный драйвер экономии токенов — не оптимизация промптов, а строгое управление контекстом. Исследование HarnessTax ранее показывало, что выбор harness влияет на стоимость до 5 раз при той же модели. В Strands Harness внедрены три правила:
- Трюнкатация: результаты инструментов длиннее 1500 токенов обрезаются.
- Компактизация: суммаризация контекста запускается при заполнении окна более чем на 85%.
- Восстановление: если окно переполняется, механизм восстановления работает внутри цикла.
Интеграция и запуск
Strands Harness поддерживает модели через Amazon Bedrock, Anthropic, OpenAI, Google, Ollama и LiteLLM. По умолчанию поставляются инструменты для работы с файлами, shell и веб-страницами. Для упрощения прототипирования доступен CLI, который позволяет описать задачу на английском языке и получить готовый код агента (Python/TypeScript) с подключенными MCP-серверами.
Установка доступна через pip install strands-harness или npm install @strands-agents/harness.
Источник: MarkTechPost ↗
