Самая важная цифра тут не про токены, а про 80%. Именно такой порог принятия действий человеком предлагают перед запуском AI-агента в работу. И да, это не очередной «просто промпт», а целый навык, который ставит модель на место: она предлагает, а система проверяет и решает.
Репозиторий agents-best-practices уже доступен на GitHub. Ставится одной командой и подходит под разные среды, от Codex до Claude Code.
Что реально изменилось: агенту наконец выдали тормоза, ремни и приборную панель

Главная идея простая: AI-модель больше не «оператор с безлимитными правами». Она работает внутри harness (управляющего контура), где каждый шаг фиксируется и проверяется. Это резко снижает риск странных действий, бесконечных циклов и дорогих ошибок.
Вместо магии «пусть сам разберётся» предлагается строгий цикл: контекст, вызов модели, предложение инструмента, валидация (проверка), разрешение, действие, наблюдение. Такой подход одинаково полезен и для продаж, и для поддержки, и для аналитики.
- Модель предлагает, код приложения проверяет и исполняет.
- У каждого tool call (вызова инструмента) есть результат, даже если это отказ или таймаут (превышение времени).
- Риски разделяются по классам: чтение, черновик, запись, внешняя отправка, финансы, разрушительные действия.
- Опасные шаги идут через approval gate (шлюз согласования), а не через «доверимся модели».
- Бюджеты задаются заранее: шаги, время, токены, стоимость, количество вызовов.
Для занятых людей это звучит так: агент перестаёт быть стажёром без контроля и становится сотрудником с понятным регламентом.
Зачем это сделали и что за этим стоит
Проблема рынка простая: почти все хотят «автономного агента», но получают нестабильный скрипт. Сегодня он гениален, завтра уходит в цикл на 40 вызовов и забывает, зачем начал задачу. Причина чаще в архитектуре, а не в тексте промпта.
Авторы skill (переиспользуемого пакета знаний для агента) бьют ровно в эту боль. Они собрали provider-neutral (независимый от провайдера) подход, который работает и с OpenAI, и с Anthropic, и с совместимыми API.
- Есть шаблон MVP-агента под конкретную бизнес-задачу.
- Есть аудит текущего контура, если агент уже «живой», но ломается.
- Есть гайд по инструментам и правам, чтобы не давать опасные «универсальные кнопки».
- Есть блоки про observability (наблюдаемость), evals (оценочные тесты) и launch gates (условия запуска).
Ключевая мысль: повторяющиеся сбои надо лечить не «новым промптом», а функцией в системе. Это взрослая инженерия, а не шаманство.
Как применить прямо сейчас: 3 сценария для бизнеса и команд
Если у вас нет времени читать десятки файлов, вот рабочий минимум. Он уже даёт пользу на этой неделе, а не «когда-нибудь после рефакторинга».
1) Быстро собрать MVP-агента под реальную задачу
Пример из репозитория: агент по риску продления аккаунтов. Он читает CRM, тикеты поддержки и usage data (данные использования), а затем готовит короткий риск-бриф и черновик следующих шагов.
- Стартуйте с Level 2 harness (контур с согласованием действий).
- Ограничьте набор инструментов до 4-5 узких функций.
- Запустите на 20 исторических кейсах до выхода в прод.
- Проверьте порог принятия: не ниже 80% одобренных черновиков.
2) Починить «живого» агента, который дорогой и нервный
Типичный симптом: агент «залипает», теряет нить после compaction (сжатия контекста) и не может объяснить решения. В таких случаях чинят не фразы, а runtime (рабочий контур).
- Ввести жёсткие лимиты по шагам, времени и стоимости.
- Хранить план, approvals (согласования) и артефакты вне промпта.
- Сделать восстановление активного состояния после сжатия.
- Добавить тесты на injection (внедрение), таймауты и исчерпание бюджета.
3) Подключить Slack, Linear, Drive и внутренние API без самоубийства
Самая частая ошибка, которая потом дорого стоит, это дать агенту широкие команды вроде send_message или write_database. В skill прямо говорят: так делать нельзя.
- Каждое действие, отдельный узкий typed tool (типизированный инструмент).
- Чтение можно автоматизировать при чёткой области доступа.
- Черновики можно делать автоматически, если они явно помечены как draft (черновик).
- Внешние отправки, деплой и финансы, только с отдельной записью согласования.
Установить можно через GitHub-репозиторий или командой через менеджер skills. Подробные пути есть для Codex и Claude Code.
Мы тихо въезжаем в эпоху, где побеждает не самый «умный» AI, а самый управляемый AI. И это отличная новость для тех, кто отвечает за деньги и репутацию.
