AI-новости17 мая 2026 г., 18:06 МСК

agents-best-practices: готовый каркас AI-агента, чтобы он не творил дичь в продакшене

Фото новости

Самая важная цифра тут не про токены, а про 80%. Именно такой порог принятия действий человеком предлагают перед запуском AI-агента в работу. И да, это не очередной «просто промпт», а целый навык, который ставит модель на место: она предлагает, а система проверяет и решает.

Репозиторий agents-best-practices уже доступен на GitHub. Ставится одной командой и подходит под разные среды, от Codex до Claude Code.

Что реально изменилось: агенту наконец выдали тормоза, ремни и приборную панель

страница GitHub репозитория agents-best-practices с описанием skill и структурой references
Скриншот: github.com

Главная идея простая: AI-модель больше не «оператор с безлимитными правами». Она работает внутри harness (управляющего контура), где каждый шаг фиксируется и проверяется. Это резко снижает риск странных действий, бесконечных циклов и дорогих ошибок.

Вместо магии «пусть сам разберётся» предлагается строгий цикл: контекст, вызов модели, предложение инструмента, валидация (проверка), разрешение, действие, наблюдение. Такой подход одинаково полезен и для продаж, и для поддержки, и для аналитики.

  • Модель предлагает, код приложения проверяет и исполняет.
  • У каждого tool call (вызова инструмента) есть результат, даже если это отказ или таймаут (превышение времени).
  • Риски разделяются по классам: чтение, черновик, запись, внешняя отправка, финансы, разрушительные действия.
  • Опасные шаги идут через approval gate (шлюз согласования), а не через «доверимся модели».
  • Бюджеты задаются заранее: шаги, время, токены, стоимость, количество вызовов.

Для занятых людей это звучит так: агент перестаёт быть стажёром без контроля и становится сотрудником с понятным регламентом.

Зачем это сделали и что за этим стоит

Проблема рынка простая: почти все хотят «автономного агента», но получают нестабильный скрипт. Сегодня он гениален, завтра уходит в цикл на 40 вызовов и забывает, зачем начал задачу. Причина чаще в архитектуре, а не в тексте промпта.

Авторы skill (переиспользуемого пакета знаний для агента) бьют ровно в эту боль. Они собрали provider-neutral (независимый от провайдера) подход, который работает и с OpenAI, и с Anthropic, и с совместимыми API.

  • Есть шаблон MVP-агента под конкретную бизнес-задачу.
  • Есть аудит текущего контура, если агент уже «живой», но ломается.
  • Есть гайд по инструментам и правам, чтобы не давать опасные «универсальные кнопки».
  • Есть блоки про observability (наблюдаемость), evals (оценочные тесты) и launch gates (условия запуска).

Ключевая мысль: повторяющиеся сбои надо лечить не «новым промптом», а функцией в системе. Это взрослая инженерия, а не шаманство.

Как применить прямо сейчас: 3 сценария для бизнеса и команд

Если у вас нет времени читать десятки файлов, вот рабочий минимум. Он уже даёт пользу на этой неделе, а не «когда-нибудь после рефакторинга».

1) Быстро собрать MVP-агента под реальную задачу

Пример из репозитория: агент по риску продления аккаунтов. Он читает CRM, тикеты поддержки и usage data (данные использования), а затем готовит короткий риск-бриф и черновик следующих шагов.

  • Стартуйте с Level 2 harness (контур с согласованием действий).
  • Ограничьте набор инструментов до 4-5 узких функций.
  • Запустите на 20 исторических кейсах до выхода в прод.
  • Проверьте порог принятия: не ниже 80% одобренных черновиков.

2) Починить «живого» агента, который дорогой и нервный

Типичный симптом: агент «залипает», теряет нить после compaction (сжатия контекста) и не может объяснить решения. В таких случаях чинят не фразы, а runtime (рабочий контур).

  • Ввести жёсткие лимиты по шагам, времени и стоимости.
  • Хранить план, approvals (согласования) и артефакты вне промпта.
  • Сделать восстановление активного состояния после сжатия.
  • Добавить тесты на injection (внедрение), таймауты и исчерпание бюджета.

3) Подключить Slack, Linear, Drive и внутренние API без самоубийства

Самая частая ошибка, которая потом дорого стоит, это дать агенту широкие команды вроде send_message или write_database. В skill прямо говорят: так делать нельзя.

  • Каждое действие, отдельный узкий typed tool (типизированный инструмент).
  • Чтение можно автоматизировать при чёткой области доступа.
  • Черновики можно делать автоматически, если они явно помечены как draft (черновик).
  • Внешние отправки, деплой и финансы, только с отдельной записью согласования.

Установить можно через GitHub-репозиторий или командой через менеджер skills. Подробные пути есть для Codex и Claude Code.

Мы тихо въезжаем в эпоху, где побеждает не самый «умный» AI, а самый управляемый AI. И это отличная новость для тех, кто отвечает за деньги и репутацию.