Релиз модели13 сентября 2026 г., 11:47 МСК🤖 Auto

Claude Code v2.1.269: Автоматическая оценка плагинов через AI-бенчмарки

Anthropic добавила в Claude Code инструмент `plugin eval`, позволяющий автоматически генерировать тестовые сценарии и измерять реальную пользу плагинов с помощью AI-судей и сравнения с базовой линией без плагина.

Баннер новости 7385

Новая функция: AI-генерация тестов и оценка пользы

В версии Claude Code v2.1.269 появилась команда claude plugin eval, которая решает главную проблему разработки плагинов для LLM — отсутствие надежных метрик эффективности. Инструмент позволяет не только запускать тесты, но и автоматически генерировать их с помощью команды claude plugin eval init. AI анализирует описание плагина, предлагает промпты и настраивает «судей» (graders) — проверки, которые оценивают результат по критериям от регулярных выражений до оценки вторичной моделью.

Метрика «Чистая польза» (Delta)

Ключевая особенность системы — сравнение работы модели с плагином и без него. Это позволяет отсеять случаи, когда Claude справляется с задачей и так. Результат вычисляется как разница между оценкой с плагином (WITH) и без него (W/OUT). Положительное значение Δ (Delta) подтверждает, что плагин реально улучшает результат.

Метрика Описание Значение для разработчика
WITH Средний балл запусков с активным плагином Показывает общую эффективность решения
W/OUT Средний балл запусков без плагина (Baseline) Показывает, что Claude умеет делать сам
Δ (Delta) Разница: WITH - W/OUT Истинная добавленная стоимость плагина
Threshold Порог прохождения (по умолчанию 1.0) Критерий успешности кейса в CI/CD

Технические детали и стоимость

Каждый тестовый кейс запускается 3 раза для статистической значности (по умолчанию). Для каждого кейса выполняется 6 вызовов модели: 3 с плагином и 3 без. Дополнительно используются короткие вызовы для AI-судей (LLM graders). Команда выводит оценку стоимости в реальном времени, основанную на прайс-листе API, что позволяет контролировать бюджет.

Результаты сохраняются в директории evals/ в виде HTML-отчетов и JSON-файлов. Отчеты можно публиковать по ссылке или хранить локально. Система также поддерживает интеграцию в CI/CD, позволяя блокировать изменения в плагине, если они снижают метрику Δ.

Почему это важно

Ранее разработчики плагинов полагались на интуицию или ручное тестирование. Теперь они могут использовать объективные бенчмарки, генерируемые самим AI, чтобы доказывать эффективность своих инструментов. Это критически важно для enterprise-сегмента, где требуется гарантировать, что кастомные навыки не деградируют при обновлении базовой модели Claude.

Источник: Claude ↗