Новая функция: AI-генерация тестов и оценка пользы
В версии Claude Code v2.1.269 появилась команда claude plugin eval, которая решает главную проблему разработки плагинов для LLM — отсутствие надежных метрик эффективности. Инструмент позволяет не только запускать тесты, но и автоматически генерировать их с помощью команды claude plugin eval init. AI анализирует описание плагина, предлагает промпты и настраивает «судей» (graders) — проверки, которые оценивают результат по критериям от регулярных выражений до оценки вторичной моделью.
Метрика «Чистая польза» (Delta)
Ключевая особенность системы — сравнение работы модели с плагином и без него. Это позволяет отсеять случаи, когда Claude справляется с задачей и так. Результат вычисляется как разница между оценкой с плагином (WITH) и без него (W/OUT). Положительное значение Δ (Delta) подтверждает, что плагин реально улучшает результат.
| Метрика | Описание | Значение для разработчика |
|---|---|---|
| WITH | Средний балл запусков с активным плагином | Показывает общую эффективность решения |
| W/OUT | Средний балл запусков без плагина (Baseline) | Показывает, что Claude умеет делать сам |
| Δ (Delta) | Разница: WITH - W/OUT | Истинная добавленная стоимость плагина |
| Threshold | Порог прохождения (по умолчанию 1.0) | Критерий успешности кейса в CI/CD |
Технические детали и стоимость
Каждый тестовый кейс запускается 3 раза для статистической значности (по умолчанию). Для каждого кейса выполняется 6 вызовов модели: 3 с плагином и 3 без. Дополнительно используются короткие вызовы для AI-судей (LLM graders). Команда выводит оценку стоимости в реальном времени, основанную на прайс-листе API, что позволяет контролировать бюджет.
Результаты сохраняются в директории evals/ в виде HTML-отчетов и JSON-файлов. Отчеты можно публиковать по ссылке или хранить локально. Система также поддерживает интеграцию в CI/CD, позволяя блокировать изменения в плагине, если они снижают метрику Δ.
Почему это важно
Ранее разработчики плагинов полагались на интуицию или ручное тестирование. Теперь они могут использовать объективные бенчмарки, генерируемые самим AI, чтобы доказывать эффективность своих инструментов. Это критически важно для enterprise-сегмента, где требуется гарантировать, что кастомные навыки не деградируют при обновлении базовой модели Claude.
Источник: Claude ↗
