Инструменты1 августа 2026 г., 13:16 МСК🤖 Auto

Supabase Evals: открытый бенчмарк для AI-агентов на реальных задачах

Supabase выпустила Supabase Evals — фреймворк с открытым исходным кодом, который тестирует AI-агентов (Claude Code, Codex, OpenCode) на реальных задачах разработки, а не на синтетических данных.

Баннер новости 4873

Суть проекта: тестирование в реальных условиях

Компания Supabase открыла исходный код своего бенчмарка Supabase Evals под лицензией Apache-2.0. В отличие от многих существующих тестов, которые используют упрощенные или синтетические задачи, этот фреймворк запускает агентов в контейнеризованной среде, максимально приближенной к реальной инфраструктуре Supabase. Агенты получают доступ к реальному MCP-серверу и CLI, что позволяет оценивать их способность решать практические проблемы: создание схем баз данных, отладка Edge Functions, исправление политик RLS (Row Level Security) и настройка очередей.

Система оценивает три ключевых аспекта: продукты (база данных, аутентификация, хранилище, edge-functions), темы (безопасность, миграции, SQL, SDK) и этапы (сборка, развертывание, расследование, решение). Сценарии отобраны на основе реальных тикетов в поддержку, отчетов об ошибках и issues на GitHub.

Методология и результаты

Оценка производится с помощью комбинации детерминированных проверок и модели LLM-as-a-judge. Каждому агенту предоставляется одна попытка исправления перед финальным подсчетом баллов. Тесты делятся на две группы: Benchmark (для публичного лидерборда, охватывающие широту задач) и Regression (для ежедневной проверки регрессий, не влияющие на публичные счета).

Ключевые выводы из первых запусков показывают, что топовые модели (Opus 5, Kimi K3) справляются с базовыми задачами без дополнительной настройки, в то время как более скромные модели значительно улучшают результаты при использовании специализированных «навыков» (skills). Также выявлены системные слабости: агенты часто пишут миграции вручную вместо использования декларативных схем и игнорируют пакет @supabase/server для проверки аутентификации.

Модель / Агент Результат без навыков (Build stage) Результат с навыками (Build stage) Примечание
Opus 5 100% 100% Высокая автономность
Kimi K3 100% 100% Высокая автономность
Sonnet 5 78% 100% Значительный прирост с skills
GPT-5.6 Sol 89% 100% Хорошая база, требует доработки
GPT-5.4 mini 78% 89% Наименьший прирост
Claude Code Читает ~2 страницы документации на сценарий
Codex / GPT-5.6 Читают ~8 страниц документации на сценарий

Почему это важно для разработчиков

Для индустрии, где AI-агенты все чаще берут на себя рутинные задачи DevOps и бэкенд-разработки, наличие стандартизированного бенчмарка на реальных сценариях критически важно. Особенно это касается секторов с высокими требованиями к безопасности (финтех, здравоохранение), где ошибка в политике RLS может привести к инциденту. Supabase Evals позволяет командам:

  • Регрессионно тестировать изменения в документации и навыках агентов.
  • Сравнивать различные «хабы» для агентов (agent harnesses) в одинаковых условиях.
  • Гейтировать релизы SDK, проверяя, не сломали ли они работу AI-инструментов.

Фреймворк требует локального запуска через pnpm, наличия Docker-демона, API-ключей провайдеров и свободных портов 54321–54329. Полный код доступен на GitHub по адресу supabase/evals.

Источник: MarkTechPost ↗