Суть проекта: тестирование в реальных условиях
Компания Supabase открыла исходный код своего бенчмарка Supabase Evals под лицензией Apache-2.0. В отличие от многих существующих тестов, которые используют упрощенные или синтетические задачи, этот фреймворк запускает агентов в контейнеризованной среде, максимально приближенной к реальной инфраструктуре Supabase. Агенты получают доступ к реальному MCP-серверу и CLI, что позволяет оценивать их способность решать практические проблемы: создание схем баз данных, отладка Edge Functions, исправление политик RLS (Row Level Security) и настройка очередей.
Система оценивает три ключевых аспекта: продукты (база данных, аутентификация, хранилище, edge-functions), темы (безопасность, миграции, SQL, SDK) и этапы (сборка, развертывание, расследование, решение). Сценарии отобраны на основе реальных тикетов в поддержку, отчетов об ошибках и issues на GitHub.
Методология и результаты
Оценка производится с помощью комбинации детерминированных проверок и модели LLM-as-a-judge. Каждому агенту предоставляется одна попытка исправления перед финальным подсчетом баллов. Тесты делятся на две группы: Benchmark (для публичного лидерборда, охватывающие широту задач) и Regression (для ежедневной проверки регрессий, не влияющие на публичные счета).
Ключевые выводы из первых запусков показывают, что топовые модели (Opus 5, Kimi K3) справляются с базовыми задачами без дополнительной настройки, в то время как более скромные модели значительно улучшают результаты при использовании специализированных «навыков» (skills). Также выявлены системные слабости: агенты часто пишут миграции вручную вместо использования декларативных схем и игнорируют пакет @supabase/server для проверки аутентификации.
| Модель / Агент | Результат без навыков (Build stage) | Результат с навыками (Build stage) | Примечание |
|---|---|---|---|
| Opus 5 | 100% | 100% | Высокая автономность |
| Kimi K3 | 100% | 100% | Высокая автономность |
| Sonnet 5 | 78% | 100% | Значительный прирост с skills |
| GPT-5.6 Sol | 89% | 100% | Хорошая база, требует доработки |
| GPT-5.4 mini | 78% | 89% | Наименьший прирост |
| Claude Code | — | — | Читает ~2 страницы документации на сценарий |
| Codex / GPT-5.6 | — | — | Читают ~8 страниц документации на сценарий |
Почему это важно для разработчиков
Для индустрии, где AI-агенты все чаще берут на себя рутинные задачи DevOps и бэкенд-разработки, наличие стандартизированного бенчмарка на реальных сценариях критически важно. Особенно это касается секторов с высокими требованиями к безопасности (финтех, здравоохранение), где ошибка в политике RLS может привести к инциденту. Supabase Evals позволяет командам:
- Регрессионно тестировать изменения в документации и навыках агентов.
- Сравнивать различные «хабы» для агентов (agent harnesses) в одинаковых условиях.
- Гейтировать релизы SDK, проверяя, не сломали ли они работу AI-инструментов.
Фреймворк требует локального запуска через pnpm, наличия Docker-демона, API-ключей провайдеров и свободных портов 54321–54329. Полный код доступен на GitHub по адресу supabase/evals.
Источник: MarkTechPost ↗
