В мире искусственного интеллекта, где новые модели появляются каждый день, возникает фундаментальная проблема: как объективно измерить их способность решать конкретные инженерные задачи? Обычные бенчмарки часто сводятся к абстрактным тестам на знание синтаксиса или решению математических головоломок, которые мало связаны с реальной разработкой. Именно эту нишу пытается заполнить Supabase, выпустив свой собственный открытый инструмент оценки — Supabase Evals. Это не просто список баллов, а полноценная инфраструктура для проверки того, насколько хорошо AI-агенты справляются с реальными задачами работы с базой данных, аутентификацией, хранилищем и серверной логикой.
Инициатива Supabase знаменует собой сдвиг парадигмы в сторону «экзаменов на реальных данных». Вместо того чтобы полагаться на симуляции или упрощенные примеры, Supabase Evals запускает таких агентов, как Claude Code, Codex и OpenCode, против сценариев, которые ежедневно встречаются в поддержке и разработке. От создания схем баз данных до отладки сломанных политик безопасности (RLS) — каждый тест проверяет не только умение писать код, но и понимание контекста платформы. В этой статье мы подробно разберем, как устроен этот фреймворк, какие результаты он показал и почему это важно для каждого, кто использует AI в своей работе.
01Что такое Supabase Evals и зачем он нужен?
Supabase Evals — это открытый бенчмарк и фреймворк, предназначенный для тестирования AI-агентов, которые используют Supabase. Проект опубликован под лицензией Apache-2.0, что делает его доступным для любого разработчика. Главная цель инструмента — предоставить измеримые метрики того, насколько эффективно агенты могут выполнять задачи в среде, максимально приближенной к реальной.
Почему это важно? Потому что традиционные бенчмарки для LLM (Large Language Models) часто не учитывают специфику конкретных платформ. Модель может отлично знать Python, но совершенно не понимать, как работает распределенная аутентификация в Supabase или как правильно настраивать Row-Level Security (RLS). Supabase Evals закрывает этот пробел, создавая среду, где агенты должны не просто «угадать» код, а запустить его, проверить и исправить ошибки в реальном контейнеризованном окружении.
Фреймворк работает локально через pnpm, что позволяет разработчикам запускать тесты на своих машинах. Это критически важно для индустрии, где конфиденциальность данных и безопасность кода стоят на первом месте. В таких отраслях, как финтех или здравоохранение, ошибка в политике безопасности, написанная AI-агентом, может привести к серьезным инцидентам. Supabase Evals позволяет проверить надежность агентов до того, как они попадут в продакшн.
02Архитектура тестирования: Три измерения
Чтобы создать всестороннюю картину возможностей AI, Supabase определила три ключевых измерения, охватывающих весь спектр функциональности платформы. Это не случайный набор задач, а структурированная система, основанная на реальных тикетах поддержки, отчетах об ошибках и проблемах на GitHub.
1. Продукты (Products)
Первое измерение охватывает основные сервисы Supabase. Агенты тестируются на работе с:
- Database: Создание и изменение схем, работа с SQL.
- Auth: Настройка аутентификации и управления пользователями.
- Storage: Загрузка и управление файлами.
- Edge Functions: Написание и отладка серверного кода на Edge.
- Realtime: Настройка подписок в реальном времени.
- Cron & Queues: Планировщик задач и очереди сообщений.
- Vectors: Работа с векторными данными для AI-приложений.
- Data API: Генерация API на основе схемы базы данных.
2. Темы (Topics)
Второе измерение фокусируется на концептуальных аспектах разработки:

- RLS (Row-Level Security): Безопасность на уровне строк — одна из самых сложных тем для AI.
- Security: Общие вопросы безопасности.
- Migrations: Управление изменениями схемы базы данных.
- SQL: Написание сложных запросов.
- SDK: Использование клиентских библиотек.
- Observability: Мониторинг и логирование.
- Self-hosting: Развертывание Supabase на собственных серверах.
- Tests: Написание тестов для кода.
- Declarative Schema: Управление схемой через декларативные файлы.
3. Этапы (Stages)
Третье измерение отражает жизненный цикл задачи:
- Build: Создание новой функциональности с нуля.
- Deploy: Развертывание кода.
- Investigate: Диагностика проблемы.
- Resolve: Исправление ошибки.
Комбинируя эти измерения, Supabase создала набор сценариев, которые касаются каждой области хотя бы один раз. Это обеспечивает баланс между широтой охвата и глубиной проверки.
03Как работает хайресс (Harness): Реальность против симуляций
Ключевое отличие Supabase Evals от многих других тестов — использование реальных окружений. Агенты не работают с моками или заглушками. Вместо этого фреймворк запускает контейнеризованную среду, имитирующую хостинг Supabase, и локальный CLI-проект.
Процесс выглядит следующим образом:
- Запуск окружения: Фреймворк поднимает Docker-контейнеры с реальным стеком Supabase. Это включает базу данных PostgreSQL, сервер аутентификации и другие сервисы.
- Взаимодействие: AI-агент получает доступ к MCP-серверу (Model Context Protocol) и CLI. Он может выполнять команды, как если бы работал в реальной среде разработки.
- Платформа Lite: Используется runtime
@supabase/lite, который предоставляет поверхность API, совместимую с Management API. Это позволяет агентам управлять ресурсами так, как они делают это в продакшене. - Оценка: Результат оценивается с помощью комбинации детерминированных проверок (проверка кода, выполнение SQL) и LLM-as-a-judge (другая LLM оценивает качество ответа). Агентам предоставляется одна попытка повторного выполнения перед финальной оценкой.
Каждый сценарий оценки содержит три основных файла:

- PROMPT.md: Описание задачи и метаданные.
- EVAL.ts: Скрипт оценки, который проверяет результат.
- local/ или remote/: Начальные состояния проекта. Если указан
local/, фреймворк запускает Docker-песочницу с установленным CLI.
04Результаты: Кто лидирует?
Результаты тестирования показали интересные закономерности. В целом, большинство агентов успешно справляются с базовыми сценариями без дополнительной настройки. Однако разрыв между моделями становится очевидным в более сложных задачах.
Лидеры без навыков (Skills)
На этапе Build (создание) модели Opus 5 и Kimi K3 показали выдающиеся результаты, набрав 100% баллов без использования каких-либо дополнительных навыков или контекстных подсказок. Это говорит о том, что эти модели обладают глубоким пониманием структуры Supabase «из коробки».
Влияние навыков (Skills)
Для других моделей добавление специализированных навыков (skills) стало решающим фактором. Навыки — это, по сути, контекстные подсказки и руководства, которые помогают агенту лучше понять конкретные аспекты платформы. Вот как изменились результаты после загрузки навыков:
- Sonnet 5: Поднялся с 78% до 100%.
- GPT-5.6 Sol: Поднялся с 89% до 100%.
- GPT-5.4 mini: Поднялся с 78% до 89%.
Эти данные показывают, что даже самые продвинутые модели могут нуждаться в помощи, особенно в сложных сценариях. Для меньших моделей навыки имеют еще большее значение, так как они компенсируют нехватку знаний в специфических областях.
05Выявленные слабости AI-агентов
Несмотря на высокие общие баллы, анализ ошибок выявил три системные слабости, которые характерны для большинства AI-агентов. Понимание этих слабостей критически важно для разработчиков, которые хотят использовать AI эффективно.
1. Ручное написание миграций
Агенты часто предпочитают писать миграции баз данных вручную, используя SQL-запросы, вместо того чтобы использовать декларативные схемы (Declarative Schemas). Декларативные схемы — это более современный и безопасный подход, где состояние базы данных описывается в файлах, а изменения применяются автоматически. Ошибка здесь может привести к потере данных или рассинхронизации схемы. Supabase уже выпустила обновление руководства по навыкам, чтобы научить агентов использовать этот подход.

2. Ручная проверка аутентификации
Вместо того чтобы использовать официальный пакет @supabase/server для проверки аутентификации, агенты часто пишут кастомные проверки. Это может привести к уязвимостям безопасности, так как кастомные решения редко бывают настолько надежными, как проверенные библиотеки. В ответ на это Supabase выпустила руководство по выбору пакетов, чтобы направить агентов к правильным инструментам.
3. Разное использование документации
Одним из самых интересных открытий стало различие в том, как агенты используют документацию. Например, Codex и GPT-5.6 читают в среднем около 8 страниц документации на сценарий. В то же время Claude Code читает только около 2 страниц. Более тревожным является тот факт, что Claude Code проверяет документацию менее чем в 40% сценариев, даже когда навыки загружены. Это может объяснять, почему некоторые модели, несмотря на высокую общую оценку, допускают ошибки в специфических деталях.
06Сценарии: Бенчмарк против Регрессии
Supabase Evals разделяет сценарии на два типа, что позволяет использовать их для разных целей.
Бенчмарк (Benchmark)
Эти сценарии охватывают широту функциональности и опубликованы для всеобщего обозрения. Они используются для сравнения различных AI-агентов и моделей. Результаты этих тестов формируют публичный рейтинг на сайте supabase.com/evals.
Регрессия (Regression)
Эти сценарии фокусируются на известных ошибках и режимах отказа. Они обновляются ежедневно и не влияют на опубликованные баллы бенчмарка. Их цель — убедиться, что новые обновления агентов или платформы не ломают существующую функциональность. Это критически важно для поддержания стабильности в долгосрочной перспективе.
07Что это значит на практике
Для разработчиков, использующих Supabase, Supabase Evals — это не просто абстрактный тест. Это практический инструмент, который можно использовать для:
- Выбора AI-агента: Если вы работаете с сложными задачами безопасности, вам может понадобиться модель с высоким баллом в области RLS, даже если она медленнее.
- Настройки навыков: Если ваша модель показывает низкий результат, попробуйте загрузить специализированные навыки. Это может значительно улучшить результаты, особенно для меньших моделей.
- Проверки безопасности: Используйте регрессионные сценарии для ежедневной проверки ваших AI-агентов. Это поможет выявить проблемы до того, как они попадут в продакшн.
- Обучения: Анализируя ошибки, которые допускают агенты, вы можете лучше понять, какие аспекты Supabase сложны для AI, и сосредоточить свои усилия на обучении или настройке.
В конечном итоге, Supabase Evals демонстрирует, что AI-агенты становятся все более способными, но они все еще нуждаются в руководстве и проверке. Открытый характер этого проекта позволяет сообществу участвовать в улучшении этих инструментов, делая разработку с AI более безопасной и эффективной.
08Заключение
Выпуск Supabase Evals — это значительный шаг вперед в области оценки AI-агентов. Предоставляя открытый, детализированный и основанный на реальных задачах бенчмарк, Supabase помогает сообществу лучше понять возможности и ограничения текущих моделей. Для разработчиков это возможность не только выбрать лучший инструмент, но и улучшить свои процессы разработки, делая их более безопасными и эффективными. В мире, где AI становится неотъемлемой частью кода, такие инструменты, как Supabase Evals, становятся необходимыми партнерами в создании надежных приложений.
Вы можете найти технические детали и репозиторий GitHub на официальном сайте Supabase. Следите за обновлениями, так как этот проект продолжает развиваться, и новые сценарии и модели будут добавляться регулярно.
Источник: MarkTechPost ↗
