Supabase официально выпустила Supabase Evals с открытым исходным кодом — новаторский бенчмарк и фреймворк, разработанный для тщательного тестирования и оценки производительности AI-помощников для написания кода, таких как Claude Code, Codex и OpenCode, в условиях реальных задач разработки Supabase, предоставляя бесценные данные для Software Developers, стремящихся оптимизировать свои рабочие процессы.
- Supabase Evals теперь общедоступен под лицензией Apache-2.0, что позволяет любому Software Developer запускать его локально и вносить свой вклад.
- Бенчмарк отличается тем, что тестирует AI-агентов в реальных, контейнеризированных средах Supabase, а не в симулированных моках, обеспечивая практическую значимость.
- Оценка сочетает детерминированные проверки с подходом LLM-as-a-judge, что позволяет проводить тонкую оценку сгенерированного AI кода.
- Хотя ведущие AI-модели показали высокую базовую производительность, интеграция «навыков» значительно расширила возможности меньших моделей, сократив разрыв в производительности.
Представляем Supabase Evals: новый бенчмарк для AI-помощников для написания кода
В рамках значимого шага для сообщества разработчиков Supabase представила Supabase Evals — инициативу с открытым исходным кодом, направленную на создание прозрачной и практичной системы оценки для AI-помощников для написания кода. Этот новый бенчмарк напрямую отвечает растущей потребности в надежных метриках в быстро развивающемся ландшафте AI-инструментов для разработчиков. Моделируя реальные сценарии, Supabase Evals предлагает уникальный взгляд на то, насколько эффективно AI-агенты могут помогать в выполнении общих задач разработки в экосистеме Supabase, от проектирования схем баз данных до отладки критически важных Edge Functions. Эта инициатива особенно актуальна для Software Developers, которые полагаются на AI для помощи в кодировании и нуждаются в понимании истинных возможностей и ограничений этих сложных инструментов.
Фреймворк — это не просто теоретическое упражнение; он поддерживает публичную таблицу лидеров на supabase.com/evals и служит внутренним набором регрессионных тестов, ежедневно отслеживаемым Supabase. Его развертывание немедленно, репозиторий supabase/evals доступен под лицензией Apache-2.0, что позволяет любому Software Developer запускать его локально с помощью pnpm. Эта доступность делает его ценным ресурсом для отдельных разработчиков, команд и даже организаций в регулируемых отраслях, таких как fintech или healthcare, где точность сгенерированного AI кода, особенно в отношении политик безопасности, таких как Row Level Security (RLS), имеет первостепенное значение.
Как Supabase Evals тестирует AI-агентов в реальных сценариях
Supabase Evals использует сложную методологию для оценки возможностей генерации кода AI. Он определяет три основных измерения: продукты Supabase (например, database, auth, storage, edge functions), темы разработки (например, RLS, security, SQL, SDKs) и этапы разработки (например, build, deploy, investigate, resolve). Создавая минимальный набор сценариев, затрагивающих каждое из этих измерений, основанных на реальных заявках в службу поддержки, отчетах об ошибках и проблемах GitHub, бенчмарк обеспечивает свою актуальность для повседневных задач Software Developer.
Эти сценарии делятся на два набора: сценарии «Benchmark», которые охватывают широкий круг задач и публикуются публично, и сценарии «Regression», которые нацелены на известные режимы сбоев, обновляются ежедневно и не влияют на публичные оценки. Важно отметить, что каждый сценарий выполняется в подлинной среде Supabase. Фреймворк запускает стек, похожий на хостинг, и локальный проект CLI в контейнерах, позволяя AI-агентам взаимодействовать с реальной поверхностью, совместимой с Supabase Management API. Оценка представляет собой гибридный процесс, сочетающий детерминированные проверки на объективную корректность с моделью LLM-as-a-judge для более тонких оценок, предоставляя агентам одну попытку перед окончательной оценкой. Эта надежная установка обеспечивает реалистичную тестовую площадку для различных решений AI для написания кода.
Первоначальные результаты производительности и выявленные недостатки в генерации кода AI
Первоначальные результаты Supabase Evals предлагают ценные сведения о текущем состоянии AI-помощников для написания кода. Многие агенты продемонстрировали высокую базовую производительность, успешно выполнив большинство сценариев даже без загрузки специфических «навыков». Примечательно, что ведущие модели, такие как Opus 5 и Kimi K3, достигли 100% результата на этапе «Build» без посторонней помощи. Для других моделей интеграция «навыков» оказалась очень эффективной в сокращении разрывов в производительности; например, Sonnet 5 улучшился с 78% до 100%, а GPT-5.6 Sol показал рост с 89% до 100%. Это подчеркивает потенциал индивидуального руководства и контекста для улучшения AI для написания кода.
Однако оценки также выявили несколько общих недостатков у протестированных AI-агентов. Повторяющейся проблемой была тенденция агентов вручную писать миграции баз данных вместо использования декларативных подходов к схемам, что побудило Supabase рекомендовать обновления руководства по навыкам. Аналогично, агенты часто проверяли аутентификацию вручную вместо использования пакета @supabase/server, что указывает на необходимость лучшего руководства по выбору пакетов. Кроме того, наблюдалось заметное расхождение в использовании документации: модели, такие как Codex и GPT-5.6, обращались примерно к восьми страницам документации на сценарий, тогда как Claude Code консультировался менее чем с четырьмя, проверяя документацию менее чем в 40% сценариев даже с включенными навыками. Это указывает на различные стратегии того, как различные AI-инструменты для разработчиков подходят к решению проблем и поиску информации.
Практические последствия для Software Developers и будущее AI-инструментов
Для Software Developers Supabase Evals представляет собой жизненно важный новый ресурс для навигации в сложном мире генерации кода AI. Практический вывод ясен: этот бенчмарк предоставляет стандартизированную, реальную тестовую площадку для сравнения и сопоставления различных вариантов AI-помощников для написания кода. Оцениваете ли вы альтернативы GitHub Copilot, такие как Cursor, Tabnine или Amazon CodeWhisperer, или просто хотите понять текущие возможности таких инструментов, как Claude Code и OpenCode, Supabase Evals предлагает данные, основанные на фактах. Он может помочь в принятии решений о том, какие AI-инструменты интегрировать в рабочие процессы разработки, выделить области, где помощь AI сильна, и определить, где человеческий контроль или специализированные навыки по-прежнему незаменимы.
Открытый исходный код Supabase Evals также дает сообществу разработчиков возможность вносить свой вклад в его развитие, помогая уточнять сценарии и расширять его охват. Этот совместный подход гарантирует, что бенчмарк остается актуальным и отражает возникающие проблемы в cloud infrastructure и data platforms. По мере того как инструменты отладки AI и AI для написания кода продолжают развиваться, фреймворки, подобные Supabase Evals, будут иметь решающее значение для обеспечения того, чтобы эти технологии действительно повышали производительность и безопасность разработчиков, а не вводили новые уязвимости или неэффективность. Software Developers могут использовать этот инструмент для принятия обоснованных решений, расширения границ разработки с помощью AI и формирования будущего кодирования.
Еженедельный ИИ-дайджест для вашей профессии
Одно письмо в неделю: изменения в ИИ, которые действительно касаются вашей профессии — сервисы, скидки и что с этим делать.

