ब्राउज़ करें
एआई डायरेक्टरी ओपन सोर्स एआई समाचार एआई आँकड़े
पेशे के अनुसार ब्राउज़ करें
अनुपालन, ऑडिट और जोखिम के लिए एआईआतिथ्यइंजीनियरिंगई-कॉमर्सऊर्जाकानूनी सभी 38 पेशे →
कंपनी
हमारे बारे में विज्ञापन टूल जोड़ें मुफ़्त गाइड पाएं
होम AI डायरेक्टरी करियर पाथ AI ख़बरें
होम AI ख़बरें डेवलपमेंट
💻 डेवलपमेंट

Supabase Evals: डेवलपर्स के लिए एक AI कोड असिस्टेंट बेंचमार्क

Supabase ने Supabase Evals को ओपन-सोर्स किया है, जो एक नया बेंचमार्क है जो वास्तविक दुनिया के Supabase कार्यों पर AI कोड असिस्टेंट का कठोरता से मूल्यांकन करता है, Software Developers के लिए महत्वपूर्ण अंतर्दृष्टि प्रदान करता है।

2 अगस्त 2026· 7 मिनट में पढ़ें
Supabase Evals: डेवलपर्स के लिए एक AI कोड असिस्टेंट बेंचमार्क

Supabase ने आधिकारिक तौर पर Supabase Evals को ओपन-सोर्स किया है, जो एक अभूतपूर्व बेंचमार्क और फ्रेमवर्क है जिसे Claude Code, Codex, और OpenCode जैसे AI कोड असिस्टेंट के प्रदर्शन का Supabase की वास्तविक विकास चुनौतियों के खिलाफ कठोरता से परीक्षण और स्कोर करने के लिए डिज़ाइन किया गया है, जो अपने वर्कफ़्लो को अनुकूलित करने वाले Software Developers के लिए अमूल्य डेटा प्रदान करता है।

पेश है Supabase Evals: AI कोड असिस्टेंट के लिए एक नया बेंचमार्क

डेवलपर समुदाय के लिए एक महत्वपूर्ण कदम में, Supabase ने Supabase Evals का अनावरण किया है, जो AI कोड असिस्टेंट के लिए एक पारदर्शी और व्यावहारिक मूल्यांकन फ्रेमवर्क प्रदान करने के उद्देश्य से एक ओपन-सोर्स पहल है। यह नया बेंचमार्क डेवलपर्स के लिए AI उपकरणों के तेजी से विकसित हो रहे परिदृश्य में विश्वसनीय मेट्रिक्स की बढ़ती आवश्यकता को सीधे संबोधित करता है। वास्तविक दुनिया के परिदृश्यों का अनुकरण करके, Supabase Evals इस बात पर एक अनूठा दृष्टिकोण प्रदान करता है कि AI एजेंट Supabase इकोसिस्टम के भीतर सामान्य विकास कार्यों में कितनी प्रभावी ढंग से सहायता कर सकते हैं, डेटाबेस स्कीमा डिज़ाइन से लेकर महत्वपूर्ण एज फ़ंक्शंस को डीबग करने तक। यह पहल उन Software Developers के लिए विशेष रूप से प्रासंगिक है जो कोडिंग सहायता के लिए AI पर निर्भर करते हैं और इन परिष्कृत उपकरणों की वास्तविक क्षमताओं और सीमाओं को समझने की आवश्यकता है।

यह फ्रेमवर्क केवल एक सैद्धांतिक अभ्यास नहीं है; यह supabase.com/evals पर एक सार्वजनिक लीडरबोर्ड को शक्ति प्रदान करता है और एक आंतरिक रिग्रेशन सूट के रूप में कार्य करता है, जिसकी Supabase द्वारा दैनिक निगरानी की जाती है। इसकी तैनाती तत्काल है, जिसमें supabase/evals रिपॉजिटरी Apache-2.0 लाइसेंस के तहत सुलभ है, जिससे कोई भी Software Developer इसे pnpm का उपयोग करके स्थानीय रूप से चला सकता है। यह पहुंच इसे व्यक्तिगत डेवलपर्स, टीमों और यहां तक कि फिनटेक या हेल्थकेयर जैसे विनियमित उद्योगों में संगठनों के लिए एक मूल्यवान संसाधन बनाती है, जहां AI-जनित कोड की सटीकता, विशेष रूप से Row Level Security (RLS) जैसी सुरक्षा नीतियों के संबंध में, सर्वोपरि है।

Supabase Evals वास्तविक दुनिया के परिदृश्यों पर AI एजेंटों का परीक्षण कैसे करता है

Supabase Evals AI कोड जनरेशन क्षमताओं का आकलन करने के लिए एक परिष्कृत कार्यप्रणाली का उपयोग करता है। यह तीन मुख्य आयामों को परिभाषित करता है: Supabase उत्पाद (जैसे, डेटाबेस, प्रमाणीकरण, स्टोरेज, एज फ़ंक्शंस), विकास विषय (जैसे, RLS, सुरक्षा, SQL, SDKs), और विकास चरण (जैसे, निर्माण, परिनियोजन, जांच, समाधान)। वास्तविक समर्थन टिकटों, बग रिपोर्टों और GitHub मुद्दों पर आधारित परिदृश्यों का एक न्यूनतम सेट बनाकर जो इनमें से प्रत्येक आयाम को छूते हैं, बेंचमार्क रोजमर्रा के Software Developer चुनौतियों के लिए अपनी प्रासंगिकता सुनिश्चित करता है।

इन परिदृश्यों को दो सुइट्स में वर्गीकृत किया गया है: ‘बेंचमार्क’ परिदृश्य, जो कार्यों की एक विस्तृत श्रृंखला को कवर करते हैं और सार्वजनिक रूप से प्रकाशित होते हैं, और ‘रिग्रेशन’ परिदृश्य, जो ज्ञात विफलता मोड को लक्षित करते हैं, दैनिक रूप से ताज़ा होते हैं, और सार्वजनिक स्कोर को प्रभावित नहीं करते हैं। महत्वपूर्ण रूप से, प्रत्येक परिदृश्य एक वास्तविक Supabase वातावरण के भीतर चलता है। फ्रेमवर्क कंटेनरों में एक होस्टेड-जैसे स्टैक और एक स्थानीय CLI प्रोजेक्ट को स्पिन करता है, जिससे AI एजेंट वास्तविक Supabase Management API-संगत सतह के साथ इंटरैक्ट कर सकते हैं। स्कोरिंग एक हाइब्रिड प्रक्रिया है, जो वस्तुनिष्ठ शुद्धता के लिए नियतात्मक जांच को अधिक सूक्ष्म मूल्यांकन के लिए LLM-as-a-judge मॉडल के साथ जोड़ती है, अंतिम ग्रेडिंग से पहले एजेंटों को एक रिट्राई की अनुमति देती है। यह मजबूत सेटअप विभिन्न कोडिंग AI समाधानों के लिए एक यथार्थवादी परीक्षण मैदान प्रदान करता है।

AI कोड जनरेशन में प्रारंभिक प्रदर्शन अंतर्दृष्टि और पहचानी गई कमजोरियाँ

Supabase Evals से प्राप्त प्रारंभिक निष्कर्ष AI कोड असिस्टेंट की वर्तमान स्थिति में मूल्यवान अंतर्दृष्टि प्रदान करते हैं। कई एजेंटों ने मजबूत आधारभूत प्रदर्शन प्रदर्शित किया, विशेष ‘कौशल’ (skills) लोड किए बिना भी अधिकांश परिदृश्यों को सफलतापूर्वक पूरा किया। विशेष रूप से, Opus 5 और Kimi K3 जैसे शीर्ष मॉडलों ने ‘बिल्ड’ चरण में बिना सहायता के 100% स्कोर प्राप्त किया। अन्य मॉडलों के लिए, ‘कौशल’ (skills) का एकीकरण प्रदर्शन के अंतर को पाटने में अत्यधिक प्रभावी साबित हुआ; उदाहरण के लिए, Sonnet 5 ने 78% से 100% तक सुधार किया, और GPT-5.6 Sol में 89% से 100% तक की वृद्धि देखी गई। यह कोडिंग AI को बढ़ाने के लिए अनुकूलित मार्गदर्शन और संदर्भ की क्षमता को उजागर करता है।

हालांकि, मूल्यांकन ने परीक्षण किए गए AI एजेंटों में कई सामान्य कमजोरियों को भी उजागर किया। एक आवर्ती मुद्दा एजेंटों की घोषणात्मक स्कीमा दृष्टिकोण का लाभ उठाने के बजाय मैन्युअल रूप से डेटाबेस माइग्रेशन लिखने की प्रवृत्ति थी, जिससे Supabase ने कौशल मार्गदर्शन अपडेट की सिफारिश की। इसी तरह, एजेंटों ने अक्सर @supabase/server पैकेज का उपयोग करने के बजाय मैन्युअल रूप से प्रमाणीकरण को सत्यापित किया, जो बेहतर पैकेज चयन मार्गदर्शन की आवश्यकता का सुझाव देता है। इसके अलावा, दस्तावेज़ीकरण के उपयोग में एक उल्लेखनीय असमानता थी: Codex और GPT-5.6 जैसे मॉडलों ने प्रति परिदृश्य लगभग आठ दस्तावेज़ीकरण पृष्ठों तक पहुंच बनाई, जबकि Claude Code ने चार से कम परामर्श किया, कौशल सक्षम होने पर भी 40% से कम परिदृश्यों में दस्तावेज़ों की जांच की। यह दर्शाता है कि डेवलपर्स के लिए विभिन्न AI उपकरण समस्या-समाधान और सूचना पुनर्प्राप्ति के लिए अलग-अलग रणनीतियों का उपयोग करते हैं।

Software Developers और AI उपकरणों के भविष्य के लिए व्यावहारिक निहितार्थ

Software Developers के लिए, Supabase Evals AI कोड जनरेशन की जटिल दुनिया को नेविगेट करने के लिए एक महत्वपूर्ण नया संसाधन प्रस्तुत करता है। व्यावहारिक निष्कर्ष स्पष्ट है: यह बेंचमार्क विभिन्न AI कोड असिस्टेंट विकल्पों की तुलना और अंतर करने के लिए एक मानकीकृत, वास्तविक दुनिया का परीक्षण मैदान प्रदान करता है। चाहे आप GitHub Copilot के विकल्पों जैसे Cursor, Tabnine, या Amazon CodeWhisperer का मूल्यांकन कर रहे हों, या केवल Claude Code और OpenCode जैसे उपकरणों की वर्तमान क्षमताओं को समझना चाहते हों, Supabase Evals डेटा-संचालित अंतर्दृष्टि प्रदान करता है। यह इस बारे में निर्णय लेने में मदद कर सकता है कि किन AI उपकरणों को विकास वर्कफ़्लो में एकीकृत किया जाए, उन क्षेत्रों को उजागर करें जहां AI सहायता मजबूत है, और उन क्षेत्रों की पहचान करें जहां मानवीय निरीक्षण या विशेष कौशल अभी भी अपरिहार्य हैं।

Supabase Evals की ओपन-सोर्स प्रकृति डेवलपर समुदाय को इसके विकास में योगदान करने, परिदृश्यों को परिष्कृत करने और इसके कवरेज का विस्तार करने में भी सशक्त बनाती है। यह सहयोगात्मक दृष्टिकोण सुनिश्चित करता है कि बेंचमार्क क्लाउड इन्फ्रास्ट्रक्चर और डेटा प्लेटफॉर्म में उभरती चुनौतियों के लिए प्रासंगिक और प्रतिबिंबित रहे। जैसे-जैसे AI डीबगिंग उपकरण और कोडिंग AI आगे बढ़ते रहेंगे, Supabase Evals जैसे फ्रेमवर्क यह सुनिश्चित करने में महत्वपूर्ण होंगे कि ये प्रौद्योगिकियां वास्तव में डेवलपर उत्पादकता और सुरक्षा को बढ़ाएं, बजाय इसके कि नई कमजोरियां या अक्षमताएं पेश करें। Software Developers इस उपकरण का लाभ उठाकर सूचित विकल्प चुन सकते हैं, AI-सहायता प्राप्त विकास की सीमाओं को आगे बढ़ा सकते हैं और कोडिंग के भविष्य को आकार दे सकते हैं।

अक्सर पूछे जाने वाले प्रश्न

Supabase Evals मेरे प्रोजेक्ट्स के लिए सबसे अच्छा AI कोड असिस्टेंट चुनने में मेरी मदद कैसे कर सकता है?

Supabase Evals एक सार्वजनिक लीडरबोर्ड और वास्तविक Supabase कार्यों के खिलाफ AI एजेंटों का परीक्षण करने के लिए एक फ्रेमवर्क प्रदान करता है, जिससे आप Claude Code, Codex, और OpenCode जैसे विभिन्न AI कोड असिस्टेंट के प्रदर्शन मेट्रिक्स की व्यावहारिक विकास परिदृश्यों पर तुलना कर सकते हैं।

Supabase Evals AI एजेंटों का किस प्रकार के विकास कार्यों पर मूल्यांकन करता है?

यह बेंचमार्क AI एजेंटों का वास्तविक दुनिया के Supabase कार्यों की एक श्रृंखला पर आकलन करता है, जिसमें डेटाबेस स्कीमा बनाना, Edge Functions को डीबग करना और Row Level Security (RLS) नीतियों को ठीक करना शामिल है, यह सब एक लाइव, कंटेनरीकृत Supabase वातावरण के भीतर होता है।

क्या मैं अपने स्वयं के AI कोड जनरेशन टूल्स या कस्टम स्किल्स का परीक्षण करने के लिए Supabase Evals का उपयोग कर सकता हूँ?

हाँ, Supabase Evals Apache-2.0 के तहत ओपन-सोर्स है और इसे स्थानीय रूप से चलाने के लिए डिज़ाइन किया गया है, जिससे Software Developers अपने स्वयं के AI एजेंटों, कस्टम स्किल्स, या यहां तक कि आंतरिक उपकरणों का इसके व्यापक परिदृश्यों के सूट के खिलाफ मूल्यांकन कर सकते हैं।

यह लेख केवल सामान्य जानकारी के लिए है और पेशेवर सलाह नहीं है। तथ्य, उत्पाद विवरण और आंकड़े प्रकाशन के समय हमारी जानकारी के अनुसार सही थे और तब से बदल सकते हैं। Zekai एक स्वतंत्र प्रकाशक है और उल्लिखित कंपनियों से संबद्ध नहीं है। कोई त्रुटि दिखी? हमारी सुधार और हटाने की नीति देखें।
#AI news#artificial intelligence#code generation#developer tools#Software Developer#Supabase

साप्ताहिक AI ब्रीफ़िंग आपके पेशे के लिए

हफ़्ते में एक ईमेल: AI के वे बदलाव जो सच में आपके पेशे को प्रभावित करते हैं — टूल्स, डील्स और आगे क्या करें।

फ़्री · हफ़्ते में 1 ईमेल · पेशे के हिसाब से · कभी भी अनसब्सक्राइब