माइक्रोसॉफ्ट ने Azure Kubernetes Service (AKS) पर एआई एजेंटों के लिए एक परिष्कृत त्रि-स्तरीय राउटिंग आर्किटेक्चर पेश किया है, जो सॉफ्टवेयर डेवलपर्स के लिए एआई कोड असिस्टेंट टूल्स और अन्य एजेंटिक वर्कलोड की दक्षता और लागत-प्रभावशीलता को महत्वपूर्ण रूप से बढ़ाने के लिए तैयार है।
यह नया डिज़ाइन LLM कॉल्स की बड़ी संख्या को प्रबंधित करने की चुनौतियों का समाधान करता है, अनुरोधों को सबसे उपयुक्त और लागत-कुशल मॉडल और GPU संसाधनों की ओर बुद्धिमानी से निर्देशित करता है, जो डेवलपर उत्पादकता एआई के लिए एक महत्वपूर्ण प्रगति प्रदान करता है।
- बेहतर लागत दक्षता और प्रदर्शन के लिए AKS पर LLM एजेंट ट्रैफिक को ऑप्टिमाइज़ करता है।
- बुद्धिमान अनुरोध वितरण के लिए सिमेंटिक राउटिंग, एक एआई प्रॉक्सी और GPU-अवेयर लोड बैलेंसिंग का लाभ उठाता है।
- विशेष रूप से एजेंटिक वर्कलोड द्वारा उत्पन्न कॉल्स की उच्च मात्रा को प्रबंधित करने के लिए डिज़ाइन किया गया है, न कि सामान्य चैट एप्लिकेशन के लिए।
- प्रत्येक कार्य के लिए सबसे उपयुक्त LLM मॉडल का गतिशील रूप से चयन करके परिचालन लागत को काफी कम करने का लक्ष्य रखता है।
सॉफ्टवेयर डेवलपर्स के लिए एआई एजेंट वर्कलोड को ऑप्टिमाइज़ करना
एआई एजेंटों का प्रसार, विशेष रूप से एआई कोड जनरेशन और जटिल ऑटोमेशन जैसे क्षेत्रों में, सॉफ्टवेयर डेवलपर्स के लिए एक अनूठी चुनौती प्रस्तुत करता है: इन एजेंटों द्वारा Large Language Models (LLMs) को की जाने वाली कॉल्स की भारी मात्रा का प्रबंधन करना। एक एकल एजेंट कार्य, जो अक्सर प्लान-एक्ट-ऑब्जर्व लूप में संचालित होता है, सैकड़ों LLM कॉल्स को ट्रिगर कर सकता है। इनमें से कई कॉल्स – उदाहरण के लिए, टूल आर्गुमेंट्स भरना, बाइनरी निर्णय लेना, या संक्षिप्त सारांश उत्पन्न करना – सबसे शक्तिशाली या महंगे ‘फ्रंटियर’ मॉडल की आवश्यकता नहीं रखते हैं।
प्रत्येक अनुरोध को एक शीर्ष-स्तरीय मॉडल पर भेजने से परिचालन लागत बढ़ जाती है और विलंबता (latency) आती है, जो डेवलपर्स के लिए एआई टूल्स की गति और दक्षता को सीधे प्रभावित करती है। पारंपरिक लोड बैलेंसिंग इसे और बढ़ा देती है, जिससे एक छोटे, त्वरित पूर्णता को एक व्यस्त GPU पॉड पर एक बड़े, संसाधन-गहन प्रीफिल के पीछे कतारबद्ध किया जा सकता है, जबकि अन्य संसाधन निष्क्रिय रहते हैं। माइक्रोसॉफ्ट का नया आर्किटेक्चर बुद्धिमान राउटिंग तंत्र पेश करके सीधे इस समस्या का समाधान करता है।
माइक्रोसॉफ्ट का एआई कोड असिस्टेंट राउटिंग कैसे काम करता है
AKS पर माइक्रोसॉफ्ट का संदर्भ आर्किटेक्चर एआई कोड असिस्टेंट और अन्य एजेंटिक एप्लिकेशन के लिए LLM ट्रैफिक को त्रि-आयामी दृष्टिकोण के माध्यम से सुव्यवस्थित करता है। सबसे पहले, RouteLLM सिमेंटिक राउटिंग करता है, प्रॉम्प्ट की जांच करके यह अनुमान लगाता है कि क्या एक कम महंगा मॉडल एक मजबूत मॉडल के समान गुणवत्ता प्राप्त कर सकता है। यह घटक मानव-पसंद डेटा पर प्रशिक्षित एक मैट्रिक्स-फैक्टराइजेशन राउटर का उपयोग करता है, जो मॉडल चयन के बारे में बुद्धिमान निर्णय लेता है।
दूसरे, agentgateway एक ओपन-सोर्स, OpenAI-संगत एआई प्रॉक्सी के रूप में कार्य करता है। यह प्रमाणीकरण (authentication), प्रति एजेंट दर सीमा (rate limits), लागत ट्रैकिंग (cost tracking) और गार्डरेल्स (guardrails) जैसी महत्वपूर्ण नीतियों का प्रबंधन करता है, यह सब प्रॉम्प्ट की सिमेंटिक सामग्री की व्याख्या किए बिना। यह एआई एजेंट इंटरैक्शन पर मजबूत नियंत्रण और शासन सुनिश्चित करता है।
तीसरे, Kubernetes Gateway API Inference Extension’s Endpoint Picker GPU-अवेयर लोड बैलेंसिंग को संभालता है। यह GPU संसाधनों की लाइव स्थिति की निगरानी करता है, विशेष रूप से vLLM के KV-कैश ऑक्यूपेंसी और क्यू डेप्थ को देखता है, ताकि चुने हुए मॉडल की इष्टतम प्रतिकृति (replica) को कुशलतापूर्वक अनुरोध असाइन किए जा सकें। स्व-होस्टेड डिप्लॉयमेंट के लिए, agentgateway सीधे ext-proc के माध्यम से Endpoint Picker को कॉल कर सकता है, एक अलग Gateway API गेटवे को बायपास करते हुए। KAITO आवश्यक GPU नोड पूल प्रदान करता है और vLLM चलाता है, जो vllm:num_requests_waiting और vllm:kv_cache_usage_perc जैसे महत्वपूर्ण मेट्रिक्स प्रदान करता है जिनका Endpoint Picker उपयोग करता है। आर्किटेक्चर उच्च-मांग वाली कॉल्स को agentgateway में एक AI बैकएंड के माध्यम से Azure OpenAI पर रूट करता है, जबकि कम मांग वाली कॉल्स inferenceRouting नीति के साथ एक सेवा बैकएंड के माध्यम से KAITO-सेवा वाले पॉड्स पर जाती हैं।
डेवलपर्स के लिए एआई टूल्स के लिए लागत बचत और प्रदर्शन के निहितार्थ
यह बुद्धिमान राउटिंग आर्किटेक्चर सॉफ्टवेयर डेवलपर्स के लिए महत्वपूर्ण लागत और प्रदर्शन लाभ प्रदान करता है। RouteLLM के साथ माइक्रोसॉफ्ट के परीक्षण से पता चला कि, एक विशिष्ट मॉडल पेयरिंग के लिए, मैट्रिक्स-फैक्टराइजेशन राउटर ने GPT-4 की MT-Bench गुणवत्ता का लगभग 95% प्राप्त किया, जबकि केवल लगभग 26% कॉल्स को GPT-4 तक बढ़ाया गया। इसके परिणामस्वरूप अधिक शक्तिशाली मॉडल पर सभी कॉल्स को रूट करने की तुलना में 85% तक की संभावित लागत बचत हुई।
हालांकि, माइक्रोसॉफ्ट इस बात पर जोर देता है कि यह प्रभावशाली आंकड़ा RouteLLM को प्रशिक्षित करने के लिए उपयोग किए गए विशिष्ट मॉडल जोड़ी से जुड़ा है और यह सार्वभौमिक रूप से लागू नहीं है। सॉफ्टवेयर डेवलपर्स को अपने वास्तविक एजेंट ट्रैफिक के मुकाबले ‘एस्केलेशन थ्रेशोल्ड’ को कैलिब्रेट करना चाहिए और agentgateway में देखे गए मजबूत/कमजोर विभाजन के आधार पर इसे समायोजित करना चाहिए, बजाय केवल RouteLLM के प्रारंभिक अनुमान पर निर्भर रहने के। इसके अलावा, प्रॉम्प्ट कैशिंग टोकन लागत गणना में जटिलता जोड़ता है; एक कैश किया गया इनपुट टोकन छूट प्राप्त करता है, और मॉडल बदलने से दोनों कैश ठंडे हो सकते हैं, जिसका अर्थ है कि एक ‘मजबूत’ कॉल की वास्तविक लागत शुरू में जितनी दिखती है उससे कम हो सकती है। यह सूक्ष्म दृष्टिकोण एआई डीबगिंग टूल्स और अन्य जटिल डेवलपर उत्पादकता एआई की दक्षता को अधिकतम करने के लिए महत्वपूर्ण है।
उन्नत एआई एजेंट सिस्टम को एकीकृत और मॉनिटर करना
व्यापक निगरानी के लिए, Azure Managed Prometheus और Grafana का उपयोग agentgateway (राउटिंग और लागत मेट्रिक्स) और vLLM (GPU मेट्रिक्स) दोनों से मेट्रिक्स को स्क्रैप करने के लिए किया जाता है, जो सॉफ्टवेयर डेवलपर्स को उनके एआई एजेंट सिस्टम के प्रदर्शन और संसाधन खपत का एक एकीकृत दृश्य प्रदान करता है। यह एकीकृत निगरानी आर्किटेक्चर को फाइन-ट्यून करने और एआई कोड जनरेशन और अन्य मांग वाले वर्कलोड के इष्टतम संचालन को सुनिश्चित करने के लिए आवश्यक है।
यह ध्यान रखना महत्वपूर्ण है कि इस आर्किटेक्चर के भीतर कुछ घटक अपेक्षाकृत नए हैं, और रिलीज़ के बीच फ़ील्ड नाम विकसित हो सकते हैं। इसके बावजूद, मान्य डिज़ाइन जटिल एआई एजेंट ट्रैफिक के प्रबंधन के लिए एक मजबूत ढांचा प्रदान करता है। यह आर्किटेक्चर डेवलपर्स को अधिक कुशल और लागत प्रभावी एप्लिकेशन बनाने के लिए एक ठोस आधार प्रदान करता है, चाहे वे GitHub Copilot विकल्पों के साथ काम कर रहे हों, Cursor या Tabnine जैसे डेवलपर्स के लिए मौजूदा एआई टूल्स को बढ़ा रहे हों, या Amazon CodeWhisperer और Codeium के साथ नए मोर्चों की खोज कर रहे हों।
अक्सर पूछे जाने वाले प्रश्न
माइक्रोसॉफ्ट का नया LLM राउटिंग आर्किटेक्चर सॉफ्टवेयर डेवलपर्स के लिए क्या समस्या हल करता है?
यह आर्किटेक्चर एआई एजेंटों से होने वाली कई LLM कॉल्स से जुड़ी उच्च लागत और विलंबता (latency) का समाधान करता है, Azure Kubernetes Service पर अनुरोधों को सबसे उपयुक्त और लागत-कुशल मॉडल और GPU संसाधनों पर बुद्धिमानी से रूट करके।
यह आर्किटेक्चर AKS पर एआई एजेंट डिप्लॉयमेंट के लिए लागत कम करने में कैसे मदद करता है?
यह सिमेंटिक राउटिंग (RouteLLM) का उपयोग यह निर्धारित करने के लिए करता है कि क्या एक सस्ता मॉडल किसी क्वेरी का उत्तर दे सकता है, नीति प्रबंधन के लिए एक एआई प्रॉक्सी (agentgateway), और संसाधन उपयोग को अनुकूलित करने के लिए GPU-अवेयर लोड बैलेंसिंग का उपयोग करता है, जिससे LLM लागत में 85% तक की बचत हो सकती है।
इस नई राउटिंग प्रणाली में ओपन-सोर्स घटकों की क्या भूमिका है?
प्रमुख ओपन-सोर्स घटकों में agentgateway, एक OpenAI-संगत प्रॉक्सी, और vLLM शामिल हैं, जो कुशल LLM सर्विंग और मेट्रिक्स प्रदान करता है जिसका उपयोग Kubernetes Gateway API Inference Extension द्वारा बुद्धिमान GPU लोड बैलेंसिंग के लिए किया जाता है।
साप्ताहिक AI ब्रीफ़िंग आपके पेशे के लिए
हफ़्ते में एक ईमेल: AI के वे बदलाव जो सच में आपके पेशे को प्रभावित करते हैं — टूल्स, डील्स और आगे क्या करें।

