Microsoft, Azure Kubernetes Service (AKS) üzerindeki yapay zeka ajanları için sofistike, üç katmanlı bir yönlendirme mimarisi tanıttı. Bu gelişme, Yazılım Geliştiricileri için yapay zeka kod asistanı araçlarının ve diğer ajans tabanlı iş yüklerinin verimliliğini ve maliyet etkinliğini önemli ölçüde artırmaya hazırlanıyor.
Bu yeni tasarım, çok sayıda LLM çağrısını yönetme zorluklarını, istekleri en uygun ve maliyet açısından en verimli modellere ve GPU kaynaklarına akıllıca yönlendirerek ele alıyor ve geliştirici üretkenliği yapay zekası için kritik bir ilerleme sunuyor.
- AKS üzerindeki LLM ajan trafiğini maliyet verimliliği ve performans için optimize eder.
- Akıllı istek dağıtımı için anlamsal yönlendirme, bir yapay zeka proxy’si ve GPU’ya duyarlı yük dengelemeyi kullanır.
- Genel sohbet uygulamaları için değil, ajans tabanlı iş yükleri tarafından üretilen yüksek hacimli çağrıları yönetmek için özel olarak tasarlanmıştır.
- Her görev için en uygun LLM modellerini dinamik olarak seçerek işletme maliyetlerini önemli ölçüde azaltmayı hedefler.
Yazılım Geliştiricileri için Yapay Zeka Ajan İş Yüklerini Optimize Etme
Yapay zeka ajanlarının, özellikle yapay zeka kod üretimi ve karmaşık otomasyon gibi alanlarda yaygınlaşması, Yazılım Geliştiricileri için benzersiz bir zorluk teşkil ediyor: bu ajanların Büyük Dil Modellerine (LLM’ler) yaptığı çağrıların muazzam hacmini yönetmek. Genellikle planla-hareket et-gözlemle döngüsünde çalışan tek bir ajan görevi, yüzlerce LLM çağrısını tetikleyebilir. Bu çağrıların çoğu – örneğin, araç argümanlarını doldurma, ikili kararlar alma veya kısa özetler oluşturma – en güçlü veya en pahalı ‘sınır’ modellerini gerektirmez.
Her isteği üst düzey bir modele göndermek, işletme maliyetlerini artırır ve gecikme süresi yaratır, bu da geliştiriciler için yapay zeka araçlarının hızını ve verimliliğini doğrudan etkiler. Geleneksel yük dengeleme bu durumu kötüleştirir; yoğun bir GPU podunda küçük, hızlı bir tamamlamayı büyük, kaynak yoğun bir ön doldurmanın arkasına kuyruğa sokabilirken, diğer kaynaklar boşta kalır. Microsoft’un yeni mimarisi, akıllı yönlendirme mekanizmaları sunarak bu sorunu doğrudan ele alıyor.
Microsoft’un Yapay Zeka Kod Asistanı Yönlendirmesi Nasıl Çalışır?
Microsoft’un AKS üzerindeki referans mimarisi, yapay zeka kod asistanı ve diğer ajans tabanlı uygulamalar için LLM trafiğini üç aşamalı bir yaklaşımla kolaylaştırır. İlk olarak, RouteLLM anlamsal yönlendirme yapar, daha ucuz bir modelin daha güçlü bir modele kıyasla benzer kaliteyi sağlayıp sağlayamayacağını tahmin etmek için istemi inceler. Bu bileşen, insan tercihi verileri üzerinde eğitilmiş bir matris-faktörizasyon yönlendiricisi kullanarak model seçimi hakkında akıllı kararlar verir.
İkinci olarak, agentgateway açık kaynaklı, OpenAI uyumlu bir yapay zeka proxy’si olarak işlev görür. Kimlik doğrulama, ajan başına hız limitleri, maliyet takibi ve koruyucu önlemler gibi kritik politikaları, istemlerin anlamsal içeriğini yorumlamaya gerek kalmadan yönetir. Bu, yapay zeka ajan etkileşimleri üzerinde sağlam kontrol ve yönetişim sağlar.
Üçüncü olarak, Kubernetes Gateway API Inference Extension’s Endpoint Picker GPU’ya duyarlı yük dengelemeyi yönetir. GPU kaynaklarının canlı durumunu izler, özellikle vLLM’nin KV-önbellek doluluğuna ve kuyruk derinliğine bakarak, istekleri seçilen modelin en uygun replikasına verimli bir şekilde atar. Kendi kendine barındırılan dağıtımlar için agentgateway, ayrı bir Gateway API ağ geçidini atlayarak ext-proc aracılığıyla Endpoint Picker’ı doğrudan çağırabilir. KAITO gerekli GPU düğüm havuzlarını sağlar ve vLLM’yi çalıştırır, Endpoint Picker’ın kullandığı vllm:num_requests_waiting ve vllm:kv_cache_usage_perc gibi kritik metrikleri sunar. Mimari, yüksek talep gören çağrıları agentgateway’deki bir yapay zeka arka ucu aracılığıyla Azure OpenAI’ye yönlendirirken, daha az talep gören çağrılar inferenceRouting politikasına sahip bir hizmet arka ucu aracılığıyla KAITO tarafından sunulan podlara gider.
Geliştiriciler için Yapay Zeka Araçlarında Maliyet Tasarrufu ve Performans Etkileri
Bu akıllı yönlendirme mimarisi, Yazılım Geliştiricileri için önemli maliyet ve performans avantajları sunar. Microsoft’un RouteLLM ile yaptığı testler, belirli bir model eşleşmesi için matris-faktörizasyon yönlendiricisinin GPT-4’ün MT-Bench kalitesinin yaklaşık %95’ini elde ederken, çağrıların yalnızca yaklaşık %26’sını GPT-4’e yönlendirdiğini gösterdi. Bu, tüm çağrıları daha güçlü modele yönlendirmeye kıyasla %85’e varan potansiyel maliyet tasarrufu sağladı.
Ancak Microsoft, bu etkileyici rakamın RouteLLM’yi eğitmek için kullanılan belirli model çiftine bağlı olduğunu ve evrensel olarak uygulanamayacağını vurguluyor. Yazılım Geliştiricileri, ‘yükseltme eşiğini’ gerçek ajan trafiğine göre kalibre etmeli ve RouteLLM’nin ilk tahminine tamamen güvenmek yerine agentgateway’de gözlemlenen güçlü/zayıf ayrımına göre ayarlamalıdır. Ayrıca, istem önbellekleme, jeton maliyeti hesaplamalarına karmaşıklık katar; önbelleğe alınmış bir giriş jetonu indirim alır ve modelleri değiştirmek her iki önbelleği de soğutabilir, bu da ‘güçlü’ bir çağrının gerçek maliyetinin başlangıçta göründüğünden daha düşük olabileceği anlamına gelir. Bu incelikli yaklaşım, yapay zeka hata ayıklama araçlarının ve diğer karmaşık geliştirici üretkenliği yapay zekasının verimliliğini en üst düzeye çıkarmak için hayati öneme sahiptir.
Gelişmiş Yapay Zeka Ajan Sistemlerini Entegre Etme ve İzleme
Kapsamlı denetim için, hem agentgateway’den (yönlendirme ve maliyet metrikleri) hem de vLLM’den (GPU metrikleri) metrikleri toplamak üzere Azure Managed Prometheus ve Grafana kullanılır ve Yazılım Geliştiricilerine yapay zeka ajan sistemlerinin performansı ve kaynak tüketimi hakkında birleşik bir görünüm sunulur. Bu entegre izleme, mimariyi ince ayar yapmak ve yapay zeka kod üretimi ve diğer zorlu iş yüklerinin optimum çalışmasını sağlamak için hayati öneme sahiptir.
Bu mimarideki bazı bileşenlerin nispeten yeni olduğunu ve alan adlarının sürümler arasında değişebileceğini belirtmek önemlidir. Buna rağmen, doğrulanmış tasarım, karmaşık yapay zeka ajan trafiğini yönetmek için sağlam bir çerçeve sunar. Bu mimari, geliştiricilere GitHub Copilot alternatifleriyle çalışsalar, Cursor veya Tabnine gibi mevcut geliştirici yapay zeka araçlarını geliştirseler veya Amazon CodeWhisperer ve Codeium ile yeni ufuklar keşfetseler bile daha verimli ve maliyet etkin uygulamalar oluşturmaları için sağlam bir temel sağlar.
mesleğiniz için haftalık yapay zekâ bülteni
Haftada tek e-posta: mesleğinizi gerçekten etkileyen yapay zekâ gelişmeleri — araçlar, fırsatlar ve yapmanız gerekenler.

