Explorer
Annuaire IA Open Source Actus IA Statistiques IA
Explorer par métier
Design GraphiqueÉtudiantsInvestissement & VCAgricultureAssuranceE-commerce Les 38 métiers →
Société
À propos Annoncer Proposer un outil Obtenir le guide gratuit
Accueil Annuaire IA Parcours métiers Actus IA
Accueil Actus IA Développement
💻 Développement

Routage d’assistants de code IA : L’architecture AKS de Microsoft optimise les LLM

Microsoft a introduit une architecture de routage sophistiquée à trois couches pour les agents IA sur Azure Kubernetes Service (AKS), améliorant considérablement les outils d'assistance au code IA.

30 juillet 2026· 5 min de lecture
Routage d’assistants de code IA : L’architecture AKS de Microsoft optimise les LLM

Microsoft a introduit une architecture de routage sophistiquée à trois couches pour les agents IA sur Azure Kubernetes Service (AKS), un développement qui devrait améliorer considérablement l’efficacité et la rentabilité des outils d’assistance au code IA et d’autres charges de travail agentiques pour les développeurs de logiciels.

Cette nouvelle conception répond aux défis de la gestion de nombreux appels LLM en dirigeant intelligemment les requêtes vers les modèles et les ressources GPU les plus appropriés et les plus rentables, offrant une avancée cruciale pour l’IA de productivité des développeurs.

Optimisation des charges de travail des agents IA pour les développeurs de logiciels

La prolifération des agents IA, en particulier dans des domaines comme la génération de code IA et l’automatisation complexe, présente un défi unique pour les développeurs de logiciels : gérer le volume considérable d’appels que ces agents effectuent vers les grands modèles linguistiques (LLM). Une seule tâche d’agent, fonctionnant souvent dans une boucle planifier-agir-observer, peut déclencher des centaines d’appels LLM. Beaucoup de ces appels – par exemple, le remplissage d’arguments d’outils, la prise de décisions binaires ou la génération de brefs résumés – ne nécessitent pas les modèles « de pointe » les plus puissants ou les plus coûteux.

L’envoi de chaque requête à un modèle de premier ordre augmente les coûts opérationnels et introduit de la latence, ce qui a un impact direct sur la vitesse et l’efficacité des outils d’IA pour les développeurs. L’équilibrage de charge traditionnel exacerbe ce problème, en mettant potentiellement en file d’attente une petite complétion rapide derrière un grand préremplissage gourmand en ressources sur un pod GPU occupé, tandis que d’autres ressources restent inactives. La nouvelle architecture de Microsoft s’attaque directement à ce problème en introduisant des mécanismes de routage intelligents.

Fonctionnement du routage des assistants de code IA de Microsoft

L’architecture de référence de Microsoft sur AKS rationalise le trafic LLM pour les assistants de code IA et d’autres applications agentiques grâce à une approche à trois volets. Premièrement, RouteLLM effectue un routage sémantique, examinant l’invite pour prédire si un modèle moins cher peut atteindre une qualité comparable à un modèle plus puissant. Ce composant utilise un routeur de factorisation matricielle entraîné sur des données de préférence humaine, prenant des décisions intelligentes concernant la sélection du modèle.

Deuxièmement, agentgateway agit comme un proxy IA open-source compatible OpenAI. Il gère des politiques critiques telles que l’authentification, les limites de débit par agent, le suivi des coûts et les garde-fous, le tout sans avoir besoin d’interpréter le contenu sémantique des invites. Cela garantit un contrôle et une gouvernance robustes des interactions des agents IA.

Troisièmement, l’Endpoint Picker de l’extension d’inférence de l’API Gateway de Kubernetes gère l’équilibrage de charge sensible aux GPU. Il surveille l’état en direct des ressources GPU, en examinant spécifiquement l’occupation du cache KV de vLLM et la profondeur de la file d’attente, pour attribuer efficacement les requêtes à la réplique optimale du modèle choisi. Pour les déploiements auto-hébergés, agentgateway peut appeler directement l’Endpoint Picker via ext-proc, en contournant une passerelle API Gateway distincte. KAITO fournit les pools de nœuds GPU nécessaires et exécute vLLM, fournissant des métriques cruciales comme vllm:num_requests_waiting et vllm:kv_cache_usage_perc que l’Endpoint Picker utilise. L’architecture achemine les appels à forte demande vers Azure OpenAI via un backend IA dans agentgateway, tandis que les appels moins exigeants vont vers les pods servis par KAITO via un backend de service avec une politique inferenceRouting.

Économies de coûts et implications en termes de performances pour les outils d’IA destinés aux développeurs

Cette architecture de routage intelligente offre des avantages significatifs en termes de coûts et de performances pour les développeurs de logiciels. Les tests de Microsoft avec RouteLLM ont démontré que, pour un couplage de modèles spécifique, le routeur de factorisation matricielle a atteint environ 95 % de la qualité MT-Bench de GPT-4 tout en n’escaladant qu’environ 26 % des appels vers GPT-4. Cela a permis des économies de coûts potentielles allant jusqu’à 85 % par rapport à l’acheminement de tous les appels vers le modèle plus puissant.

Cependant, Microsoft souligne que ce chiffre impressionnant est lié à la paire de modèles spécifique utilisée pour l’entraînement de RouteLLM et n’est pas universellement applicable. Les développeurs de logiciels doivent calibrer le « seuil d’escalade » par rapport à leur trafic d’agents réel et l’ajuster en fonction de la répartition fort/faible observée dans agentgateway, plutôt que de se fier uniquement à l’estimation initiale de RouteLLM. De plus, la mise en cache des invites ajoute de la complexité aux calculs de coûts des jetons ; un jeton d’entrée mis en cache bénéficie d’une réduction, et le changement de modèle peut refroidir les deux caches, ce qui signifie que le coût réel d’un appel « fort » pourrait être inférieur à ce qu’il semble initialement. Cette approche nuancée est vitale pour maximiser l’efficacité des outils de débogage IA et d’autres IA complexes de productivité des développeurs.

Intégration et surveillance des systèmes d’agents IA avancés

Pour une supervision complète, Azure Managed Prometheus et Grafana sont utilisés pour collecter les métriques d’agentgateway (métriques de routage et de coût) et de vLLM (métriques GPU), offrant aux développeurs de logiciels une vue unifiée des performances et de la consommation des ressources de leur système d’agents IA. Cette surveillance intégrée est essentielle pour affiner l’architecture et assurer le fonctionnement optimal de la génération de code IA et d’autres charges de travail exigeantes.

Il est important de noter que certains composants de cette architecture sont relativement nouveaux et que les noms de champs peuvent évoluer entre les versions. Malgré cela, la conception validée offre un cadre robuste pour la gestion du trafic complexe des agents IA. Cette architecture fournit une base solide aux développeurs pour créer des applications plus efficaces et plus rentables, qu’ils travaillent avec des alternatives à GitHub Copilot, améliorent les outils d’IA existants pour les développeurs comme Cursor ou Tabnine, ou explorent de nouvelles frontières avec Amazon CodeWhisperer et Codeium.

Cet article est fourni à titre d'information générale uniquement et ne constitue pas un conseil professionnel. Les faits, détails produits et chiffres étaient exacts à notre connaissance au moment de la publication et peuvent avoir changé depuis. Zekai est un éditeur indépendant, sans lien avec les entreprises mentionnées. Une erreur ? Consultez notre politique de corrections et retrait.
#AI news#artificial intelligence#Azure Kubernetes Service#Microsoft#Software Developer

Le briefing IA hebdo pour votre métier

Un e-mail par semaine : les changements IA qui touchent vraiment votre métier — outils, offres, et quoi en faire.

Gratuit · 1 e-mail/semaine · segmenté par métier · désabonnement à tout moment