Explorar
Directorio de IA Open Source Noticias de IA Estadísticas de IA
Explorar por profesión
AgriculturaDiseño GráficoLogísticaCiberseguridadCiencia de DatosConstrucción Las 38 profesiones →
Empresa
Acerca de Anunciar Enviar herramienta Obtener la guía gratis
Inicio Directorio de IA Rutas profesionales Noticias de IA
Inicio Noticias de IA desarrollo
💻 desarrollo

Enrutamiento de Asistentes de Código de IA: La Arquitectura AKS de Microsoft Optimiza los LLM

Microsoft ha introducido una sofisticada arquitectura de enrutamiento de tres capas para agentes de IA en Azure Kubernetes Service (AKS), mejorando significativamente las herramientas de asistencia de código de IA.

30 de julio de 2026· 5 min de lectura
Enrutamiento de Asistentes de Código de IA: La Arquitectura AKS de Microsoft Optimiza los LLM

Microsoft ha introducido una sofisticada arquitectura de enrutamiento de tres capas para agentes de IA en Azure Kubernetes Service (AKS), un desarrollo que está a punto de mejorar significativamente la eficiencia y la rentabilidad de las herramientas de asistencia de código de IA y otras cargas de trabajo agénticas para desarrolladores de software.

Este nuevo diseño aborda los desafíos de gestionar numerosas llamadas a LLM dirigiendo inteligentemente las solicitudes a los modelos y recursos de GPU más apropiados y rentables, ofreciendo un avance crucial para la IA de productividad del desarrollador.

Optimización de Cargas de Trabajo de Agentes de IA para Desarrolladores de Software

La proliferación de agentes de IA, particularmente en áreas como la generación de código de IA y la automatización compleja, presenta un desafío único para los desarrolladores de software: gestionar el enorme volumen de llamadas que estos agentes realizan a los Grandes Modelos de Lenguaje (LLM). Una sola tarea de agente, que a menudo opera en un bucle de planificar-actuar-observar, puede desencadenar cientos de llamadas a LLM. Muchas de estas llamadas, por ejemplo, para completar argumentos de herramientas, tomar decisiones binarias o generar resúmenes breves, no requieren los modelos ‘frontera’ más potentes o caros.

Enviar cada solicitud a un modelo de primer nivel aumenta los costos operativos e introduce latencia, lo que afecta directamente la velocidad y eficiencia de las herramientas de IA para los desarrolladores. El balanceo de carga tradicional exacerba esto, pudiendo poner en cola una finalización pequeña y rápida detrás de una precarga grande y que consume muchos recursos en un pod de GPU ocupado, mientras otros recursos permanecen inactivos. La nueva arquitectura de Microsoft aborda directamente esto introduciendo mecanismos de enrutamiento inteligentes.

Cómo Funciona el Enrutamiento de Asistentes de Código de IA de Microsoft

La arquitectura de referencia de Microsoft en AKS optimiza el tráfico de LLM para asistentes de código de IA y otras aplicaciones agénticas a través de un enfoque de tres puntas. Primero, RouteLLM realiza un enrutamiento semántico, examinando el prompt para predecir si un modelo menos costoso puede lograr una calidad comparable a uno más potente. Este componente utiliza un enrutador de factorización de matrices entrenado con datos de preferencia humana, tomando decisiones inteligentes sobre la selección del modelo.

Segundo, agentgateway actúa como un proxy de IA de código abierto compatible con OpenAI. Gestiona políticas críticas como autenticación, límites de tasa por agente, seguimiento de costos y barreras de seguridad, todo sin necesidad de interpretar el contenido semántico de los prompts. Esto asegura un control y gobernanza robustos sobre las interacciones de los agentes de IA.

Tercero, el Endpoint Picker de la Kubernetes Gateway API Inference Extension gestiona el balanceo de carga consciente de la GPU. Monitorea el estado en vivo de los recursos de GPU, específicamente observando la ocupación de la caché KV de vLLM y la profundidad de la cola, para asignar eficientemente las solicitudes a la réplica óptima del modelo elegido. Para implementaciones autoalojadas, agentgateway puede llamar directamente al Endpoint Picker a través de ext-proc, evitando un gateway de API de Gateway separado. KAITO proporciona los grupos de nodos de GPU necesarios y ejecuta vLLM, suministrando métricas cruciales como vllm:num_requests_waiting y vllm:kv_cache_usage_perc que el Endpoint Picker utiliza. La arquitectura enruta las llamadas de alta demanda a Azure OpenAI a través de un backend de IA en agentgateway, mientras que las llamadas menos exigentes van a los pods servidos por KAITO a través de un backend de servicio con una política inferenceRouting.

Implicaciones de Ahorro de Costos y Rendimiento para Herramientas de IA para Desarrolladores

Esta arquitectura de enrutamiento inteligente ofrece importantes beneficios de costo y rendimiento para los desarrolladores de software. Las pruebas de Microsoft con RouteLLM demostraron que, para un emparejamiento de modelos específico, el enrutador de factorización de matrices logró aproximadamente el 95% de la calidad MT-Bench de GPT-4 mientras que solo escaló alrededor del 26% de las llamadas a GPT-4. Esto resultó en ahorros de costos potenciales de hasta el 85% en comparación con enrutar todas las llamadas al modelo más potente.

Sin embargo, Microsoft enfatiza que esta impresionante cifra está ligada al par de modelos específico utilizado para entrenar RouteLLM y no es universalmente aplicable. Los desarrolladores de software deben calibrar el ‘umbral de escalada’ contra su tráfico de agentes real y ajustarlo en función de la división fuerte/débil observada en agentgateway, en lugar de depender únicamente de la estimación inicial de RouteLLM. Además, el almacenamiento en caché de prompts añade complejidad a los cálculos de costos de tokens; un token de entrada en caché recibe un descuento, y cambiar de modelo puede enfriar ambas cachés, lo que significa que el costo real de una llamada ‘fuerte’ podría ser menor de lo que parece inicialmente. Este enfoque matizado es vital para maximizar la eficiencia de las herramientas de depuración de IA y otras IA complejas de productividad del desarrollador.

Integración y Monitoreo de Sistemas Avanzados de Agentes de IA

Para una supervisión integral, Azure Managed Prometheus y Grafana se utilizan para extraer métricas tanto de agentgateway (métricas de enrutamiento y costos) como de vLLM (métricas de GPU), proporcionando a los desarrolladores de software una vista unificada del rendimiento y el consumo de recursos de su sistema de agentes de IA. Este monitoreo integrado es esencial para ajustar la arquitectura y asegurar la operación óptima de la generación de código de IA y otras cargas de trabajo exigentes.

Es importante señalar que algunos componentes dentro de esta arquitectura son relativamente nuevos, y los nombres de los campos pueden evolucionar entre versiones. A pesar de esto, el diseño validado ofrece un marco robusto para gestionar el tráfico complejo de agentes de IA. Esta arquitectura proporciona una base sólida para que los desarrolladores construyan aplicaciones más eficientes y rentables, ya sea que estén trabajando con alternativas a GitHub Copilot, mejorando herramientas de IA existentes para desarrolladores como Cursor o Tabnine, o explorando nuevas fronteras con Amazon CodeWhisperer y Codeium.

Este artículo se ofrece solo como información general y no constituye asesoramiento profesional. Los hechos, detalles de productos y cifras eran correctos según nuestro conocimiento en el momento de la publicación y pueden haber cambiado desde entonces. Zekai es un editor independiente y no está afiliado a las empresas mencionadas. ¿Has visto un error? Consulta nuestra política de correcciones y retirada.
#AI news#artificial intelligence#Azure Kubernetes Service#Microsoft#Software Developer

El briefing semanal de IA para tu profesión

Un correo semanal: los cambios de IA que realmente afectan a tu profesión — herramientas, ofertas y qué hacer al respecto.

Gratis · 1 correo/semana · segmentado por profesión · baja cuando quieras