Microsoft представила сложную трехуровневую архитектуру маршрутизации для ИИ-агентов в Azure Kubernetes Service (AKS) — разработку, призванную значительно повысить эффективность и экономичность инструментов ИИ-помощников по коду и других агентных рабочих нагрузок для разработчиков программного обеспечения.
Этот новый дизайн решает проблемы управления многочисленными вызовами LLM, интеллектуально направляя запросы к наиболее подходящим и экономически эффективным моделям и ресурсам GPU, предлагая ключевое достижение для ИИ-инструментов повышения производительности разработчиков.
- Оптимизирует трафик агентов LLM в AKS для повышения экономической эффективности и производительности.
- Использует семантическую маршрутизацию, ИИ-прокси и балансировку нагрузки с учетом GPU для интеллектуального распределения запросов.
- Специально разработан для управления большим объемом вызовов, генерируемых агентными рабочими нагрузками, а не общими чат-приложениями.
- Направлен на существенное снижение эксплуатационных расходов за счет динамического выбора наиболее подходящих моделей LLM для каждой задачи.
Оптимизация рабочих нагрузок ИИ-агентов для разработчиков программного обеспечения
Распространение ИИ-агентов, особенно в таких областях, как генерация кода с ИИ и сложная автоматизация, представляет уникальную проблему для разработчиков программного обеспечения: управление огромным объемом вызовов, которые эти агенты совершают к большим языковым моделям (LLM). Одна задача агента, часто работающая в цикле «планирование-действие-наблюдение», может вызывать сотни обращений к LLM. Многие из этих вызовов – например, заполнение аргументов инструментов, принятие бинарных решений или создание кратких сводок – не требуют самых мощных или дорогих «передовых» моделей.
Отправка каждого запроса к модели высшего уровня увеличивает эксплуатационные расходы и задержки, напрямую влияя на скорость и эффективность ИИ-инструментов для разработчиков. Традиционная балансировка нагрузки усугубляет эту проблему, потенциально ставя небольшое, быстрое завершение в очередь за большим, ресурсоемким предварительным заполнением на занятом GPU-поде, в то время как другие ресурсы остаются бездействующими. Новая архитектура Microsoft напрямую решает эту проблему, внедряя интеллектуальные механизмы маршрутизации.
Как работает маршрутизация помощника по коду с ИИ от Microsoft
Эталонная архитектура Microsoft на AKS оптимизирует трафик LLM для помощника по коду с ИИ и других агентных приложений с помощью трехстороннего подхода. Во-первых, RouteLLM выполняет семантическую маршрутизацию, анализируя запрос, чтобы предсказать, может ли менее дорогая модель достичь сопоставимого качества с более мощной. Этот компонент использует маршрутизатор на основе матричной факторизации, обученный на данных человеческих предпочтений, принимая интеллектуальные решения о выборе модели.
Во-вторых, agentgateway действует как открытый, совместимый с OpenAI ИИ-прокси. Он управляет критически важными политиками, такими как аутентификация, ограничения скорости для каждого агента, отслеживание затрат и защитные механизмы, при этом не требуя интерпретации семантического содержимого запросов. Это обеспечивает надежный контроль и управление взаимодействиями ИИ-агентов.
В-третьих, Kubernetes Gateway API Inference Extension’s Endpoint Picker осуществляет балансировку нагрузки с учетом GPU. Он отслеживает текущее состояние ресурсов GPU, в частности, загрузку KV-кэша vLLM и глубину очереди, чтобы эффективно назначать запросы оптимальной реплике выбранной модели. Для локальных развертываний agentgateway может напрямую вызывать Endpoint Picker через ext-proc, минуя отдельный шлюз Gateway API. KAITO предоставляет необходимые пулы узлов GPU и запускает vLLM, поставляя важные метрики, такие как vllm:num_requests_waiting и vllm:kv_cache_usage_perc, которые использует Endpoint Picker. Архитектура направляет высоконагруженные вызовы в Azure OpenAI через ИИ-бэкенд в agentgateway, в то время как менее требовательные вызовы поступают на поды, обслуживаемые KAITO, через сервисный бэкенд с политикой inferenceRouting.
Экономия затрат и влияние на производительность ИИ-инструментов для разработчиков
Эта интеллектуальная архитектура маршрутизации предлагает значительные преимущества в стоимости и производительности для разработчиков программного обеспечения. Тестирование Microsoft с RouteLLM показало, что для определенной пары моделей маршрутизатор на основе матричной факторизации достиг примерно 95% качества MT-Bench модели GPT-4, при этом только около 26% вызовов были перенаправлены на GPT-4. Это привело к потенциальной экономии затрат до 85% по сравнению с маршрутизацией всех вызовов к более мощной модели.
Однако Microsoft подчеркивает, что эта впечатляющая цифра привязана к конкретной паре моделей, использованных для обучения RouteLLM, и не является универсально применимой. Разработчики программного обеспечения должны калибровать «порог эскалации» в соответствии со своим фактическим трафиком агентов и корректировать его на основе разделения на «сильные/слабые» вызовы, наблюдаемого в agentgateway, а не полагаться исключительно на первоначальную оценку RouteLLM. Кроме того, кэширование запросов усложняет расчеты стоимости токенов; кэшированный входной токен получает скидку, а переключение моделей может «охладить» оба кэша, что означает, что истинная стоимость «сильного» вызова может быть ниже, чем кажется на первый взгляд. Этот тонкий подход жизненно важен для максимизации эффективности инструментов отладки ИИ и других сложных ИИ-инструментов для повышения производительности разработчиков.
Интеграция и мониторинг продвинутых систем ИИ-агентов
Для всестороннего контроля Azure Managed Prometheus и Grafana используются для сбора метрик как из agentgateway (метрики маршрутизации и стоимости), так и из vLLM (метрики GPU), предоставляя разработчикам программного обеспечения единое представление о производительности и потреблении ресурсов их системы ИИ-агентов. Этот интегрированный мониторинг необходим для тонкой настройки архитектуры и обеспечения оптимальной работы генерации кода с ИИ и других требовательных рабочих нагрузок.
Важно отметить, что некоторые компоненты этой архитектуры относительно новы, и названия полей могут меняться между выпусками. Несмотря на это, проверенный дизайн предлагает надежную основу для управления сложным трафиком ИИ-агентов. Эта архитектура обеспечивает прочную основу для разработчиков, позволяющую создавать более эффективные и экономичные приложения, будь то работа с альтернативами GitHub Copilot, улучшение существующих ИИ-инструментов для разработчиков, таких как Cursor или Tabnine, или исследование новых горизонтов с Amazon CodeWhisperer и Codeium.
Еженедельный ИИ-дайджест для вашей профессии
Одно письмо в неделю: изменения в ИИ, которые действительно касаются вашей профессии — сервисы, скидки и что с этим делать.

