تصفّح
دليل أدوات الذكاء الاصطناعي مفتوحة المصدر أخبار الذكاء الاصطناعي إحصاءات الذكاء الاصطناعي
تصفّح حسب المهنة
تصميم غرافيكزراعةإدارة المشاريعإنتاج فيديوبرمجياتمبيعات وتسويق كل المهن الـ38 ←
الشركة
من نحن أعلن معنا أضف أداة احصل على الدليل المجاني
الرئيسية دليل الأدوات المسارات المهنية أخبار الذكاء الاصطناعي
💻 البرمجيات

توجيه مساعد الكود بالذكاء الاصطناعي: هندسة AKS من Microsoft تحسن نماذج اللغات الكبيرة (LLMs)

قدمت Microsoft هندسة توجيه متطورة ثلاثية الطبقات لعملاء الذكاء الاصطناعي على Azure Kubernetes Service (AKS)، مما يعزز بشكل كبير أدوات مساعد الكود بالذكاء الاصطناعي.

30 يوليو، 2026· 5 دقائق قراءة
توجيه مساعد الكود بالذكاء الاصطناعي: هندسة AKS من Microsoft تحسن نماذج اللغات الكبيرة (LLMs)

قدمت Microsoft هندسة توجيه متطورة ثلاثية الطبقات لعملاء الذكاء الاصطناعي على Azure Kubernetes Service (AKS)، وهو تطور من شأنه أن يعزز بشكل كبير كفاءة وفعالية التكلفة لأدوات مساعد الكود بالذكاء الاصطناعي وأعباء العمل الوكيلية الأخرى لمطوري البرمجيات.

يعالج هذا التصميم الجديد تحديات إدارة العديد من استدعاءات LLM عن طريق توجيه الطلبات بذكاء إلى النماذج وموارد GPU الأكثر ملاءمة وفعالية من حيث التكلفة، مما يوفر تقدمًا حاسمًا في إنتاجية المطورين في مجال الذكاء الاصطناعي.

تحسين أعباء عمل عملاء الذكاء الاصطناعي لمطوري البرمجيات

يمثل انتشار عملاء الذكاء الاصطناعي، لا سيما في مجالات مثل توليد الكود بالذكاء الاصطناعي والأتمتة المعقدة، تحديًا فريدًا لمطوري البرمجيات: إدارة الحجم الهائل من الاستدعاءات التي يقوم بها هؤلاء العملاء إلى نماذج اللغات الكبيرة (LLMs). يمكن لمهمة عميل واحدة، تعمل غالبًا في حلقة تخطيط-تنفيذ-مراقبة، أن تؤدي إلى مئات استدعاءات LLM. العديد من هذه الاستدعاءات – على سبيل المثال، ملء وسيطات الأدوات، أو اتخاذ قرارات ثنائية، أو إنشاء ملخصات موجزة – لا تتطلب النماذج ‘الرائدة’ الأكثر قوة أو تكلفة.

يؤدي إرسال كل طلب إلى نموذج من الدرجة الأولى إلى تصعيد التكاليف التشغيلية وإدخال زمن انتقال، مما يؤثر بشكل مباشر على سرعة وكفاءة أدوات الذكاء الاصطناعي للمطورين. تفاقم موازنة التحميل التقليدية هذا، مما قد يؤدي إلى وضع إكمال صغير وسريع في قائمة الانتظار خلف عملية تعبئة مسبقة كبيرة ومكثفة للموارد على وحدة GPU مشغولة، بينما تظل الموارد الأخرى خاملة. تتصدى هندسة Microsoft الجديدة لهذا الأمر مباشرة من خلال تقديم آليات توجيه ذكية.

كيف يعمل توجيه مساعد الكود بالذكاء الاصطناعي من Microsoft

تعمل هندسة Microsoft المرجعية على AKS على تبسيط حركة مرور LLM لتطبيقات مساعد الكود بالذكاء الاصطناعي والتطبيقات الوكيلية الأخرى من خلال نهج ثلاثي المحاور. أولاً، يقوم RouteLLM بالتوجيه الدلالي، حيث يفحص المطالبة للتنبؤ بما إذا كان نموذج أقل تكلفة يمكن أن يحقق جودة مماثلة لنموذج أقوى. يستخدم هذا المكون موجهًا يعتمد على تحليل المصفوفات (matrix-factorization router) تم تدريبه على بيانات تفضيلات بشرية، لاتخاذ قرارات ذكية بشأن اختيار النموذج.

ثانيًا، يعمل agentgateway كوكيل ذكاء اصطناعي مفتوح المصدر ومتوافق مع OpenAI. يدير سياسات حاسمة مثل المصادقة، وحدود المعدل لكل عميل، وتتبع التكلفة، والحواجز الوقائية، كل ذلك دون الحاجة إلى تفسير المحتوى الدلالي للمطالبات. وهذا يضمن تحكمًا وحوكمة قويين لتفاعلات عملاء الذكاء الاصطناعي.

ثالثًا، يتعامل Kubernetes Gateway API Inference Extension’s Endpoint Picker مع موازنة التحميل المدركة لوحدة معالجة الرسوميات (GPU-aware load balancing). يراقب الحالة الحية لموارد GPU، وبالتحديد يشاهد إشغال ذاكرة التخزين المؤقت KV-cache وعمق قائمة الانتظار لـ vLLM، لتخصيص الطلبات بكفاءة للنسخة المثلى من النموذج المختار. بالنسبة لعمليات النشر المستضافة ذاتيًا، يمكن لـ agentgateway استدعاء Endpoint Picker مباشرة عبر ext-proc، متجاوزًا بوابة Gateway API منفصلة. يوفر KAITO مجموعات عقد GPU الضرورية ويشغل vLLM، ويزود مقاييس حاسمة مثل vllm:num_requests_waiting و vllm:kv_cache_usage_perc التي يستخدمها Endpoint Picker. تقوم الهندسة بتوجيه الاستدعاءات عالية الطلب إلى Azure OpenAI عبر واجهة خلفية للذكاء الاصطناعي في agentgateway، بينما تذهب الاستدعاءات الأقل طلبًا إلى وحدات KAITO-served عبر واجهة خلفية للخدمة مع سياسة inferenceRouting.

توفير التكاليف وتداعيات الأداء لأدوات الذكاء الاصطناعي للمطورين

توفر هندسة التوجيه الذكية هذه فوائد كبيرة من حيث التكلفة والأداء لمطوري البرمجيات. أظهرت اختبارات Microsoft باستخدام RouteLLM أنه، لزوج معين من النماذج، حقق موجه تحليل المصفوفات حوالي 95% من جودة MT-Bench لـ GPT-4 بينما قام بتصعيد حوالي 26% فقط من الاستدعاءات إلى GPT-4. وقد أدى ذلك إلى توفير محتمل في التكاليف يصل إلى 85% مقارنة بتوجيه جميع الاستدعاءات إلى النموذج الأكثر قوة.

ومع ذلك، تؤكد Microsoft أن هذا الرقم المثير للإعجاب مرتبط بزوج النماذج المحدد المستخدم لتدريب RouteLLM وليس قابلاً للتطبيق عالميًا. يجب على مطوري البرمجيات معايرة ‘عتبة التصعيد’ مقابل حركة مرور العملاء الفعلية لديهم وتعديلها بناءً على الانقسام القوي/الضعيف الملاحظ في agentgateway، بدلاً من الاعتماد فقط على التقدير الأولي لـ RouteLLM. علاوة على ذلك، يضيف التخزين المؤقت للمطالبات تعقيدًا إلى حسابات تكلفة الرمز المميز؛ يتلقى الرمز المميز المدخل المخزن مؤقتًا خصمًا، ويمكن أن يؤدي تبديل النماذج إلى تبريد كلا ذاكرتي التخزين المؤقت، مما يعني أن التكلفة الحقيقية لاستدعاء ‘قوي’ قد تكون أقل مما تبدو عليه في البداية. يعد هذا النهج الدقيق أمرًا حيويًا لزيادة كفاءة أدوات تصحيح الأخطاء بالذكاء الاصطناعي وغيرها من أدوات إنتاجية المطورين المعقدة في مجال الذكاء الاصطناعي.

دمج ومراقبة أنظمة عملاء الذكاء الاصطناعي المتقدمة

لإجراء مراقبة شاملة، يتم استخدام Azure Managed Prometheus و Grafana لجمع المقاييس من كل من agentgateway (مقاييس التوجيه والتكلفة) و vLLM (مقاييس GPU)، مما يوفر لمطوري البرمجيات رؤية موحدة لأداء نظام عملاء الذكاء الاصطناعي الخاص بهم واستهلاك الموارد. تعد هذه المراقبة المتكاملة ضرورية لضبط الهندسة وضمان التشغيل الأمثل لتوليد الكود بالذكاء الاصطناعي وأعباء العمل الأخرى المتطلبة.

من المهم ملاحظة أن بعض المكونات ضمن هذه الهندسة جديدة نسبيًا، وقد تتطور أسماء الحقول بين الإصدارات. على الرغم من ذلك، يوفر التصميم الذي تم التحقق منه إطارًا قويًا لإدارة حركة مرور عملاء الذكاء الاصطناعي المعقدة. توفر هذه الهندسة أساسًا متينًا للمطورين لبناء تطبيقات أكثر كفاءة وفعالية من حيث التكلفة، سواء كانوا يعملون مع بدائل GitHub Copilot، أو يعززون أدوات الذكاء الاصطناعي الحالية للمطورين مثل Cursor أو Tabnine، أو يستكشفون آفاقًا جديدة مع Amazon CodeWhisperer و Codeium.

الأسئلة الشائعة

ما المشكلة التي تحلها هندسة توجيه LLM الجديدة من Microsoft لمطوري البرمجيات؟

تعالج هذه الهندسة التكلفة العالية وزمن الانتقال المرتبطين بالعديد من استدعاءات LLM من عملاء الذكاء الاصطناعي عن طريق توجيه الطلبات بذكاء إلى النماذج وموارد GPU الأكثر ملاءمة وفعالية من حيث التكلفة على Azure Kubernetes Service.

كيف تساعد هذه الهندسة في تقليل التكاليف لعمليات نشر عملاء الذكاء الاصطناعي على AKS؟

تستخدم التوجيه الدلالي (RouteLLM) لتحديد ما إذا كان نموذج أرخص يمكنه الإجابة على استعلام، ووكيل ذكاء اصطناعي (agentgateway) لإدارة السياسات، وموازنة التحميل المدركة لوحدة معالجة الرسوميات (GPU-aware load balancing) لتحسين استخدام الموارد، مما قد يوفر ما يصل إلى 85% من تكاليف LLM.

ما الدور الذي تلعبه المكونات مفتوحة المصدر في نظام التوجيه الجديد هذا؟

تشمل المكونات مفتوحة المصدر الرئيسية agentgateway، وهو وكيل متوافق مع OpenAI، و vLLM، الذي يوفر خدمة LLM فعالة ومقاييس تستخدمها Kubernetes Gateway API Inference Extension لموازنة التحميل الذكية لوحدة معالجة الرسوميات (GPU).

هذه المقالة لأغراض المعلومات العامة فقط ولا تشكّل نصيحة مهنية. كانت الحقائق وتفاصيل المنتجات والأرقام دقيقة حسب علمنا وقت النشر وقد تكون تغيّرت منذ ذلك الحين. زيكاي ناشر مستقل وغير تابع للشركات المذكورة. وجدت خطأً؟ راجع سياسة التصحيحات والإزالة.
#AI news#artificial intelligence#Azure Kubernetes Service#Microsoft#Software Developer

موجز الذكاء الاصطناعي الأسبوعي لمهنتك

بريد واحد أسبوعيًا: تغييرات الذكاء الاصطناعي التي تمسّ مهنتك فعلًا — أدوات وعروض وما يجب فعله.

مجاني · رسالة واحدة أسبوعيًا · مصنّفة حسب المهنة · إلغاء الاشتراك متى شئت