News

Amazon SageMaker HyperPod Inference Gateway: ما الذي أعلنته AWS

قدّمت AWS بوابة استدلال أصلية لـ Kubernetes على EKS تستخدم إشارات GPU لتوجيه حركة المرور وتقليل زمن الاستجابة أثناء الارتفاعات المفاجئة.
Sep 21, 2026·3 min read
Amazon SageMaker HyperPod Inference Gateway: ما الذي أعلنته AWS

#

النقاط الرئيسية

  • أعلنت AWS عن Amazon SageMaker HyperPod Inference Gateway في 18 سبتمبر 2026.
  • وهي إضافة أصلية لـ Kubernetes لـ Amazon EKS.
  • تقوم البوابة بتوجيه طلبات الاستدلال باستخدام إشارات GPU في الوقت الفعلي.
  • تقول AWS إنها يمكن أن تقلل زمن استجابة أول رمز بما يصل إلى 82 في المئة في النتيجة التي أبلغت عنها.
  • يتم التثبيت عبر دورة حياة إضافات EKS، ولا تحتاج التطبيقات إلى تغييرات في الشيفرة.

ما الذي أعلنته AWS

أعلنت AWS عن Amazon SageMaker HyperPod Inference Gateway في 18 سبتمبر 2026. ويُوصف هذا الخدمة بأنها إضافة أصلية لـ Kubernetes لـ Amazon EKS. وهي جزء من طبقة استدلال HyperPod أوسع للفرق التي تريد تحكمًا أصليًا لـ Kubernetes في عناقيد GPU مخصصة.

يركز الإعلان على توجيه حركة مرور الاستدلال بشكل أكثر ذكاءً. تقول AWS إن البوابة تستخدم إشارات GPU في الوقت الفعلي بدلًا من قرارات عامة من نوع round-robin أو least-connections. والهدف هو تجنب إرسال الحركة إلى pod مشغول بينما لا تزال هناك سعة خاملة متاحة.

كيف توجه البوابة الطلبات

تقول AWS إن البوابة يمكنها أخذ عدة إشارات في الاعتبار عند توجيه الحركة. وتشمل هذه إشارات تشبع ذاكرة التخزين المؤقت KV، والتوليدات ذات السياق الطويل، وما إذا كان pod قد حمّل بالفعل موائم LoRA المطلوب. وهذا يعني أن التوجيه يمكن أن يعكس الحالة الحالية لعبء عمل GPU، وليس فقط عدد الاتصالات المفتوحة.

هذا مهم لأن حركة مرور الاستدلال ليست دائمًا موحدة. قد يبدو pod متاحًا في موازن تحميل بسيط، لكنه لا يزال تحت ضغط بسبب استخدام الذاكرة المؤقتة أو طول السياق. وتضع AWS البوابة كطريقة لاتخاذ قرارات توجيه تتوافق بشكل أفضل مع ظروف وقت التشغيل تلك.

التأثير المعلن على زمن الاستجابة

تذكر AWS أن التوجيه البسيط قد يرفع زمن استجابة أول رمز إلى أكثر من أربع ثوانٍ أثناء الارتفاعات المفاجئة. كما تدعي أن البوابة يمكنها خفض زمن استجابة أول رمز بما يصل إلى 82 في المئة. ويجب قراءة هذا الرقم على أنه نتيجة أبلغت عنها AWS، وليس نتيجة عالمية تم التحقق منها بشكل مستقل.

لا يعد الإعلان بنفس النتيجة لكل عبء عمل. كما أنه لا يعد بخفض ثابت في التكلفة. والرسالة الأساسية تدور حول وضع أفضل للحركة، وتقليل ضغط الطوابير، واستخدام أكثر كفاءة لسعة GPU المتاحة.

نموذج النشر والتشغيل

تقول AWS إن التثبيت يتم عبر دورة حياة إضافات EKS. ولا تحتاج التطبيقات إلى تغييرات في الشيفرة. وهذا يقلل عبء التكامل على الفرق التي تعمل بالفعل على EKS وتريد إضافة توجيه واعٍ لـ GPU دون إعادة كتابة منطق التطبيق.

كما يصف المصدر البوابة بأنها أصلية لـ Kubernetes. ومن الناحية العملية، يشير ذلك إلى أن الخدمة مصممة لتناسب عمليات العنقود الحالية بدلًا من أن تعمل خارجها. ولا يقدم الإعلان قصة أوسع عن نشر العملاء، ولا يذكر ما إذا كانت الخدمة متاحة في كل مناطق AWS.

لماذا تهم تفاصيل التوجيه

يسلط الإعلان الضوء على مفاضلة هندسية شائعة: يمكن أن تسحب كل من زمن الاستجابة، وقرب الذاكرة المؤقتة، واستخدام GPU في اتجاهات مختلفة. قد تكون قاعدة التوجيه البسيطة سهلة التشغيل، لكنها قد ترسل الحركة إلى pod يعاني أصلًا من الضغط. أما الموجه الأكثر وعيًا فيمكنه تحسين التوزيع، لكنه يعتمد أيضًا على جودة الإشارات التي يقرأها.

من الواضح أن AWS تراهن على الوعي بوقت التشغيل. ومن خلال النظر إلى تشبع الذاكرة المؤقتة، والعمل طويل السياق، وحالة الموائم، تحاول البوابة إرسال الطلبات إلى المكان الذي يُرجح أن تبدأ منه بسرعة أكبر. وهذا هو خيار التصميم الأساسي في الإعلان.

الصلة بالمغرب

لا يذكر المصدر أي تفاصيل نشر أو عميل أو توفر خاصة بالمغرب. وبالنسبة للقراء في المغرب، فإن الدرس العام مشروط: قد تكون لخيارات البنية التحتية التي تراعي قرب الذاكرة المؤقتة وحالة GPU أهمية عندما يكون زمن الاستجابة حساسًا.

ما الذي لا يقوله هذا الإعلان

المصدر هو إعلان عن البنية التحتية، وليس دليلًا على نتيجة محددة لعميل بعينه. ولا يثبت وجود وصول في المغرب أو عملاء مغاربة أو أداء خاص بالمغرب. كما أنه لا يقدم نموذج تسعير ثابتًا أو ضمانًا عالميًا لزمن الاستجابة.

وهذا يجعل الإعلان مفيدًا كتحديث للمنتج، لكنه محدود كدليل. ينبغي للقراء التعامل مع الادعاءات على أنها تموضع للمنتج وتقارير أداء صادرة عن AWS. وستعتمد أي نتيجة في العالم الحقيقي على شكل عبء العمل وحالة العنقود وتفاصيل النشر.

تابعونا على Google

أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.

إضافتنا كمصدر مفضّل
تطوير منصات الذكاء الاصطناعي

ما الذي ترغب في بنائه؟

نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.

هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.

الاسم *
البريد الإلكتروني المهني *
المؤسسة (اختياري)
الحل *
وصف مختصر للمشروع *

Related Articles

featured
J
Jawad
·Sep 21, 2026

Amazon SageMaker Inference: مراجعة إطلاقات 2026

featured
J
Jawad
·Sep 21, 2026

نشر نماذج Hugging Face على SageMaker AI باستخدام وكلاء البرمجة

featured
J
Jawad
·Sep 21, 2026

أساسيات الأمن لا تزال مهمة في عصر الذكاء الاصطناعي

featured
J
Jawad
·Sep 21, 2026

EnvHarness من Google يساعد وكلاء الذكاء الاصطناعي على التدريب في بيئات متغيرة