بوابة استدلال Amazon SageMaker HyperPod لاستدلال نماذج LLM القابل للتوسع

:تاريخ النشر24 سبتمبر 2026

تُعد بوابة استدلال Amazon SageMaker HyperPod نظام توجيه أصلي من Kubernetes مدركًا لوحدة معالجة الرسومات (GPU) يتم نشره كإضافة واحدة مُدارة لـ EKS على البنية التحتية الحالية لـ SageMaker HyperPod دون أي تغييرات في التطبيق. من خلال استبدال موازنة التحميل غير الذكية التي تعتمد على التوزيع بالتناوب بنظام التوجيه القائم على الإشارة الاستدلالية في الوقت الفعلي، يقل زمن الاستجابة للرمز الأول بنسبة تصل إلى 82% ويقل p99 TTFT بنسبة 97-98% في سيناريوهات الأجهزة المختلطة وحركة المرور المتلاحقة.

تم بناء البوابة على 3 مكونات أساسية. تقوم Envoy Endpoint بإنهاء حركة مرور HTTPS وتعرض نقطة نهاية خاصة واحدة لكل مجموعة. يقوم Body-Based Router بقراءة اسم النموذج مباشرةً من كل طلب وارد وتوجيهه إلى مجموعة وحدات معالجة الرسومات الصحيحة، مما يتيح لبوابة واحدة خدمة العديد من النماذج من خلال عنوان URL واحد لنقطة النهاية دون الحاجة إلى إجراء تغييرات من جانب العميل. يقوم Endpoint Picker باستمرار بتقييم كل pod لخادم نموذج في الوقت الفعلي عبر 6 إشارات على مستوى الاستدلال، وهم استخدام ذاكرة التخزين المؤقت KV وعمق قائمة الانتظار ووجود محول LoRa ومعدل إصابة ذاكرة التخزين المؤقت للبادئة ووقت الاستجابة المتوقع والطلبات قيد التشغيل، ويحدد وحدة pod المثلى لكل طلب فردي.

تعمل البوابة مع أي خادم نموذج متوافق مع OpenAI، بما في ذلك vLLM وsGlang، ولا تتطلب أي تغييرات في رمز التطبيق.

يتوفر التوجيه لكل مجموعة اليوم في جميع مناطق AWS التي تدعم الوظيفة الإضافية للاستدلال الخاصة بـ SageMaker HyperPod. قريبًا - سيتم طرح التوجيه عبر المجموعات وعبر المناطق من خلال بوابة أسطول مركزية وتحديد عالمي للمعدلات وتشكيل حركة المرور وفقًا لمستوى التكلفة.

لمعرفة المزيد، اقرأ مدونة الإطلاق واستكشف الوثائق