Amazon SageMaker HyperPod تدعم الآن التخزين المؤقت للنماذج لتسريع التحجيم التلقائي للاستدلال وتقليل أوقات التهيئة الأولية

:تاريخ النشر11 سبتمبر 2026

يدعم Amazon SageMaker HyperPod الآن التخزين المؤقت للنماذج، وهي تقنية لتحسين الاستدلال تقوم بتحميل أوزان النماذج وصور الحاويات مسبقًا إلى عقد المجموعة بحيث تبدأ وحدات pod في ثوانٍ بدلاً من دقائق.

عند تشغيل استدلال نموذج اللغة الكبير (LLM) على نطاق واسع لأعباء العمل مثل مساعدي الدردشة والمسارات القائمة على الوكلاء والتوليد المعزز بالاسترداد (RAG) وتحليل المستندات، فإن زمن التهيئة الأولية يمثل عقبة حقيقية. تستهلك عمليات النشر وأحداث التوسع معظم وقتها في تنزيل صور الحاوية وأوزان النماذج. ومع زيادة حجم النموذج، يزداد الأمر سوءًا، حيث تستغرق النماذج الكبيرة عشرات الدقائق قبل أن تتمكن من خدمة حركة المرور.

يعمل التخزين المؤقت للنماذج على حل هذه المشكلة من خلال إمكانيتين مستقلتين. تقوم ذاكرة التخزين المؤقت للأوزان بتخزين أوزان النماذج على NVMe المحلي بحيث تقرأ وحدات pod من التخزين المحلي السريع بدلاً من السحب من S3 أو FSx عبر الشبكة. تقوم ذاكرة التخزين المؤقت للصور بسحب صورة الحاوية مسبقًا حتى تتخطى وحدات pod تنزيل ECR تمامًا. إذا تم تشغيل pod على عقدة بدون ذاكرة تخزين مؤقت مُهيأة، فإنها تعود إلى السحب من المصدر الأصلي تلقائيًا، لذلك لا يوجد خطر تعطل وحدات pod أو فشلها.

تُظهر المعايير عبر نماذج يتراوح حجمها من 57 غيغابايت إلى 145 غيغابايت إمكانية توسيع النطاق بشكل أسرع بنسبة 60% تقريبًا، وتخفّض ذاكرة التخزين المؤقت للصور أكثر من دقيقتين من وقت سحب الصورة (أي تقليل بنسبة 97%). تزداد الفائدة مع حجم النموذج مع الاحتفاظ بموثوقية مسار المصدر الأصلي.

يقوم العملاء بتمكين التخزين المؤقت للنماذج من خلال HyperPod Inference Operator عن طريق إضافة قسم ModelCacheConfig إلى مورد InferenceEndpointConfig أو JumpstartModel الخاص بهم. يتولى المشغل دورة الحياة الكاملة بدون إعداد أو تنظيف يدوي.

يتوفر التخزين المؤقت للنماذج الآن بشكل عام في جميع المناطق التي يتوفر فيها SageMaker HyperPod. للبدء، راجع وثائق SageMaker HyperPod.