Amazon SageMaker HyperPod artık daha hızlı çıkarım otomatik ölçeklendirme ve daha az hazırlıksız başlangıç için model önbelleğe almayı destekliyor

Yayınlanma Tarihi: 11 Eyl 2026

Amazon SageMaker HyperPod artık model ağırlıklarını ve container görüntülerini küme düğümlerine önceden yükleyen bir çıkarım optimizasyonu olan model önbelleğe almayı destekliyor, böylece pod'lar dakikalar yerine saniyeler içinde başlatılır.

Sohbet asistanlarını, etken iş hatlarını ve RAG ve belge analizi gibi iş yükleri için LLM çıkarımını uygun ölçekte çalıştırırken, hazırlıksız başlangıç gerçek bir darboğazdır. Dağıtımlar ve ölçeklendirme etkinlikleri, zamanlarının çoğunu container görüntülerini ve model ağırlıklarını indirerek geçirir. Model boyutu arttıkça bu daha da fazla zaman alır; büyük modellerin trafiğe hizmet vermeleri onlarca dakika sürer.

Model önbelleğe alma bunu iki bağımsız özellikle çözer. Ağırlık önbelleği, model ağırlıklarını yerel NVMe'de depolar, böylece pod'lar ağ üzerinden S3 veya FSx'den çekmek yerine hızlı yerel depolamadan okuma yapar. Görüntü önbelleği, container görüntüsünü önceden çeker, böylece pod'lar ECR indirmesini tamamen atlar. Bir pod sıcak önbelleği olmayan bir düğüme inerse, otomatik olarak orijinal kaynaktan çekmeye geri döner, dolayısıyla pod'ların sıkışma veya arızalanma riski yoktur.

57 GB'tan 145 GB'a kadar olan modellerde karşılaştırmalar yaklaşık %60 daha hızlı ölçek genişletme gösterir ve görüntü önbelleği görüntü çekme süresini iki dakikadan fazla azaltır (%97 azalma). Avantaj, orijinal kaynak yolunun güvenilirliğini korurken model boyutuyla birlikte büyür.

Müşteriler, InferenceEndpointConfig veya JumpStartModel kaynaklarına bir modelCacheConfig bölümü ekleyerek HyperPod Çıkarım Operatörü aracılığıyla model önbelleğe almayı etkinleştirir. Operatör, tüm yaşam döngüsünü manuel kurulum veya temizlik yapmadan halleder.

Model önbelleğe alma artık SageMaker HyperPod'un kullanılabildiği tüm bölgelerde genel olarak kullanılabilir. Başlamak için SageMaker HyperPod belgelerine bakın.