Amazon SageMaker HyperPod kini mendukung caching model untuk inferensi yang lebih cepat, penskalaan otomatis, dan pengurangan cold start
Amazon SageMaker HyperPod kini mendukung caching model, sebuah optimasi inferensi yang memuat bobot model dan citra kontainer ke simpul klaster sehingga pod dapat mulai berjalan dalam hitungan detik, bukan menit.
Saat menjalankan inferensi LLM dalam skala besar untuk beban kerja seperti asisten chat, pipeline agentik, RAG, dan analisis dokumen, cold start menjadi hambatan nyata. Deployment dan peristiwa scale-out menghabiskan sebagian besar waktunya untuk mengunduh gambar kontainer dan bobot model. Seiring bertambahnya ukuran model, hal ini menjadi semakin buruk, dengan model yang besar membutuhkan waktu puluhan menit sebelum dapat melayani trafik.
Model caching mengatasi hal ini dengan dua kemampuan independen. Cache bobot menyimpan bobot model pada NVMe lokal sehingga pod membaca dari penyimpanan lokal yang cepat, alih-alih mengambilnya dari S3 atau FSx melalui jaringan. Cache gambar melakukan pra-unduh gambar kontainer sehingga pod melewati proses pengunduhan ECR sepenuhnya. Jika pod mendarat di simpul tanpa cache yang siap pakai, pod tersebut akan secara otomatis kembali mengambil data dari sumber aslinya, sehingga tidak ada risiko pod macet atau gagal.
Tolok ukur pada berbagai model mulai dari 57 GB hingga 145 GB menunjukkan peningkatan skala sekitar 60%, dan cache gambar memangkas waktu pengambilan gambar lebih dari dua menit (pengurangan 97%). Manfaatnya meningkat seiring dengan ukuran model sambil tetap mempertahankan keandalan jalur sumber aslinya.
Pelanggan mengaktifkan caching model melalui HyperPod Inference Operator dengan menambahkan bagian modelCacheConfig ke sumber daya InferenceEndpointConfig atau JumpStartModel mereka. Operator menangani seluruh siklus hidup tanpa pengaturan atau pembersihan manual.
Model caching kini tersedia secara umum di semua region tempat SageMaker HyperPod tersedia. Untuk memulai, lihat dokumentasi SageMaker HyperPod.