Amazon SageMaker HyperPod ora supporta il caching dei modelli per accelerare il dimensionamento automatico dell'inferenza e ridurre gli avvii a freddo

Inserito il: 11 set 2026

Amazon SageMaker HyperPod ora supporta il caching dei modelli, un'ottimizzazione dell'inferenza che precarica i pesi dei modelli e le immagini dei container sui nodi del cluster per ridurre da minuti a pochi secondi il tempo necessario per avviare i pod.

Quando si esegue l'inferenza LLM su larga scala per carichi di lavoro come assistenti di chat, pipeline agentiche, RAG e analisi dei documenti, gli avvii a freddo possono diventare un importante limite alle prestazioni. Durante le distribuzioni e gli eventi di scalabilità orizzontale, la maggior parte del tempo viene impiegata per scaricare le immagini dei container e i pesi dei modelli. Il problema aumenta con le dimensioni del modello: i modelli più grandi possono infatti impiegare decine di minuti prima di essere pronti a gestire il traffico.

Il caching dei modelli risolve il problema grazie a due funzionalità indipendenti. La cache dei pesi archivia i pesi dei modelli su NVMe locale, consentendo ai pod di utilizzare lo spazio di archiviazione locale ad alta velocità invece di recuperarli da S3 o FSx tramite la rete. La cache delle immagini precarica l'immagine del container, così i pod non devono effettuare il download da ECR. Se un pod viene assegnato a un nodo senza una cache pronta, il sistema torna automaticamente a recuperare i dati dalla fonte originale, evitando il rischio che il pod rimanga bloccato o abbia esito negativo.

I benchmark eseguiti su modelli da 57 GB a 145 GB mostrano una scalabilità orizzontale più rapida di circa il 60%, mentre la cache delle immagini elimina oltre due minuti dal tempo di download, con una riduzione del 97%. I vantaggi aumentano per i modelli più grandi, mantenendo al contempo l'affidabilità garantita dall'accesso alla fonte originale.

I clienti possono abilitare il caching dei modelli tramite HyperPod Inference Operator aggiungendo una sezione modelCacheConfig alla risorsa InferenceEndpointConfig o JumpStartModel. L'operatore gestisce automaticamente l'intero ciclo di vita, senza bisogno di configurazione o interventi manuali per la pulizia.

Il caching dei modelli è ora disponibile al pubblico in tutte le regioni AWS in cui è supportato SageMaker HyperPod. Per iniziare, consulta la documentazione di SageMaker HyperPod.