Amazon SageMaker HyperPod unterstützt jetzt Modell-Caching für eine schnellere automatische Inferenzskalierung und weniger Kaltstarts
Amazon SageMaker HyperPod unterstützt jetzt Modell-Caching, eine Inferenzoptimierung, die Modellgewichte und Container-Images vorab auf Cluster-Knoten lädt, sodass Pods in Sekunden statt in Minuten starten.
Wenn LLM-Inferenz in großem Umfang für Workloads wie Chat-Assistenten, agentenbasierte Pipelines, RAG und Dokumentenanalysen ausgeführt wird, ist der Kaltstart ein echter Engpass. Bereitstellungen und Scale-Out-Ereignisse verbringen die meiste Zeit damit, Container-Images und Modellgewichte herunterzuladen. Mit zunehmender Modellgröße wird das Problem noch gravierender, da große Modelle Dutzende von Minuten benötigen, bis sie den Verkehr bedienen können.
Das Modell-Caching löst dieses Problem mit zwei unabhängigen Funktionen. Der Gewichtungs-Cache speichert Modellgewichte auf lokalem NVMe, sodass Pods aus dem schnellen lokalen Speicher lesen, anstatt sie über das Netzwerk von S3 oder FSx abzurufen. Der Image-Cache ruft das Container-Image vorab ab, sodass Pods den ECR-Download vollständig überspringen. Wenn ein Pod auf einem Node ohne Warm-Cache landet, wird automatisch wieder von der ursprünglichen Quelle abgerufen, sodass kein Risiko besteht, dass Pods hängen bleiben oder ausfallen.
Benchmarks für Modelle von 57 GB bis 145 GB zeigen, dass das Scale-Out um rund 60 % schneller ist, und der Image-Cache reduziert die Bildabrufzeit um mehr als zwei Minuten (Reduzierung um 97 %). Der Vorteil wächst mit der Modellgröße, wobei die Zuverlässigkeit des ursprünglichen Quellpfads erhalten bleibt.
Kunden aktivieren das Modell-Caching über den HyperPod Inference Operator, indem sie ihrer InferenceEndpointConfig- oder JumpStartModel-Ressource einen ModelCacheConfig-Abschnitt hinzufügen. Der Bediener kümmert sich um den gesamten Lebenszyklus ohne manuelle Einrichtung oder Bereinigung.
Modell-Caching ist jetzt allgemein in allen Regionen verfügbar, in denen SageMaker HyperPod verfügbar ist. Informationen zum Einstieg finden Sie in der SageMaker HyperPod-Dokumentation.