Amazon SageMaker AI-Inferenz unterstützt jetzt G7-Instances

Veröffentlicht am: 22. Juli 2026

Amazon SageMaker AI-Inferenz unterstützt jetzt G7-Instances, die auf NVIDIA RTX PRO 4500 Blackwell Server Edition-GPUs basieren, sodass Sie Machine-Learning-Modelle mit einer bis zu 4,6-fachen KI-Inferenzleistung im Vergleich zu G6-Instances der vorherigen Generation bereitstellen können. Kunden, die generative KI-Modelle für die Inferenz in der Produktion einsetzen, benötigen einen hohen GPU-Durchsatz und eine hohe Speicherkapazität, um mittelgroße bis große Modelle kostengünstig unterstützen zu können. Instances der vorherigen Generation erforderten jedoch häufig eine Überbereitstellung teurer Rechen- oder Quantisierungsmodelle, um den Speicherbeschränkungen gerecht zu werden.

G7-Instances bieten 32 GB GPU-Speicher pro GPU mit Tensorkernen der 5. Generation, bis zu 700 Gbit/s EFA-fähigem Networking (7x mehr als G6) und bis zu 7,6 TB lokalen NVMe-SSD-Speicher, sodass große Modelle immer in der Nähe der Rechenleistung sind. Aufgrund dieser Funktionen eignen sich G7-Instances hervorragend für die Bereitstellung von Modellen im Parameterbereich 7B–30B, für Workloads zur Bild- und Videogenerierung sowie für Mulit-Modell-Inferenzendpunkte, die von einer höheren Speicherbandbreite und einem höheren Durchsatz profitieren. Sie können Modelle auf G7-Instances mithilfe der SageMaker AI-Inferenz-Konsole, API oder SDK bereitstellen, indem Sie G7-Instance-Typen (wie ml.g7.xlarge bis ml.g7.48xlarge) in Ihrer Endpunktkonfiguration angeben.

G7-Instances für SageMaker AI-Inferenz sind in den Regionen USA Ost (Nord-Virginia, Ohio) und USA West (Oregon) verfügbar. Preisinformationen zu diesen Instances finden Sie auf unsererPreisseite.