Generative AI-Inferenzempfehlung für Amazon SageMaker jetzt im SageMaker AI Studio verfügbar
Amazon SageMaker AI bietet jetzt Generative AI-Inferenzempfehlungen in SageMaker AI Studio an und bietet Kunden einen geführten Low-Code-Nocode-Pfad, um die beste Inferenzkonfiguration für ihren Workload zu finden. Das baut auf dem API-basierten Launch im April 2026 auf und erweitert dieselbe Benchmarking-Infrastruktur auf Teams, die einen visuellen Workflow dem programmatischen Zugriff vorziehen.
Für den Einsatz generativer KI-Modelle in der Produktion muss die richtige Kombination aus Instance-Typ, Serving-Container und Optimierungsstrategie gefunden werden. Um das richtig zu machen, sind in der Regel wochenlanges manuelles Benchmarking, Konfigurationstuning und Ausprobieren erforderlich, ohne dass einfach festgestellt werden kann, ob das endgültige Setup tatsächlich optimal ist. Mit der neuen Erfahrung beschreiben Kunden ihren Workload und was am wichtigsten ist, ob das Latenz, Durchsatz oder Kosten sind, und SageMaker AI erledigt den Rest. Es vergleicht mehrere Konfigurationen auf einer realen GPU-Infrastruktur mit NVIDIA AiPerf, wendet zielgerichtete Techniken wie spekulative Dekodierung für den Durchsatz oder Kernel-Tuning für Latenz an und gibt rangierte, produktionsreife Empfehlungen mit gemessenen Performance-Daten zurück. Teams erhalten innerhalb von Stunden statt Wochen eine validierte Konfiguration, ohne entscheiden zu müssen, welche Techniken angewendet oder wie sie konfiguriert werden sollen.
Mit der neuen Erfahrung beschreiben Kunden ihren Workload und was am wichtigsten ist, ob das Latenz, Durchsatz oder Kosten sind, und SageMaker AI erledigt den Rest. Es vergleicht mehrere Konfigurationen auf einer realen GPU-Infrastruktur mit NVIDIA AiPerf, wendet zielgerichtete Techniken wie spekulative Dekodierung für den Durchsatz oder Kernel-Tuning für Latenz an und gibt rangierte, produktionsreife Empfehlungen mit gemessenen Performance-Daten zurück. Teams erhalten innerhalb von Stunden statt Wochen eine validierte Konfiguration, ohne entscheiden zu müssen, welche Techniken angewendet oder wie sie konfiguriert werden sollen.
In SageMaker AI Studio wählen Kunden unter Jobs, Inferenzoptimierung ein Anwendungsfallprofil (Interact, Generate, Summarize oder Custom) aus, wählen ein Optimierungsziel (Latenz minimieren, Durchsatz maximieren oder Kosten minimieren) und wählen ihr Modell aus JumpStart, S3, Model Registry oder einem vorhandenen SageMaker-Modell aus. Die Empfehlungen sind nach TTFT, Latenz zwischen den Token, Durchsatz und Kosten geordnet und können visuell verglichen werden, bevor sie direkt von Studio aus auf einem SageMaker-Echtzeit-Endpunkt bereitgestellt werden.
Für die Generierung von Empfehlungen fallen keine zusätzlichen Kosten an. Die Standard-Rechenkosten fallen für Optimierungsaufträge und Endpunkte an, die während des Benchmarkings bereitgestellt werden. Diese Funktion ist in den USA Ost (Nord-Virginia), USA West (Oregon), USA Ost (Ohio), Europa (Irland), Europa (Frankfurt), Asien-Pazifik (Singapur) und Asien-Pazifik (Tokio) verfügbar. Weitere Informationen finden Sie im Blogbeitrag oder in der Dokumentation.