Raccomandazioni sull'inferenza di IA generativa per Amazon SageMaker ora disponibili in SageMaker AI Studio

Inserito il: 20 ago 2026

Amazon SageMaker AI offre ora le raccomandazioni sull'inferenza di IA generativa in SageMaker AI Studio, mettendo a disposizione un percorso guidato low-code/no-code per individuare la configurazione di inferenza ottimale per il proprio carico di lavoro. Ciò si basa sul lancio basato su API dell'aprile 2026, estendendo la medesima infrastruttura di benchmarking ai team che prediligono un flusso di lavoro visivo rispetto all'accesso programmatico.

La distribuzione di modelli di IA generativa in produzione richiede l'individuazione della giusta combinazione di tipo di istanza, container di serving e strategia di ottimizzazione. L'individuazione dell'impostazione corretta richiede in genere settimane di benchmarking manuale, ottimizzazione dei parametri e procedure per tentativi ed errori, senza un modo semplice per sapere se la configurazione finale sia effettivamente quella ottimale. Con la nuova esperienza, è sufficiente descrivere il proprio carico di lavoro e definire le priorità, che si tratti di latenza, throughput o costi, e SageMaker AI gestisce il resto. Il servizio effettua il benchmark di più configurazioni su un'infrastruttura GPU reale utilizzando NVIDIA AIPerf, applica tecniche orientate agli obiettivi (quali la decodifica speculativa per il throughput o il tuning del kernel per la latenza) e restituisce raccomandazioni classificate e pronte per la produzione, corredate dai dati di prestazione rilevati. I team riescono ad ottenere una configurazione convalidata in poche ore anziché in settimane, senza dover definire a priori quali tecniche applicare o come configurarle.

Con la nuova esperienza, è sufficiente descrivere il proprio carico di lavoro e definire le priorità, che si tratti di latenza, throughput o costi, e SageMaker AI gestisce il resto. Il servizio effettua il benchmark di più configurazioni su un'infrastruttura GPU reale utilizzando NVIDIA AIPerf, applica tecniche orientate agli obiettivi (quali la decodifica speculativa per il throughput o il tuning del kernel per la latenza) e restituisce raccomandazioni classificate e pronte per la produzione, corredate dai dati di prestazione rilevati. I team arrivano a una configurazione convalidata in poche ore anziché in settimane, senza dover decidere quali tecniche applicare o come configurarle.

In SageMaker AI Studio, nella sezione Jobs > Inference optimization, è possibile selezionare un profilo per il caso d'uso (Interact, Generate, Summarize o Custom), scegliere un obiettivo di ottimizzazione (ridurre al minimo la latenza, massimizzare il throughput o ridurre al minimo i costi) e selezionare il modello da JumpStart, S3, Model Registry o da un modello SageMaker esistente. Le raccomandazioni vengono classificate in base a TTFT, latenza inter-token, throughput e costi, e possono essere confrontate visivamente prima di eseguire la distribuzione su un endpoint SageMaker in tempo reale direttamente da Studio.

Non è previsto alcun costo aggiuntivo per la generazione delle raccomandazioni. Si applicano i costi di elaborazione standard per i processi di ottimizzazione e per gli endpoint sottoposti a provisioning durante le attività di benchmarking. Questa funzionalità è disponibile nelle regioni Stati Uniti orientali (Virginia settentrionale), Stati Uniti occidentali (Oregon), Stati Uniti orientali (Ohio), Europa (Irlanda), Europa (Francoforte), Asia-Pacifico (Singapore) e Asia-Pacifico (Tokyo). Per ulteriori informazioni, consulta il post del blog o la documentazione.