L'inferenza di Amazon SageMaker AI ora supporta le istanze G7
L'inferenza di Amazon SageMaker AI ora supporta le istanze G7, alimentate da GPU NVIDIA RTX PRO 4500 Blackwell Server Edition, che ti consentono di distribuire modelli di machine learning con prestazioni di inferenza IA fino a 4,6 volte superiori rispetto alle istanze G6 di generazione precedente. I clienti che distribuiscono modelli di IA generativa per l'inferenza in produzione necessitano di un throughput GPU elevato e di un'ampia capacità di memoria per gestire in modo economicamente vantaggioso modelli di dimensioni medio-grandi, ma le istanze di generazione precedente richiedevano spesso l'overprovisioning di risorse di calcolo costose oppure la quantizzazione dei modelli per rientrare nei limiti di memoria.
Le istanze G7 offrono 32 GB di memoria GPU per GPU con Tensor Core di quinta generazione, fino a 700 Gbps di rete abilitata per EFA (7 volte superiore rispetto a G6) e fino a 7,6 TB di storage NVMe SSD locale, per mantenere i modelli di grandi dimensioni vicini alle risorse di calcolo. Queste caratteristiche rendono le istanze G7 particolarmente adatte per gestire modelli con un numero di parametri compreso tra 7 e 30 miliardi, carichi di lavoro di generazione di immagini e video, ed endpoint di inferenza multi-modello che traggono vantaggio da una maggiore larghezza di banda della memoria e da un throughput più elevato. Puoi distribuire i modelli sulle istanze G7 utilizzando la console, l'API o l'SDK di SageMaker AI Inference, specificando i tipi di istanza G7 (ad esempio da ml.g7.xlarge a ml.g7.48xlarge) nella configurazione dell'endpoint.
Le istanze G7 per l'inferenza di SageMaker AI sono disponibili negli Stati Uniti orientali (Virginia settentrionale, Ohio) e negli Stati Uniti occidentali (Oregon). Per informazioni sui prezzi di queste istanze, visita la nostra pagina dei prezzi.