Rekomendasi Inferensi AI Generatif untuk Amazon SageMaker kini tersedia di SageMaker AI Studio
Amazon SageMaker AI kini menawarkan Rekomendasi Inferensi AI Generatif di SageMaker AI Studio, memberikan pelanggan jalur terpandu, low-code, atau no-code untuk menemukan konfigurasi inferensi terbaik untuk beban kerja mereka. Hal ini melanjutkan peluncuran berbasis API pada bulan April 2026 dengan memperluas infrastruktur tolok ukur yang sama bagi tim yang lebih memilih alur kerja visual dibandingkan akses terprogram.
Menerapkan model AI generatif ke lingkungan produksi mengharuskan temuan kombinasi yang tepat antara jenis instans, kontainer penyajian, dan strategi optimalisasi. Untuk mendapatkan hasil yang tepat biasanya membutuhkan waktu berminggu-minggu untuk melakukan benchmarking manual, penyetelan konfigurasi, dan uji coba, tanpa cara mudah untuk mengetahui apakah pengaturan akhir benar-benar optimal. Dengan pengalaman baru ini, pelanggan menjelaskan beban kerja mereka dan apa yang paling penting, baik itu latensi, throughput, atau biaya, dan SageMaker AI akan melakukan sisanya. Platform ini melakukan benchmark pada berbagai konfigurasi di infrastruktur GPU nyata menggunakan NVIDIA AIPerf, menerapkan teknik yang selaras dengan tujuan seperti decoding spekulatif untuk throughput atau penyetelan kernel untuk latensi, dan mengembalikan rekomendasi yang siap produksi dan berperingkat dengan data kinerja yang terukur. Tim dapat mencapai konfigurasi yang tervalidasi dalam hitungan jam, bukan minggu, tanpa perlu memutuskan teknik mana yang akan diterapkan atau bagaimana mengonfigurasinya.
Dengan pengalaman baru ini, pelanggan menjelaskan beban kerja mereka dan apa yang paling penting, baik itu latensi, throughput, atau biaya, dan SageMaker AI akan melakukan sisanya. Platform ini melakukan benchmark pada berbagai konfigurasi di infrastruktur GPU nyata menggunakan NVIDIA AIPerf, menerapkan teknik yang selaras dengan tujuan seperti decoding spekulatif untuk throughput atau penyetelan kernel untuk latensi, dan mengembalikan rekomendasi yang siap produksi dan berperingkat dengan data kinerja yang terukur. Tim dapat mencapai konfigurasi yang tervalidasi dalam hitungan jam, bukan minggu, tanpa perlu memutuskan teknik mana yang akan diterapkan atau bagaimana mengonfigurasinya.
Di SageMaker AI Studio, pada bagian Jobs dan Inference optimization, pelanggan memilih profil kasus penggunaan (Interact, Generate, Summarize, atau Custom), menentukan tujuan optimalisasi (meminimalkan latensi, memaksimalkan throughput, atau meminimalkan biaya), serta memilih model dari JumpStart, S3, Registri Model, atau model SageMaker yang sudah ada. Rekomendasi diurutkan berdasarkan TTFT, latensi antar-token, throughput, dan biaya, serta dapat dibandingkan secara visual sebelum diterapkan ke titik akhir real-time SageMaker langsung dari Studio.
Tidak ada biaya tambahan untuk menghasilkan rekomendasi. Biaya komputasi standar berlaku untuk pekerjaan optimasi dan titik akhir yang disediakan selama benchmarking. Kemampuan ini tersedia di AS Timur (Virginia Utara), AS Barat (Oregon), AS Timur (Ohio), Eropa (Irlandia), Eropa (Frankfurt), Asia Pasifik (Singapura), Asia Pasifik (Tokyo). Untuk informasi lebih lanjut, kunjungi posting blog atau dokumentasi.