Đề xuất suy luận AI tạo sinh cho Amazon SageMaker hiện đã có sẵn trong Studio SageMaker AI
Amazon SageMaker AI hiện cung cấp Đề xuất suy luận AI tạo sinh trong Studio SageMaker AI, cung cấp cho khách hàng một lộ trình có hướng dẫn, ít cần viết mã, không cần viết mã để tìm cấu hình suy luận tốt nhất cho khối lượng công việc của họ. Tính năng này bổ sung cho lần ra mắt dựa trên API vào tháng 4 năm 2026, mở rộng cơ sở hạ tầng định chuẩn tương tự cho các đội ngũ ưu tiên quy trình công việc trực quan so với truy cập thông qua lập trình.
Việc triển khai các mô hình AI tạo sinh trong môi trường sản xuất đòi hỏi phải tìm ra sự kết hợp phù hợp giữa loại phiên bản, bộ chứa phân phối và chiến lược tối ưu hóa. Để thực hiện đúng, thông thường sẽ mất nhiều tuần định chuẩn thủ công, điều chỉnh cấu hình, cũng như thử và sai, không có cách nào dễ dàng để biết thiết lập cuối cùng có thực sự tối ưu hay không. Với trải nghiệm mới này, khách hàng sẽ mô tả khối lượng công việc của mình và các tiêu chí quan trọng nhất như độ trễ, thông lượng hoặc chi phí, và SageMaker AI sẽ thực hiện phần còn lại. Tính năng này giúp định chuẩn nhiều cấu hình trên cơ sở hạ tầng GPU thực bằng NVIDIA AIPerf, áp dụng các kỹ thuật điều chỉnh cho mục tiêu như giải mã suy đoán cho thông lượng hoặc điều chỉnh nhân cho độ trễ, đồng thời trả về các khuyến nghị được xếp hạng, sẵn sàng cho sản xuất với dữ liệu hiệu năng đo được. Các đội ngũ có cấu hình đã được xác thực trong vòng vài giờ thay vì vài tuần, mà không cần quyết định áp dụng kỹ thuật nào hoặc cách cấu hình các kỹ thuật đó.
Với trải nghiệm mới này, khách hàng sẽ mô tả khối lượng công việc của mình và các tiêu chí quan trọng nhất như độ trễ, thông lượng hoặc chi phí, và SageMaker AI sẽ thực hiện phần còn lại. Tính năng này giúp định chuẩn nhiều cấu hình trên cơ sở hạ tầng GPU thực bằng NVIDIA AIPerf, áp dụng các kỹ thuật điều chỉnh cho mục tiêu như giải mã suy đoán cho thông lượng hoặc điều chỉnh nhân cho độ trễ, đồng thời trả về các khuyến nghị được xếp hạng, sẵn sàng cho sản xuất với dữ liệu hiệu năng đo được. Các đội ngũ có cấu hình đã được xác thực trong vòng vài giờ thay vì vài tuần, mà không cần quyết định áp dụng kỹ thuật nào hoặc cách cấu hình các kỹ thuật đó.
Trong Studio SageMaker AI, dưới mục Tác vụ, Tối ưu hóa suy luận, khách hàng chọn hồ sơ trường hợp sử dụng (Tương tác, Tạo, Tóm tắt hoặc Tùy chỉnh), chọn mục tiêu tối ưu hóa (giảm thiểu độ trễ, tối đa hóa thông lượng hoặc giảm thiểu chi phí) và chọn mô hình của họ từ JumpStart, S3, Sổ đăng ký mô hình hoặc mô hình SageMaker hiện có. Các đề xuất được xếp hạng theo TTFT, độ trễ giữa các token, thông lượng và chi phí, và có thể được so sánh trực quan trước khi triển khai đến điểm cuối thời gian thực SageMaker trực tiếp từ Studio.
Việc tạo đề xuất sẽ không mất thêm phí. Chi phí điện toán tiêu chuẩn áp dụng cho các công việc tối ưu hóa và điểm cuối được cung cấp trong quá trình định chuẩn. Khả năng này có sẵn ở Miền Đông Hoa Kỳ (Bắc Virginia), Miền Tây Hoa Kỳ (Oregon), Miền Đông Hoa Kỳ (Ohio), Châu Âu (Ireland), Châu Âu (Frankfurt), Châu Á Thái Bình Dương (Singapore) và Châu Á Thái Bình Dương (Tokyo). Để tìm hiểu thêm, hãy truy cập bài đăng blog hoặc tài liệu.