Cổng suy luận Amazon SageMaker HyperPod để suy luận LLM có thể điều chỉnh quy mô

Ngày đăng: 24 Th09 2026

Cổng suy luận Amazon SageMaker HyperPod là hệ thống định tuyến nhận thức GPU gốc Kubernetes, triển khai dưới dạng tiện ích bổ sung được quản lý EKS duy nhất trên cơ sở hạ tầng SageMaker HyperPod hiện có mà không thay đổi ứng dụng. Bằng cách thay thế cân bằng tải luân chuyển vòng (round-robin) thiếu khả năng thích ứng bằng định tuyến dựa trên tín hiệu suy luận theo thời gian thực, cổng này giảm độ trễ mã thông báo đầu tiên lên đến 82% và giảm p99 TTFT 97 – 98% trong các tình huống phần cứng hỗn hợp và lưu lượng tăng đột biến.

Cổng này được xây dựng dựa trên 3 thành phần cốt lõi. Điểm cuối Envoy chấm dứt lưu lượng HTTPS và cung cấp một điểm cuối riêng tư duy nhất cho mỗi cụm. Bộ định tuyến dựa trên nội dung đọc tên mô hình trực tiếp từ mỗi yêu cầu đến và định tuyến yêu cầu đến nhóm GPU chính xác – cho phép một cổng phục vụ nhiều mô hình từ một URL điểm cuối duy nhất mà không cần thay đổi phía máy khách. Trình chọn điểm cuối liên tục chấm điểm mọi pod máy chủ mô hình theo thời gian thực trên 6 tín hiệu cấp suy luận – mức sử dụng bộ nhớ đệm KV, độ sâu hàng đợi, tình trạng lưu trú bộ chuyển đổi LoRA, tỷ lệ truy cập bộ nhớ đệm tiền tố, độ trễ dự đoán và yêu cầu đang chạy – chọn pod tối ưu cho từng yêu cầu riêng lẻ.

Cổng này hoạt động với bất kỳ máy chủ mô hình tương thích OpenAI nào, bao gồm vLLM và SGLang, mà không yêu cầu thay đổi mã ứng dụng.

Định tuyến theo cụm hiện có sẵn ở tất cả các Khu vực AWS hỗ trợ tiện ích bổ sung suy luận SageMaker HyperPod. Sắp ra mắt – định tuyến xuyên cụm và xuyên khu vực với cổng đội nhóm tập trung, giới hạn tốc độ toàn cục và định hình lưu lượng truy cập theo bậc chi phí.

Để tìm hiểu thêm, hãy đọc blog ra mắt và khám phá tài liệu