AWS công bố aws-bench, bộ quy chuẩn nguồn mở dành cho tác tử AI trên AWS

Ngày đăng: 24 Th07 2026

Hôm nay, AWS công bố phiên bản xem trước nghiên cứu của aws-bench, bộ quy chuẩn nguồn mở để đo lường mức độ chính xác và hiệu quả của tác tử AI trong việc hoàn thành tác vụ AWS trong thế giới thực. Các nhà cung cấp mô hình và nhà nghiên cứu AI xây dựng tác tử hoạt động trên cơ sở hạ tầng của AWS cần một phương thức đo lường hiệu suất và chẩn đoán lỗi một cách khách quan và có thể tái tạo. aws-bench cung cấp bộ trường hợp kiểm thử công khai rút ra được từ việc phân tích quá trình sử dụng AWS thực tế, bao gồm các tác vụ điều tra, khắc phục sự cố và tạo cơ sở hạ tầng.

Mỗi trường hợp kiểm thử ghép nối một truy vấn ngôn ngữ tự nhiên với một trạng thái tài nguyên đám mây được xác định và một đáp án chuẩn, để bạn có thể chấm điểm bất kỳ tác tử hoặc mô hình nào trên cơ sở nhất quán, có thể xác minh. Các nhà nghiên cứu và nhà cung cấp mô hình có thể sử dụng aws-bench để cải thiện hiệu năng mô hình nền tảng trên các tác vụ AWS, cải thiện harness tác tử và theo dõi tiến trình cải tiến. Bản phát hành bao gồm một công cụ CLI dễ sử dụng để khởi tạo môi trường kiểm thử, thực thi và chấm điểm các lượt chạy đánh giá và đặt lại trạng thái tài nguyên.

aws-bench hiện đã được cung cấp trên GitHub. Để bắt đầu sử dụng, hãy làm theo hướng dẫn thiết lập trên README.