AWS mengumumkan aws-bench, sebuah tolok ukur sumber terbuka untuk agen AI di AWS
Hari ini, AWS mengumumkan pratinjau riset aws-bench, sebuah tolok ukur sumber terbuka yang mengukur seberapa akurat dan efisien agen AI menyelesaikan tugas-tugas AWS di dunia nyata. Penyedia model dan peneliti AI yang membangun agen yang beroperasi di infrastruktur AWS membutuhkan cara yang objektif dan dapat direproduksi untuk mengukur kinerja dan mendiagnosis kegagalan. aws-bench menyediakan serangkaian kasus uji publik yang berasal dari analisis penggunaan AWS nyata, termasuk tugas investigasi, pemecahan masalah, dan pembuatan infrastruktur.
Setiap kasus uji menggabungkan kueri bahasa alami dengan status sumber daya cloud yang telah ditentukan dan jawaban sebenarnya, sehingga Anda dapat menilai agen atau model apa pun secara konsisten dan dapat diverifikasi. Peneliti dan penyedia model dapat menggunakan aws-bench untuk meningkatkan kinerja model dasar pada tugas AWS, meningkatkan harness agen, dan melacak kemajuan peningkatan. Rilis ini menyertakan tool CLI yang mudah digunakan untuk membuat lingkungan pengujian, menjalankan dan menilai hasil evaluasi, serta mengatur ulang status sumber daya.
aws-bench kini tersedia di GitHub. Untuk memulai, ikuti petunjuk pengaturan yang ada di README.