AWS, AWS'deki yapay zeka temsilcileri için açık kaynaklı bir kıyaslama olan aws-bench'i duyurdu

Yayınlanma Tarihi: 24 Tem 2026

Bugün AWS, yapay zeka temsilcilerinin gerçek dünyadaki AWS görevlerini ne kadar doğru ve verimli bir şekilde tamamladığını ölçen açık kaynaklı bir kıyaslama olan aws-bench'in araştırma önizlemesini duyurdu. AWS altyapısında çalışan temsilcileri oluşturan model sağlayıcıları ve yapay zeka araştırmacıları, performansı ölçmek ve arızaları teşhis etmek için objektif ve tekrarlanabilir bir yola ihtiyaç duyar. aws-bench; araştırma, sorun giderme ve altyapı oluşturma görevleri de dahil olmak üzere gerçek AWS kullanım analizinden türetilen genel bir test senaryosu paketi sunar.

Her test senaryosu, doğal dil sorgusunu tanımlanmış bir bulut kaynağı durumu ve temel doğruluk yanıtıyla eşleştirir, böylece herhangi bir temsilciyi veya modeli tutarlı ve doğrulanabilir bir temelde puanlayabilirsiniz. Araştırmacılar ve model sağlayıcılar, AWS görevlerinde temel model performansını iyileştirmek, temsilci çalışma katmanlarını iyileştirmek ve iyileştirme ilerlemesini izlemek için aws-bench'i kullanabilir. Sürüm, test ortamlarını başlatmak, değerlendirme çalıştırmalarını yürütmek ve puanlamak ve kaynak durumunu sıfırlamak için kullanımı kolay bir CLI aracı içerir.

aws-bench artık GitHub'da mevcuttur. Başlamak için README'deki kurulum talimatlarını izleyin.