تعلن AWS عن aws-bench، وهو معيار مفتوح المصدر لوكلاء الذكاء الاصطناعي على AWS
تعلن AWS اليوم عن معاينة بحثية لـ aws-bench، وهو معيار مفتوح المصدر يقيس مدى دقة وكفاءة وكلاء الذكاء الاصطناعي في إكمال مهام AWS في العالم الحقيقي. يحتاج موفرو النماذج وباحثو الذكاء الاصطناعي وكلاء البناء الذين يعملون على البنية التحتية لـ AWS إلى طريقة موضوعية وقابلة للتكرار لقياس الأداء وتشخيص الأعطال. يوفر aws-bench مجموعة عامة من حالات الاختبار المستمدة من تحليل الاستخدام الحقيقي لـ AWS، بما في ذلك التحقيق واستكشاف الأخطاء وإصلاحها ومهام إنشاء البنية التحتية.
تجمع كل حالة اختبار بين استعلام بلغة طبيعية وحالة موارد سحابية محددة وإجابة الحقيقة الأساسية، حتى تتمكن من تسجيل أي وكيل أو نموذج على أساس ثابت وقابل للتحقق. يمكن للباحثين وموفري النماذج استخدام aws-bench لتحسين أداء النموذج الأساسي في مهام AWS، وتحسين إطار تشغيل الوكيل، وتتبع تقدم التحسين. يتضمن الإصدار أداة CLI سهلة الاستخدام لإنشاء بيئات الاختبار وتنفيذ عمليات التقييم وتسجيلها وإعادة تعيين حالة المورد.
يتوفر الآن aws-bench على GitHub. للبدء، اتبع تعليمات الإعداد على README.