AWS annonce aws-bench, une référence open source pour les agents IA sur AWS

Publié le: 24 juil. 2026

AWS annonce aujourd’hui une version préliminaire de la recherche d’aws-bench, une référence open source qui mesure la précision et l’efficacité avec lesquelles les agents IA exécutent des tâches AWS réelles. Les fournisseurs de modèles et les chercheurs en IA qui créent des agents qui opèrent sur l’infrastructure AWS ont besoin d’un moyen objectif et reproductible de mesurer les performances et de diagnostiquer les défaillances. aws-bench propose une suite publique de cas de test dérivés de l’analyse de l’utilisation réelle d’AWS, y compris des tâches d’investigation, de dépannage et de création d’infrastructure.

Chaque scénario de test associe une requête en langage naturel à un état des ressources cloud défini et à une réponse fiable, afin que vous puissiez évaluer n’importe quel agent ou modèle sur une base cohérente et vérifiable. Les chercheurs et les fournisseurs de modèles peuvent utiliser aws-bench pour améliorer les performances des modèles de base sur les tâches AWS, améliorer les harnais d’agents et suivre les progrès en matière d’amélioration. La version inclut un outil CLI facile à utiliser pour instancier les environnements de test, exécuter et évaluer les cycles d’évaluation, et réinitialiser l’état des ressources.

aws-bench est disponible dès maintenant sur GitHub. Pour commencer, suivez les instructions de configuration du README.