AWS が AWS の AI エージェント向けのオープンソースベンチマークである aws-bench を発表

投稿日: 2026年7月24日

本日、AWS は、AI エージェントが実際の AWS タスクをどれだけ正確かつ効率的に実行できるかを測定するオープンソースベンチマーク aws-bench のリサーチプレビューを発表しました。AWS インフラストラクチャで動作するエージェントを構築するモデルプロバイダーや AI 研究者には、パフォーマンスを測定し、失敗を診断するための客観的で再現可能な方法が必要です。aws-bench は、実際の AWS 利用状況の分析から作成された、調査、トラブルシューティング、インフラストラクチャ作成などのタスクを含む、一般公開されたテストケース一式を提供します。

各テストケースは、自然言語のクエリと、定義済みのクラウドリソース状態および正解データを組み合わせたものであり、これにより一貫した検証可能な基準で任意のエージェントやモデルをスコアリングできます。研究者やモデルプロバイダーは、aws-bench を使用して、AWS タスクにおける基盤モデルのパフォーマンスの改善、エージェントハーネスの改善、改善の進捗の追跡を行うことができます。今回のリリースには、テスト環境のインスタンス化、評価の実行とスコアリング、リソース状態のリセットを行うための使いやすい CLI ツールが含まれています。

aws-bench は、現在 GitHub で利用できます。使用を開始するには、README に記載されているセットアップ手順に従ってください。