AWS 宣布推出 aws-bench,這是一項適用於 AWS 上 AI 代理程式的開放原始碼基準測試

張貼日期: 2026年7月24日

AWS 今日宣布推出 aws-bench 的研究預覽版,這是一項開放原始碼基準測試,可評估 AI 代理程式完成實際 AWS 任務的準確度和效率。建置在 AWS 基礎架構上運作之代理程式的模型供應商和 AI 研究人員,需要客觀且可重現的方法來衡量效能並診斷故障。aws-bench 提供一套公開測試案例,這些案例源自對實際 AWS 使用情況的分析,包括調查、故障排除和基礎架構建立任務。

每個測試案例都將自然語言查詢與定義的雲端資源狀態及標準答案配對,因此您可以依一致且可驗證的基準,為任何代理程式或模型評分。研究人員和模型供應商可使用 aws-bench 改善基礎模型在 AWS 任務上的效能、改善代理執行框架,並追蹤改善進度。此版本包含易於使用的 CLI 工具,可具現化測試環境、執行及評分評估作業,並重設資源狀態。

aws-bench 現已在 GitHub 上提供。若要開始使用,請依照 README 中的設定指示操作。