AWS 宣布推出 aws-bench,这是一项适用于 AWS 上人工智能代理的开源基准
发布于:
2026年7月24日
今天,AWS 宣布推出 aws-bench 的研究预览版,这是一项开源基准测试,用于衡量人工智能代理完成真实 AWS 任务的准确性和效率。构建在 AWS 基础设施上运行的代理的模型提供商和人工智能研究人员需要一种客观、可重复的方式来衡量性能和诊断故障。aws-bench 提供了一套公开的测试用例,这些测试用例源自对真实 AWS 使用情况的分析,包括调查、故障排查和基础设施创建任务。
每个测试用例都会将自然语言查询与定义的云资源状态和基准真值配对,以便可在一致、可验证的基础上对任何代理或模型进行评分。研究人员和模型提供商可以使用 aws-bench 来提高 AWS 任务的基础模型性能,优化代理框架并跟踪改进进度。该版本包括一个简单易用的 CLI 工具,用于实例化测试环境、执行评估运行并予以评分以及重置资源状态。
aws-bench 现已在 GitHub 推出。要开始使用,请按照自述文件中的设置说明进行操作。