AWS, AWS 기반 AI 에이전트를 위한 오픈 소스 벤치마크인 aws-bench 발표
게시된 날짜:
2026년 7월 24일
오늘 AWS는 AI 에이전트가 실제 AWS 태스크를 얼마나 정확하고 효율적으로 완료하는지 측정하는 오픈 소스 벤치마크인 aws-bench의 연구 평가판을 발표했습니다. AWS 인프라에서 작동하는 에이전트를 구축하는 모델 제공업체와 AI 연구원에게는 성능을 측정하고 장애를 진단할 수 있는 객관적이고 재현 가능한 방법이 필요합니다. aws-bench는 실제 AWS 사용을 분석하여 도출된 공개 테스트 사례 모음을 제공하며, 여기에는 조사, 문제 해결 및 인프라 생성 태스크 등이 포함됩니다.
각 테스트 사례는 자연어 쿼리를 정의된 클라우드 리소스 상태 및 실측 정보 답변과 연결하므로 일관되고 검증 가능한 기준으로 모든 에이전트 또는 모델을 평가할 수 있습니다. 연구원과 모델 제공업체는 aws-bench를 사용하여 파운데이션 모델의 AWS 테스크 성능을 개선하고, 에이전트 하네스를 개선하고, 개선 진행 상황을 추적할 수 있습니다. 이 릴리스에는 테스트 환경을 인스턴스화하고, 평가 실행을 실행 및 채점하고, 리소스 상태를 재설정하는 사용하기 쉬운 CLI 도구가 포함되어 있습니다.
aws-bench는 이제 GitHub에서 사용할 수 있습니다. 시작하려면 README의 설정 지침을 따르세요.