A AWS anuncia o aws-bench, um benchmark de código aberto para agentes de IA na AWS
Hoje, a AWS anuncia uma versão prévia da pesquisa do aws-bench, um benchmark de código aberto que mede a precisão e eficiência com que os agentes de IA concluem tarefas reais da AWS. Provedores de modelos e pesquisadores de IA que criam agentes que operam na infraestrutura da AWS precisam de uma forma objetiva e reproduzível de medir o desempenho e diagnosticar falhas. O aws-bench fornece um conjunto público de casos de teste derivados da análise do uso real da AWS, incluindo tarefas de investigação, solução de problemas e criação de infraestrutura.
Cada caso de teste combina uma consulta em linguagem natural com um estado de recurso de nuvem definido e uma resposta verdadeira, para que você possa pontuar qualquer agente ou modelo de forma consistente e verificável. Pesquisadores e fornecedores de modelos podem usar o aws-bench para melhorar o desempenho do modelo básico nas tarefas da AWS, melhorar o aproveitamento dos agentes e acompanhar o progresso da melhoria. A versão inclui uma ferramenta CLI fácil de usar para instanciar ambientes de teste, executar e pontuar execuções de avaliação e redefinir o estado do recurso.
O aws-bench já está disponível no GitHub. Para começar a usar, siga as instruções de configuração no README.