AWS anuncia aws-bench, un punto de referencia de código abierto para los agentes de IA en AWS

Publicado en: 24 de jul de 2026

Hoy, AWS anuncia una versión preliminar de la investigación de aws-bench, un punto de referencia de código abierto que mide la precisión y la eficiencia con la que los agentes de IA completan las tareas de AWS del mundo real. Los proveedores de modelos y los investigadores de IA que crean agentes que operan en la infraestructura de AWS necesitan una forma objetiva y reproducible de medir el rendimiento y diagnosticar los errores. aws-bench proporciona un conjunto público de casos de prueba derivados del análisis del uso real de AWS, incluidas las tareas de investigación, solución de problemas y creación de infraestructura.

Cada caso de prueba combina una consulta en lenguaje natural con un estado de recursos de nube definido y una respuesta básica, de modo que puede puntuar a cualquier agente o modelo de forma coherente y verificable. Los investigadores y los proveedores de modelos pueden usar aws-bench para mejorar el rendimiento del modelo básico en las tareas de AWS, mejorar el arnés del agente y realizar un seguimiento del progreso de las mejoras. La versión incluye una herramienta CLI fácil de usar para crear instancias de entornos de prueba, ejecutar y puntuar las ejecuciones de evaluación y restablecer el estado de los recursos.

aws-bench ya está disponible en GitHub. Para empezar, siga las instrucciones de configuración del archivo README.