AWS анонсирует aws-bench – оценочный тест с открытым исходным кодом для агентов ИИ на AWS
Сегодня AWS объявляет о выпуске предварительной версии aws-bench – оценочного теста с открытым исходным кодом, который измеряет точность и эффективность выполнения реальных задач AWS агентами ИИ. Поставщикам моделей и исследователям ИИ, создающим агенты, которые работают в инфраструктуре AWS, нужен объективный и воспроизводимый способ измерения производительности и диагностики сбоев. aws-bench предоставляет публичный набор тестовых примеров, полученных по итогам анализа реального использования AWS, включая задачи исследования, устранения неполадок и создания инфраструктуры.
Каждый тестовый пример сочетает запрос на естественном языке с определенным состоянием облачных ресурсов и достоверным ответом, так что вы можете оценить любой агент или любую модель на последовательной и поддающейся проверке основе. Исследователи и поставщики моделей могут использовать aws-bench для повышения производительности базовой модели при выполнении задач AWS, улучшения обвязки агента и отслеживания хода улучшения. В выпуск входит простой в использовании инструмент CLI для создания экземпляров тестовых сред, выполнения и оценки прогонов теста, а также сброса состояния ресурсов.
Тест aws-bench теперь доступен на GitHub. Чтобы приступить к работе, следуйте инструкциям по настройке в файле README.