AWS kündigt aws-bench an, einen Open-Source-Benchmark für KI-Agenten auf AWS
Heute kündigt AWS eine Research-Vorschau von aws-bench an, einem Open-Source-Benchmark, der misst, wie genau und effizient KI-Agenten reale AWS-Aufgaben erledigen. Modellanbieter und KI-Forscher, die auf der AWS-Infrastruktur basierende Agenten erstellen, benötigen eine objektive, reproduzierbare Methode zur Leistungsmessung und Fehlerdiagnose. aws-bench bietet eine öffentliche Suite von Testfällen, die aus der Analyse der tatsächlichen AWS-Nutzung abgeleitet wurden, einschließlich Untersuchungen, Problembehebungen und Infrastrukturerstellungsaufgaben.
Jeder Testfall kombiniert eine Abfrage in natürlicher Sprache mit einem definierten Cloud-Ressourcenstatus und einer Ground-Truth-Antwort, sodass Sie jegliche Agenten oder Modelle auf einer einheitlichen, verifizierbaren Grundlage bewerten können. Forscher und Modellanbieter können aws-bench nutzen, um die Leistung des Basismodells bei AWS-Aufgaben zu verbessern,Agenten-Harnesses zu verbessern und den Optimierungsfortschritt zu verfolgen. Das Release enthält ein einfach zu bedienendes CLI-Tool zum Instanziieren von Testumgebungen, zum Ausführen und Bewerten von Testläufen und zum Zurücksetzen des Ressourcenstatus.
aws-bench ist jetzt auf GitHub verfügbar. Installationsanweisungen finden Sie in der README-Datei.