Amazon Web Services ブログ

AWS Continuum が自律型コードセキュリティの新たな基準を確立: CyberGym-E2E で成功率 89.0% を達成

本ブログは 2026 年 10 月 5 日に公開された AWS Blog “AWS Continuum sets a new standard in autonomous code security” を翻訳したものです。

AI モデルは、能力が向上するにつれて、より多くのセキュリティ脆弱性を発見し、それらを悪用するためのますます巧妙な攻撃経路を特定するようになっています。その結果、防御側にはこれまで以上に迅速な対応が求められています。セキュリティチームは現在、既存のプロセスで想定していた以上の数の潜在的な脆弱性に直面しています。脆弱性ごとに調査と再現を行い、修正を作成したうえで、その修正が想定どおりの動作を損なわずに脆弱性を解消できるかをテストで確認しなければなりません。

AWS Continuum for code vulnerabilities は、マシンスピードで動作する自律型セキュリティによって、この作業を加速します。Continuum を具体的な公開基準で評価するために AWS が選んだのが CyberGym-E2E です。このベンチマークでは、エージェントが実際のコードベースから脆弱性を見つけ、動作する概念実証 (proof of concept) でそれを実証し、プロジェクトのテストでカバーされている動作を損なわずに修正することが求められます。Continuum は、ベンチマークの制限時間である 90 分以内に 920 件中 819 件のタスクをパスし、エンドツーエンドの成功率 89.0% を達成しました。これは、従来の公開最高値である 65.9% を 23.1 ポイント上回る新たな基準です。

脆弱性ライフサイクル全体の測定

多くのセキュリティベンチマークは、単一のタスクを切り離してテストします。検出ベンチマークは、システムが疑わしいコードを特定できるかどうかをテストし、パッチ生成ベンチマークは、既知の欠陥を前提として修正を求めます。CyberGym-E2E の前身である CyberGym も既知の脆弱性を前提としており、エクスプロイト生成に重点を置いています。これに対して CyberGym-E2E は脆弱性ライフサイクル全体を評価するもので、システムには脆弱性を特定して実証したうえで、テスト済みの修正を作成することが求められます。このように評価範囲が広いため、セキュリティチームが実際に取り組む作業をより忠実に反映しています。

CyberGym-E2E の各タスクでは、実際のオープンソースプロジェクトの脆弱なリビジョンと、そのビルドとテストに必要なツールを含むコンテナにエージェントが配置されます。エージェントはソースの調査と変更はできますが、脆弱性の説明、概念実証、クラッシュログ、元のパッチは一切与えられません。外部ネットワークへのアクセスはブロックされ、保護されたベンチマークファイルも変更できません。エージェントは 90 分以内に、脆弱性を実証する入力とソースコードのパッチを提出する必要があります。ベンチマーク全体は、139 のオープンソースプロジェクトで過去に OSS-Fuzz によって検出された脆弱性に基づく 920 件のタスクで構成されています。プロジェクトのコード行数の中央値は 600,000 行を超えます。

このベンチマークでは、各提出物を次の 4 つの累積的なステージで評価します。

  1. S1 では、脆弱なプログラムをクラッシュさせる入力をエージェントが生成したかどうかを確認します。
  2. S2 では、エージェントが作成したパッチによってそのクラッシュが防止されるかどうかを確認します。
  3. S3 では、パッチを適用したプロジェクトが引き続き機能テストにパスするかどうかを確認します。
  4. S4 では、ベンチマークで選定された特定の過去の脆弱性もパッチによって修正されるかどうかを確認します。

CyberGym-E2E では、S3 をエンドツーエンドの成功を測る主要な指標と定義しています。S4 は診断用の指標です。リポジトリには実在する脆弱性が複数含まれている場合があり、エージェントがベンチマークで選定された対象とは異なる実在の欠陥を見つけて修正することもあるためです。

Continuum が新たな基準を確立

Continuum for code vulnerabilities は、CyberGym-E2E のすべてのステージで新たな基準を打ち立てました。次の表は、そのパフォーマンスを従来の公開最高値と比較したものです。

ステージ

評価内容

Continuum

従来の公開最高値

差分

S1

脆弱性の発見と再現

92.5%

67.9%

+24.6%

S2

生成した入力によるクラッシュの修正

89.6%

66.2%

+23.4%

S3

テスト対象の機能の維持

89.0%

65.9%

+23.1%

S4

ベンチマークで選定された脆弱性も修正

37.8%

26.2%

+11.6%

ベンチマークでエンドツーエンドの成功を測る主要な指標である S3 では、Continuum は 920 件中 819 件のタスクをパスしました。成功率 89.0% は、従来の公開最高値である 65.9% を 23.1 ポイント上回っています。この結果には、基盤となるフロンティアモデルの能力と、マルチエージェントのセキュリティシステムとしての Continuum の設計の両方が反映されています。次のセクションでは、このシステムがモデル単体の能力に加えてどのような価値をもたらしているのかを説明します。

公式の結果である 89.0% は、CyberGym-E2E の 90 分の制限時間を適用したものです。制限時間を超えてタスクの継続を許可した場合、Continuum のエンドツーエンドのパス率は 93.7% に達しました。この結果は、長時間の分析を最後まで完了できれば、対応できる範囲がさらに広がる可能性があることを示しています。

評価は、CyberGym-E2E のネットワーク分離と提出物レビューの要件に従って実施しました。実行中は外部からの情報取得をブロックしました。また、実行後にトラジェクトリ (エージェントの実行履歴) をレビューし、タスクの成功が、公開済みの過去の修正を取得した結果ではなく、脆弱性分析によるものであることを確認しました。

エンドツーエンドのセキュリティを実現するハーネス設計

Continuum for code vulnerabilities は、コード脆弱性ライフサイクルの主要なフェーズである発見、検証、修復を中心に構成されたマルチエージェントシステムです。各フェーズでは、そのフェーズで必要となる証拠と判断に合わせて調整された専用のエージェントを使用します。システムは証拠を次のフェーズへ引き継ぐため、各フェーズでは前のフェーズまでに完了した作業を基に処理を進められます。

発見フェーズでは、Continuum がリポジトリを分析し、脆弱性の候補となる検出結果を作成します。エージェントは、詳しく調査すべきコードパスを特定し、各候補を裏付けるソースコード上の証拠を記録します。

検証フェーズでは、専用のエージェントが、候補となる検出結果が実際のセキュリティ問題であることを実証しようとします。エージェントは概念実証を構築して脆弱なプログラムに対して実行し、観測された動作がその検出結果を裏付けるかどうかを判断します。これにより、コードレベルの潜在的な弱点が、実行して確認できる証拠へと変換されます。

修復フェーズでは、エージェントが脆弱性の根本原因を突き止め、パッチを作成します。その後 Continuum は、パッチによって実証済みの不具合が防止されること、そしてプロジェクトの機能テストに引き続きパスすることを確認します。つまり、修正は、脆弱性の立証に使用したものと同じ証拠に基づいて評価されます。

これらのフェーズが連携することで、疑わしいコードから実証済みの脆弱性、テスト済みの修正に至るまでを一貫してたどれる記録が作成されます。このアーキテクチャにより、Continuum は一貫した証拠の基準を維持しながら、ツール、指示、チェック、モデルを各フェーズに合わせて調整できます。また、複数のモデルの相互補完的な強みを活用し、新しいモデルが利用可能になりしだい取り込めるマルチモデルのアプローチにも対応しています。

お客様の環境では、Continuum はコードレベルの証拠を、サービスの露出状況、ネットワークパス、アクセス許可、設定など、利用可能なデプロイコンテキストと組み合わせることもできます。このコンテキストは、本番環境への影響が限定的な脆弱性と、直ちに対応が必要なセキュリティ上の露出とを区別するのに役立ちます。CyberGym-E2E はコードレベルのプロセスを評価するもので、デプロイコンテキストは提供されません。そのため、こうしたより広範な優先順位付けの機能はベンチマークの評価範囲外となります。

CyberGym-E2E のその先へ

CyberGym-E2E は、複雑で多段階にわたるプロセスを、再現可能なタスクと、コードを実行して検証できる結果を備えた大規模な公開ベンチマークとして形にすることで、セキュリティ評価を前進させています。タスクの構築、スコアリング、提出基準について CyberGym-E2E の作成者が行った綿密な取り組みは、エンドツーエンドの進歩を測定するための具体的な基盤をこの分野にもたらしています。

920 件のタスク全体で評価の一貫性と再現性を保つため、CyberGym-E2E は C および C++ プロジェクトのメモリ安全性の脆弱性に焦点を当てています。サニタイザーが検出したクラッシュを欠陥の客観的な証拠とし、その後のチェックで、修正が概念実証による脆弱性の再現を防ぎ、プロジェクトのテストでカバーされる機能を維持しているかどうかを判断します。この設計上、多くのプログラミング言語や脆弱性クラスは、必然的にベンチマークの現在の範囲外となります。その中には、本番システムで観測される、最も一般的かつ影響の大きいバグクラスの多くも含まれます。これらの領域を評価するには、別のタスク環境と、同様に厳密な検証方法が必要になります。

AWS が考えるエンドツーエンドのセキュリティは、テスト済みのコードレベルの修正を作成するだけにとどまりません。本番システムでは、サービスの露出状況、ネットワークパス、アクセス許可、設定などのデプロイコンテキストによって、その脆弱性のリスクが限定的なのか、直ちに対応が必要なのかが決まることが少なくありません。今後の評価では、自律型システムがこうしたコンテキストを踏まえて推論し、デプロイされたシステムの安全性への影響に応じて検出結果に優先順位を付けられるかどうかをテストする必要があります。

CyberGym-E2E の価値は、データセットそのものだけにとどまりません。CyberGym-E2E は、エンドツーエンドのセキュリティを独立したタスクとして定義し、測定する価値があることを示しています。そのためには、範囲、証拠、何をもって成功とみなすかについて難しい設計判断が必要になりますが、CyberGym-E2E は、こうした判断を検討するための具体的な出発点をこの分野に提供しています。このシステムレベルの視点は、Deception Benchmark に関する AWS の取り組みを補完するものです。Deception Benchmark は、範囲はより狭いものの関連する能力、つまり個々のフロンティアモデルが実際の脆弱性と安全なコードをどの程度確実に区別できるかを評価します。両者は、モデルとシステムの両方のレベルでセキュリティパフォーマンスを検証します。

AWS Continuum for code vulnerabilities が、チームによる脆弱性の発見、検証、優先順位付け、修復をマシンスピードでどのように支援するかについては、AWS Continuum 製品ページをご覧ください。


Alexander Greaves

Alexander Greaves-Tunnell

Alec は、AWS Continuum for code vulnerabilities の設計と評価に携わるサイエンティストです。AWS では、検索、セキュリティ、オブザーバビリティの分野にわたるプロジェクトを主導し、既存のモデルの知識だけでは対応できない複雑なアプリケーション領域に最先端の AI を適用してきました。学術的なバックグラウンドは統計学です。

Neha Rungta

Neha Rungta

Neha は、複雑なシステムを対象とするマシン推論を大規模に実現することにキャリアを捧げてきたサイエンティスト兼ビルダーです。自動推論、形式的検証、セキュリティ、AI にわたる研究に取り組み、Cedar、IAM Access Analyzer、Continuum などのシステムの構築に携わってきました。現在は、LLM、形式手法、エージェント型システムを組み合わせ、次世代のマシン推論の開拓に取り組んでいます。

本ブログは Security Solutions Architect の 中島 章博 が翻訳しました。