Amazon Web Services ブログ

Amazon CloudWatch Omni の紹介: AI 時代のオブザーバビリティ

本記事は 2026 年 9 月 22 日 に公開された「Introducing Amazon CloudWatch Omni: Observability for the AI Era」を翻訳したものです。

AI エージェントとアプリケーション向けの AI 駆動オブザーバビリティ体験。オープンスタンダードで構築し、AWS マネジメントコンソール外で提供します。

サポートチケットの対応からインフラ管理、経費承認、本番コードのデプロイ、さらにはビジネスを支えるロングテールのワークフローまで、組織は日常業務をエージェントに委ねつつあります。IDC は 2029 年までに 10 億を超える AI エージェントがアクティブに稼働し、1 日あたり約 2,170 億のアクションを実行すると予測しています (出典: IDC Blog, Agentic AI is critical infrastructure, 2026 年 3 月)。この規模になると、エージェントは生産性向上のレイヤーではなく運用基盤の一部となり、新しい基準が求められます。エージェントは初日から信頼でき、確実に動作しなければなりません。しかしながら AI エージェントは従来のソフトウェアとは違う失敗の仕方をします。同じ入力でもツール呼び出し、推論パス、出力が呼び出しごとに異なる可能性があります。レイテンシーやエラー率ではハルシネーションや有害性を確実に検出できません。従来のモニタリングではエージェントが動作したかは確認できても、正しく推論したかはわかりません。すべてのメトリクスは正常のまま、顧客の信頼が静かに、しかし急速に失われていきます。

一方、エージェントが連携するアプリケーションはますます分散化しており、複数の言語、フレームワーク、クラウドにまたがって構築されています。運用チームはログ、メトリクス、トレース用の別々のコンソールを何十も使い分けています。本番環境の問題を診断するには、ツール間でコンテキストを切り替え、本来つながっていないシグナルを頭の中で関連付け、顧客が気づく前に全体像を組み立てられることを願うしかありません。お客様から一貫して聞くのは、ツールがアプリケーションの実際の構築・運用方法に追いついていないということです。

私たちはこの 2 つを収束する課題と捉えています。エージェントは API を呼び出し、Amazon Bedrock、Amazon S3、サードパーティのエンドポイントなどのサービスに依存し、それぞれ固有の障害モードを持つインフラ上で動作します。何かが壊れたとき、根本原因はエージェントの推論かもしれないし、古いナレッジベースかもしれないし、3 層先にある下流データベースのレイテンシーのスパイクかもしれません。現状では、エージェントトレースツール、APM コンソール、データを共有していないインフラダッシュボードを切り替えて診断するしかありません。「動いているか?」だけでなく「なぜそうしたのか? 何が原因か?」が問われているのです。そこで私たちは Amazon CloudWatch Omni を構築しました。

「Capital One は金融サービス業界で最大級のオブザーバビリティ環境を運用しています。Amazon CloudWatch Omni のデザインパートナーとして、私たちは単一の AI 搭載オブザーバビリティソリューションの形成を支援しました。このソリューションは、私たちのエンジニアに、トポロジーを意識したインテリジェンスと、すべてのテレメトリーに対する自然言語でのクエリを単一の画面から提供し、OpenTelemetry を通じたデータの完全な所有権を実現してくれるものになります。これは、大規模な AIOps とレジリエンスに向けた、根本的に異なる運用モデルです。」

— Parvez Naqvi, Managing Vice President, Cloud Platform & Resilience Engineering, Capital One

Amazon CloudWatch Omni とは

CloudWatch は AWS 上でチームが運用を行う基盤であり、あらゆる業界とリージョンにまたがる数百万のお客様に対して、毎日数兆のオブザーバビリティシグナルを処理しています。Amazon CloudWatch Omni は CloudWatch の次世代版です。アプリケーションと、それと並行して動作する AI エージェントを、AWS マネジメントコンソール外で 1 つにまとめて見られるようにしたオブザーバビリティです。自動検出されたトポロジー、自然言語と SQL によるクエリ、AWS DevOps Agent による AI ガイド付き調査を、アプリケーションとエージェントの両方に対して提供します。

CloudWatch Omni は、チームが今日直面するオブザーバビリティのいくつかの主要な課題に対応します。

信頼できるエージェントをリリースする: 「動いているか?」だけでなく「なぜエージェントがそうしたのか?」にも答える、評価駆動のオブザーバビリティです。開発者はエージェントの振る舞いをトレースし、品質を継続的に評価し、リリース前に修正を検証する実験を実行できます。Omni は複数のフレームワーク (CrewAI、LangGraph、OpenAI Agents SDK、Strands、Vercel AI SDK など) で構築されたエージェントに対応し、開発者が普段使っている環境で利用できます。VS Code、Cursor、Kiro 向けの Omni IDE 拡張機能に加え、本番環境向けの専用 Omni Web 体験を提供します。

アプリケーションを顧客の視点で把握する: バラバラなリソースではなく、顧客が見ているようにアプリケーションを理解できます。Omni スペース (アプリケーション、チーム、またはワークロード単位で構築されたワークスペース) で作業し、すべてがサービス、ユーザージャーニー、ビジネストランザクションを軸に整理されます。自動検出されたトポロジー、フリートダッシュボード、ゴールデンメトリクス、ネイティブアラートが 1 か所にまとまります。現在 Azure からのアプリケーションおよびエージェントテレメトリの取り込みに対応しており、他のクラウドプロバイダーも近日対応予定です。

フルスタックで相関分析する: エージェントは API を呼び出し、サービスに依存し、インフラ上で動作します。何かが壊れたとき、根本原因はエージェントの推論、古いナレッジベース、または下流サービスのレイテンシースパイクかもしれません。Omni は CloudWatch 統合データストア (数百万のお客様に信頼されているテレメトリストア) 上に構築されており、エージェントの振る舞いからアプリケーションの健全性、インフラまでを 1 つの体験で相関分析します。

AI で調査する: Omni 全体に AI が組み込まれています。自前で構築・保守したダッシュボードから始めるのではなく、状況に合った方法でテレメトリとやり取りできます。コンソールでの自然言語チャット、重要なシグナルをたどるガイド付きの画面操作、または AWS Agent Toolkit プラグインを使った任意のツールからの直接アクセスです。自然言語で質問すると、組み込み AI アシスタントが関連テレメトリを見つけ、必要なシグナルの動的ビューを構築し、根本原因の特定を支援します。ネイティブの AWS DevOps Agent は運用上の問題を調査する AI エージェントとして、エージェント、アプリケーション、インフラにまたがるデータを自動的に相関分析して根本原因を特定します。

1 か所で作業する: Omni を使うと、日々の業務が変わります。ツール間を行き来してコンテキストを切り替える代わりに、1 か所で質問しながらインシデントを解決できます。AWS マネジメントコンソールの外に独自の UI とアクセスモデルを備え、オペレーター向けの専用 Web 体験と、VS Code、Cursor、Kiro 向けのネイティブ IDE 拡張機能により、開発者はローカル実行した瞬間にエージェントトレースを確認できます。

「Sony では、全社的な Agentic AI プラットフォームが数百の PoC および本番ワークロードをサポートしています。この規模ではオブザーバビリティと評価が不可欠です。Amazon CloudWatch Omni を使えば、1 つのトレースから評価、AI 分析、比較、データセット作成に直接進めます。すべてが 1 か所にまとまっています。ライブトレースからワンクリックでデータセットを作成できる機能は特に印象的でした。評価用データセットの作成はビジネス側のボトルネックになりがちですが、トレースから直接作成できることでその障壁を大幅に下げられます。さらに、開発環境内でローカルデータとクラウドデータをシームレスに扱えるため、全体として非常に使いやすい体験でした。」

— Masahiro Oba, AI アクセラレーション部門 シニアゼネラルマネージャー, Digital & Technology Platform, ソニーグループ株式会社

marketecture diagram of Amazon CloudWatch Omni, observability reimagined for the AI era, unified across applications and AI agents and delivered off-AWS console. Three value areas sit across the top: Omni IDE Extension (observe while you code in VS Code, Cursor, or Kiro), Omni Web UI (an off-AWS console with auto-discovered topology, service dashboards, native evals, and access controls), and an AI-Woven Experience (AI assistant, natural language interaction, DevOps Agent investigation). All feed into Amazon CloudWatch as one store correlating every signal (logs, traces, metrics, eval scores) via OTLP. A bottom "bring your own stack" layer shows open-standard integrations across languages, frameworks, models, evaluators, hosting, and telemetry sources.

図 1: Amazon CloudWatch Omni — CloudWatch の次世代版。

開発者は、ワークフローに留まったまま作業できます。オペレーターは、画面の切り替え作業から解放されます。また、すぐに始められるよう CloudWatch Omni の料金体系はシンプルに設計しました。送信・保存するテレメトリに応じた課金で、ダッシュボードとアラートは追加料金なし、月間取り込み量の 5 倍までのクエリは無料、さらに対象アカウントには 30 日間の無料トライアルと OTel テレメトリ取り込みに使える $1,000 のクレジットが付与されます。

仕組み

問題のあるエージェントから検証済みの修正までループを繋ぐ

エージェントの出力が品質基準を満たしていない場合、CloudWatch Omni は診断から検証済みの改善まで構造化されたパスを提供します。エージェントをトレースしてすべてのプロンプト、モデル呼び出し、ツール呼び出し、サブエージェントのやり取りを 1 つのタイムラインで確認し、ワークフローを離れることなく評価駆動のループを回せます。

  1. 診断: フラグが付いたトレースをプレイグラウンドで開き、実データに対して異なるプロンプトやモデル設定を試す
  2. スコアリング: 評価器を実行して正確性、一貫性、検索品質、ツール選択をスコアリングする
  3. 比較してリリース: 本番トラフィックから構築したデータセットに対して新バージョンを並べて比較し、リグレッションなくスコアが高いバリアントをリリースする
  4. 監視: 評価器をライブトラフィックに対して継続的に実行するように設定し、顧客が気づく前に品質の劣化を検出する

サイクル全体が 1 か所で完結し、各ステップが次のステップにつながります。

CloudWatch Omni は複数のフレームワーク (LangGraph、CrewAI、OpenAI Agents SDK、Vercel AI SDK、Strands など) に対応しています。VS Code、Kiro、Cursor 向けの拡張機能により、ローカルでエージェントを実行した瞬間にトレースが表示されます。オペレーターはエンタープライズ SSO 対応の AWS マネジメントコンソール外の Web 体験で作業します。どちらも同じデータレイヤーを共有しているため、オペレーターがリグレッションを発見すれば、開発者は IDE でそのトレースをそのまま開いて修正に取りかかれます。

Amazon Bedrock AgentCore (AI エージェントの構築、デプロイ、スケーリング向けのマネージドプラットフォーム) 上で構築しているチームは、CloudWatch Omni でのオブザーバビリティを自動的に利用できます。既に AgentCore Observability (AgentCore ランタイム上で動作するエージェント向けの組み込みテレメトリ) を使用している場合、Omni は既存の計装を引き継ぎ、IDE と Omni Web UI に拡張します。AgentCore の組み込み評価器 (検索品質、ツール選択、ガードレール適用、メモリの一貫性) は Omni ですぐに利用でき、AutoEval や DeepEval などの独立した評価ツールを使用しているチームは、評価器を CloudWatch Omni に直接取り込んで既存の投資を活かせます。

エージェントが悪い結果を出したとき、原因は、エージェントからインフラまでのどこにでもあり得ます。CloudWatch Omni ではエージェントトレースとアプリケーションテレメトリが 1 つのデータレイヤーを共有しているため、原因をたどれます。エージェントの判断 (「ツール X を呼び出したが悪い結果だった」) がアプリケーションシグナル (「バッキングサービスがキャパシティ制限に達したため API がエラーを返した」) につながり、さらにインフラメトリクス (「データベースのコネクションプールが枯渇した」) につながります。1 回の調査でトップからボトムまでスレッドをたどれます。

アプリケーションを顧客の視点で把握する

CloudWatch Omni はアプリケーションのトポロジーを自動検出し、サービス、依存関係、サービス間を流れるトラフィックを軸にテレメトリを整理します。アプリケーション全体から始め、必要なサービス、トレース、ログ行にドリルダウンします。既存の CloudWatch ユーザーであれば、すぐに利用開始できます。CloudWatch に送信済みのテレメトリ (ログ、メトリクス、トレース) は、統合データストアを通じて Omni でそのまま使えます。この統合データストアでは、すべてのシグナルタイプをまとめて相関分析できます。再設定は不要です。既存の計装、ダッシュボード、アラームは引き継がれ、Omni がアプリケーション中心の新しい体験に拡張します。CloudWatch を初めて使うチームにとっても、オンボーディングは同様に簡単です。OpenTelemetry (OTLP) エンドポイント経由でテレメトリを送信し、CloudWatch Omni スペースを作成すれば、Omni がトポロジーを自動検出して依存関係と健全性シグナルをすぐに表示し始めます。

Omni の組み込み AI アシスタントは、自然言語で状況を説明すると、異常を特定し、仮説を提案し、調査を案内します。統合検索により、自然言語または SQL でログ、メトリクス、トレースを 1 か所でクエリできます。あらゆるシグナルタイプの条件でアラートがトリガーされ、Slack と GitHub のインテグレーションにより、チームが普段作業している場所にシグナルが届きます。CloudWatch Omni は現在、Azure 環境からのアプリケーションおよびエージェントテレメトリの取り込みに対応しており、より深いマルチクラウドオブザーバビリティが近日提供予定です。組織レベルのドメイン、エンタープライズ SSO、きめ細かな権限制御により、組織全体が 1 回のセットアップでオンボードでき、各ユーザーは自分のロールに応じたデータのみを閲覧できます。

はじめ方

エージェント開発者: VS Code Marketplace から CloudWatch Omni 拡張機能をインストールしてください (無料、ローカル開発に AWS アカウント不要)。または Open VSX から拡張機能をダウンロードし、Kiro や Cursor を使用している場合は OTLP でエージェントを計装して実行すると、トレース、評価、実験をすぐに試せます。エージェントオブザーバビリティの使い方をご覧ください。

アプリケーションチーム: CloudWatch Omni スペースを作成して、サービスとチームのアクセスを整理します。既に CloudWatch を使用している場合、ログ、メトリクス、トレースは再設定なしでそのまま利用できます。新規の場合は、OTLP 経由でテレメトリを送信すると、Omni がトポロジーと健全性シグナルを自動検出してすぐに表示します。Omni でのアプリケーションオブザーバビリティの使い方とドキュメントをご覧ください。

今後の展望

CloudWatch Omni は、エージェントとアプリケーション双方を理解する可視性と、改善につなげるワークフローを 1 つの体験で提供します。

これはまだ始まりにすぎません。マルチクラウド対応を拡大し、インフラがどこで動いていてもオブザーバビリティが追従するようにします。また、問題がインシデントになる前にキャッチするプロアクティブな運用を目指し、検出から修正までの手動作業を減らすエージェントワークフローを深化させていきます。CloudWatch が向かう先は、エージェント、アプリケーション、インフラを 1 つの体験で、クラウドを越えて扱い、AI がすべてのワークフローに織り込まれた姿です。

Omni の動作をウェビナーでご覧ください: 10 月 7 日 (水) 午前 10〜11 時、10 月 8 日 (木) 午前 4〜5 時、10 月 8 日 (木) 午後 10:30〜11:30 (いずれも日本時間)。

出典: IDC Blog, Agentic AI is critical infrastructure, 2026 年 3 月


この記事は Solutions Architect の Tomoki Suzuki が翻訳を担当しました。