Amazon Web Services ブログ

Amazon CloudWatch Omni のご紹介:生成 AI およびエージェント型ワークロード向けの AI を活用したオブザーバビリティ

2026 年 9 月 25 日、 Amazon CloudWatch は CloudWatch Omni を発表しました。これは、アプリケーション中心で AI を活用し、オープンスタンダードに基づいて構築され、オフコンソールで提供される、アプリケーションと AI ワークロードの統合オブザーバビリティエクスペリエンスです。CloudWatch Omni は、AI エージェント向けに特化して構築されたオブザーバビリティ、評価、実験のためのソリューションです。評価主導のワークフロー、既存のツールのサポート、そして作業環境に直接提供されるオブザーバビリティにより、チームは、モデルプロバイダー、フレームワーク、ランタイムを問わず、AI エージェントの設計、評価、運用を行えます。オブザーバビリティは IDE に直接提供されるほか、AWS Management Console とは独立したスタンドアロンの Web エクスペリエンスからも利用できます。

エージェント型 AI システムを導入する組織は、従来のモニタリングでは対処できないオブザーバビリティの課題に直面しています。エージェントの動作は非決定的です。標準的なメトリクスでエラーが示されていなくても、プロンプトを変更すると応答品質が低下する可能性があります。チームは複数のシステムにまたがるログを手作業で確認するために何時間も費やしており、何が変更されたのか、なぜ変更されたのかを特定できないことがあります。既存のツールでは、チームはサイロ化された生成 AI モニタリングを利用するか、コーディング環境とブラウザーベースのダッシュボードを頻繁に行き来する必要がある分断されたソリューションを利用するかの選択を迫られます。

CloudWatch Omni はすべてのトレースをキャプチャし、正確性、一貫性、検索品質、ツール選択などを評価する組み込みの評価機能を備えています。Playground でプロンプトバージョンを並べて比較したり、本番トラフィックからテストデータセットを構築したり、さまざまな構成で実験を実行したり、リグレッションを自動的に検出したりできます。

開発用と運用用の2つのサーフェス
CloudWatch Omni は、相互に補完する 2 つのインターフェイスを通じてオブザーバビリティを提供しま開発者は、現在サポートされている IDE である VS Code と Kiro にネイティブ拡張機能を導入できます。エージェントの実行中にトレースが表示され、プレイグラウンドや評価機能にもワンクリックでアクセスできます。運用担当者は、AWS Management Console とは独立したスタンドアロンの Web エクスペリエンスを利用してフリートをモニタリングできます。SSO 経由でアクセスでき、AWS Management Console は必要ありません。どちらも同じデータを共有します。開発者がデバッグするトレースと、運用担当者が調査するトレースは同じものです。

Cloud Login 機能は、ローカルの IDE 環境を AWS アカウントに接続し、テレメトリデータを Amazon CloudWatch に送信して永続的に保存したり、チームとトレースを共有したり、本番環境のダッシュボードにアクセスしたりできるようにします。この接続はオプションです。開発中は CloudWatch Omni を完全にローカル環境で使用し、本番環境のエージェントをモニタリングする準備ができたら、クラウドに接続できます。

使用の開始
CloudWatch Omni を使い始める方法は 2 つあります。IDE 拡張機能(VS Code と Kiro 向け)を使用する方法と、クラウドエクスペリエンスから直接開始する方法です。クラウドエクスペリエンスでは、IDE 拡張機能をインストールせずに CloudWatch へのテレメトリデータの送信を開始できます。このチュートリアルでは、拡張機能をインストールし、エージェントを作成して実行した後、IDE からトレースと評価ツールを確認します。

VS Code Marketplace から CloudWatch Omni 拡張機能をインストールすると、アクティビティ バーに CloudWatch Omni のアイコンが表示されます。ウェルカム画面から、[サンプルプロジェクトを開始する] を選択して、事前設定されたエージェントにサンプルトレースデータをロードするか、Command+Shift+P(macOS の場合)または Ctrl+Shift+P(Windows/Linuxの場合)を使用してコマンドパレットへのショートカットを使用し、[オムニ:新しいプロジェクトの作成] を選択します。

CloudWatch オムニウェルカムスクリーンと VS Code での新規プロジェクトの作成
図 1.CloudWatch オムニウェルカムスクリーンと VS Code での新規プロジェクトの作成

サンプルプロジェクトには、エージェントの実装とサンプルデータセットが含まれています。使用開始時の設定の一環として、OpenTelemetry の計測機能を追加します。CloudWatch Omni が各手順をガイドします。新しいエージェントを最初から作成することもできます。CloudWatch Omni では、インタラクティブなチャットを使ってプロセスを進めます。チャットでエージェントの目的を定義し、モデルプロバイダーを選択して、ツールを設定します。デフォルトでは、すべてのデータはローカルに保存されます。必要に応じて AWS に接続し、Amazon CloudWatch にデータを送信できます。

設定を確認した後、ローカル開発サーバーを起動し、エージェントに質問を送信しました。これが一般的なチャットボットインターフェースと異なるのは、次に何が起こるかということです。「トレースを表示」を選択すると、エージェントがリクエストをどのように処理したかが正確に表示されます。

CloudWatch Omni が AI コードアシスタントをガイドして開発環境を構成します
図 2.CloudWatch Omni は、AI コードアシスタントをガイドし、テスト用のローカル開発環境を設定できるようにします

CloudWatch Omni は、Kiro、Claude Code、Codex などの AI コードアシスタントと統合し、セットアッププロセスを効率化します。これらのアシスタントは、Dev Server の設定、依存関係のインストール、計測機能の設定を代わりに行うことができるため、手動で設定することなく、インストールから最初のトレース付きエージェントセッションの実行までを数分で完了できます。

エージェントとのやり取りとトレースの表示
図 3.エージェントとのやり取りとトレースの表示

トレースは AI エージェントの動作を理解するために不可欠です。従来のリクエストとレスポンスのシステムとは異なり、エージェントは 1 回の呼び出しで複数の意思決定を行います。ツールの選択、プロンプトの組み立て、サブコールの連鎖などが含まれます。トレース全体を可視化できなければ、エージェントが誤った回答を生成した理由や、予期しない処理経路をたどった理由の診断は推測に頼ることになります。CloudWatch Omni は、すべてのステップを構造化されたタイムラインに記録するため、動作が想定から外れた箇所を正確に特定できます。

Trace Explorer では、エージェントが実行したすべてのステップ(LLM 呼び出し、ツールの呼び出し、推論ステップ)を、構造化された階層型タイムラインで詳細に確認できます。任意のスパンを詳細に確認して、入力、出力、トークン使用量、レイテンシーを調査できます。

エージェント実行タイムラインを表示するトレースエクスプローラー
図 4。エージェントの実行タイムラインを表示するトレースエクスプローラー

Trace Explorer は比較モードもサポートしています。比較モードでは、2 つのトレースを並べて表示し、異なるプロンプトや設定が動作にどのように影響するかを確認します。比較モードは、リグレッションのデバッグに特に役立ちます。また、 Ask Assistant を使用すると、AI エージェントがトレースから表面のパターンや異常を分析し、「なぜエージェントはこのツールを2回呼び出したのか」などの質問に答えます。

2 つのトレースを並べて比較する
図 5。2 つのトレースを並べて比較する

評価は、生成 AI のオブザーバビリティを、実際の品質改善につながるものに変える役割を果たします。レイテンシーやエラー率などの従来のメトリクスでは、エージェントの応答が有用で、一貫性があり、事実に基づいて正確なものかどうかを判断できません。評価機能は、各応答を品質の観点から評価することで、ユーザーが実際に体験する品質を測定し、標準的なモニタリングではまったく検出できないリグレッションを発見できるようにします。

CloudWatch Omni には、一貫性、有用性、忠実性、ルーティングの正確性などのメトリクスに対応する 17 種類の組み込み評価機能が含まれています。Trace Explorer からトレースを選択し、評価機能を選んで評価を実行しました。カスタム評価フレームワークを構築することなく、各サンプルのスコアと集計メトリクスを取得できました 。

トレースの評価の実行
図 6.トレースの評価の実行

そこから、 Playground を使用してさまざまなシステムプロンプトを並べてテストし、複数のモデルとプロンプト構成をリアルタイムで比較して、変更を加える前に各バリエーションが出力品質にどのように影響するかを確認しました。Experiments ビューを使用すると、同じデータセットに対して 2 つのエージェントのバリエーションを実行し、評価スコア、レイテンシー、トークン使用量を並べて比較できるため、パフォーマンスの高い構成を選択できます。

図 7 。Omni Experimentsコンソールでのエージェントバリアントの評価比較

Prompt Management を使用すると、プロンプト構成を長期にわたってバージョン管理および追跡できるため、新しいバージョンのパフォーマンスが低下した場合でも、簡単にロールバックできます。

CloudWatch Omni には、完全な会話履歴を確認し、エージェントが複数ターンのインタラクションをどのように処理するかを把握できる Session Explorer も用意されています。また、Agent Topology ビューでは、サブエージェント、ツール、およびそれらの相互接続を含むエージェントシステムのアーキテクチャを可視化できます。任意のノードを詳細に確認して、パフォーマンスを調査し、ボトルネックを特定できます。

CloudWatch Omni には、IDE を使用せず、任意のブラウザーからアクセスできる専用の Web エクスペリエンスも用意されています。チームは、アプリケーションモニタリング、分析、エージェントのオブザーバビリティ、AI を活用した調査など、すべての機能に共同でアクセスできます。

アプリケーションモニタリング、分析、エージェントオブザーバビリティを備えた CloudWatch Omni ウェブエクスペリエンス
図 8.アプリケーションモニタリング、分析、エージェントオブザーバビリティを備えた CloudWatch Omni ウェブエクスペリエンス

トレースをキュレーションしてゴールデンデータセットにし、構造化された実験を行いました。Experiment 関数は、データセットに対してエージェントを実行し、結果を自動的に評価します。プロンプトやエージェントのロジックが変更されるたびに、リグレッションテスト用のベンチマークを作成できます。

サポートされているフレームワークで構築されたエージェントがすでにある場合、CloudWatch Omniはインストルメンテーションを追加するための2つの方法を提供します。 1つはフレームワークを検出してトレースを自動的に設定する Auto-Instrumentswith Kiro 、もう1つは Python と TypeScript 用のすぐに使えるコードスニペットを使った手動インストゥルメンテーションです。詳細なインストルメンテーションガイドについては、 CloudWatch Omni ドキュメントを参照してください。

サポートされているフレームワークとオープンスタンダード
上記のチュートリアルではサンプルプロジェクトを使用していますが、CloudWatch Omni は、チームがすでに使用しているエージェントフレームワークにも対応しています。LangChain、LangGraph、CrewAI、OpenAI SDK、Strands、Vercel AI SDK など、Python と TypeScript の両。また、 Amazon Bedrock AgentCore で構築されたエージェントにネイティブなオブザーバビリティを提供し、AgentCore の評価機能を使用してエージェントの品質をオムニワークフロー内で直接評価します。

計測機能には、エージェントが Lambda、ECS、EKS、その他のクラウドのいずれで実行されている場合でも、オープンスタンダード(OpenInference および ADOT)が使用 。評価については、Omni は Braintrust、DeepEval、Ragas などのサードパーティー評価ツールと統合できるほか、組み込みのデータセット、プレイグラウンド、バッチ実験も利 。再プラットフォーム化は不要です。

CloudWatch Omni は、エージェントのオブザーバビリティとアプリケーションのオブザーバビリティを 1 つのエクスペリエンスに統合します。アプリケーションのオブザーバビリティ体験については、関連記事「Amazon CloudWatch Omni の紹介:人工知能を活用したアプリケーションのコラボレーティブオブザーバビリティ」を参照してください。

料金と利用可能なリージョン
Amazon CloudWatch Omni が一般公開されました。IDE 拡張機能は自由に使用できます。開始するのに AWS アカウントは必要ありません。Amazon Bedrock のモデルを使用する場合は AWS 認証情報のみが必要で、OpenAI や Anthropic などの他のプロバイダーを使用する場合は API キーのみが必要です。VS Code マーケットプレイスから拡張機能をインストールして、今すぐ始めましょう。

すべての機能を調べてすぐに使い始めるには、 CloudWatch on AWS Builder Center にアクセスしてください。

API を呼び出したり、ドキュメントを検索したり、リージョンごとの提供状況を確認したり、この新機能に関するトラブルシューティングを確認したりする場合は、お好みの AI ツールで AWS MCP Server とプラグインを使用してみてください。AWS re:Post でフィードバックを共有するか、通常の AWS サポート の連絡先からお問い合わせください。

ハッピービルディング!

– Daniel Abib

原文はこちらです。