AI agent observability template: 実装から決定まで
プロンプトを実装の概要として扱います。有用な成果物は、コピーされたコードだけではなく、信頼できる答えを生成するレビューされたイベント コントラクトです。
- 1
境界を設定する
Instrument the point where agent_run_started becomes final.
- 2
契約書を作成する
Start with agent_run_started, agent_tool_called, agent_run_completed and keep every field typed, bounded, and privacy-reviewed.
- 3
フィクスチャを実行する
集計結果に依存する前に、既知の成功、失敗、再試行、および空の結果のケースを実行してください。
- 4
質問に答えてください
最も頻繁に失敗するツールはどれですか?
テンプレートとユースケースの比較
このテンプレートでイベントを追加する
測定目標がすでに明確な場合は、このテンプレートをコピーします。一致するユースケース ガイドを使用して、イベントの境界、成功の定義、および結果の SQL がサポートする必要がある決定を確認します。
テンプレート
これをコーディングエージェントに貼り付けます
交換する YOUR_API_KEY、フローをローカルで実行し、生成されたイベントとダッシュボードを確認します。
AI エージェントの可観測性テンプレート
この AI エージェント ワークフローに Telemetry を追加します。
/skill.md とこの Telemetry API キーを使用します: YOUR_API_KEY
ログ:
1. agent_run_started と agent_name、route、user_id、team_id、model、provider、および input_category。
2. agent_tool_called と tool_name、status、latency_ms、retry_count、および error_type。
3. status付きの agent_run_completed、duration_ms、total_tokens、estimated_cost_usd、output_category、利用可能な場合は受け入れられます。
4. agent_run_failed と error_type、failed_step、retry_count、および duration_ms。
実行量、ツール別の失敗率、p95 期間、feature別のmodel コスト、および受け入れられた出力率についての SQL クエリを作成します。
明示的に承認されない限り、生のプロンプト、完了、シークレット、認証ヘッダー、または個人データをログに記録しないでください。キャプチャするイベント
検証チェックリスト
完全なインストルメンテーション パスが後に残すもの
イベント
合成イベントは、安定した名前とフィールド タイプで目的のテーブルに到達します。
クエリ
最初の SQL クエリは、明示的な時間枠を使用して妥当な行を返します。
ビュー
ダッシュボードでは実際のフィールドが使用され、変更を説明するのに十分なコンテキストが含まれています。
安全性
プロンプト、本文、資格情報、署名、およびプライベート コンテンツの編集がチェックされました。
イベントスキーマの例
このワークフローのイベントスキーマ
クエリまたはスニペットを運用環境に適用する前に、行粒度、出力境界、必要なタイプ、プライバシー クラス、サンプル ペイロード、および検証チェックリストを確認してください。
関連製品の機能
このワークフローを続行します AIエージェントの監視
レビュー可能な SQL を使用して、エージェントの実行、ツールの使用、モデルのコスト、品質、製品の結果を結び付けます。
関連する SQL レシピ
その他のSQL例
このワークフローの構造化フィールドに対してクエリを実行し、結果の例を検査して、有用な回答をダッシュボードまたはアラートに変換します。
相関のあるワークフローのタイムラインを再構築する
最近失敗したワークフロー中に、順番に何が起こったのでしょうか?
レシピを開くプロンプト バージョンごとに AI 品質の低下を見つける
新しいプロンプト バージョンでは、人間による引き継ぎを増やすことなく品質が向上しましたか?
レシピを開くネストされた AI ツール呼び出しイベントのクエリ
最も失敗した呼び出しに関連する AI ツールと引数はどれですか?
レシピを開く繰り返しを検出する AI エージェント ツール Loops
どのエージェントの実行が繰り返しのツール ループに陥っているように見えますか?
レシピを開く機能とモデルごとに LLM コストを計算する
LLM の支出を促進しているのはどの製品機能とモデルですか?
レシピを開く1 ドルあたりの受け入れられた AI 出力を測定する
どのモデルと機能の組み合わせが、1 ドルあたり最も受け入れられる出力を生成しますか?
レシピを開くバージョンごとの RAG 取得品質の評価
新しい RAG パイプラインにより、検索率と根拠のある回答率は向上しましたか?
レシピを開くその他のテンプレート