本文へ移動
Telemetry
API の成功を超えるエージェントの成果を測定するチーム向け

AIエージェントの品質と評価

エージェントの実行、レビュー担当者の結果、人間による引継ぎ、コストを結び付け、反復可能な品質評価ワークフローに変更をリリースします。

レビュー者 Telemetry 製品チーム . イベントの契約、推奨される分析、およびプライバシーの境界. 基準と所有権を確認する

なぜこれが機能するのか
  • 技術的な完了と、レビューされたタスクの成功を切り離してください。
  • 承認、改訂、拒否、および人による引き継ぎ率を比較します。
  • コストと遅延だけを最適化するのではなく、品質のほかにコストと遅延も追跡します。
測定経路

1 つのエージェントの実行からリリースの決定までの移行

有用な品質ループにより、バージョン管理された運用コンテキストが保存され、自動化されたスコアがレビュー結果から分離され、評価されたカバレッジが常に可視化されます。

  1. 1

    バージョン管理された実行

    ワークフロー、モデル、プロンプト、ツール、リリース、コスト、ターミナルのステータスを記録します。

  2. 2

    レビューされた結果

    ルーブリックのバージョン、評価者のタイプ、スコア、承認または引き継ぎの結果を添付します。

  3. 3

    SQLの比較

    同じ対象集団間で品質、カバレッジ、障害、レイテンシ、コストを比較します。

  4. 4

    発売決定

    昇格またはロールバックする前に、失敗した例と製品への影響を検査します。

ユースケースとテンプレートの比較

このページでは、何を測定するのか、なぜ測定するのかについて説明します。

ユースケース ガイドを使用して、結果、イベントの境界、分析の質問を選択します。短いコピーアンドペースト実装の概要の準備ができたら、一致するテンプレートを開きます。

開く AI エージェント可観測性テンプレート

エージェントプロンプト

これをコーディングエージェントに貼り付けます

交換する YOUR_API_KEY サインアップ後、エージェントに製品フローを実行して最初のイベントを確認するように依頼します。

エージェントプロンプト

AI Agent Quality and Evaluation セットアップ プロンプト

text
Telemetry を使用して AI エージェントの品質と評価を計測します。

/skill.md とこの Telemetry API キーを使用します: YOUR_API_KEY

ターミナル エージェントの結果を run_id、ワークフロー、model、prompt_version、リリース、status、reviewer_outcome、human_handoff、duration_ms、input_tokens、output_tokens、で記録します。 estimated_cost_usd、retry_count、および制御対象の error_type。共有 run_id を使用してツールの結果を個別に記録します。

技術的な成功、レビューされた承認、改訂と拒否、人による引き継ぎ、承認された結果ごとのコスト、リリースごとの品質に関するダッシュボードを作成します。未レビューの実行をレビュー済みの受け入れ分母から除外します。

データ所有者が目的と保持を明示的に承認していない限り、生のプロンプト、完了、ツールのペイロード、秘密、または個人データをログに記録しないでください。

セットアップ手順

  1. 1タスクレベルの成功ルーブリックと管理されたレビュー担当者の結果を定義します。
  2. 2エージェントの実行ごとに 1 つのターミナル結果と、ツールおよびハンドオフ イベントをログに記録します。
  3. 3成熟したレビュー済みコホートをワークフロー、モデル、プロンプト、リリースごとにセグメント化します。
  4. 4自動化を変更する前に、テレメトリ以外の例で回帰を確認してください。

キャプチャするイベント

agent_run_completedagent_output_reviewedagent_handoff_requestedagent_tool_completedagent_release_evaluated

質問のロックが解除されました

  • 技術的には完了したが、人間によるレビューに失敗したワークフローはどれですか?
  • リリース後に人間による引き継ぎが増加しているのはどこですか?
  • 持続可能なコストで受け入れられる結果を生み出すモデルはどれですか?

イベントスキーマの開始点

クエリまたはスニペットを運用環境に適用する前に、行粒度、出力境界、必要なタイプ、プライバシー クラス、サンプル ペイロード、および検証チェックリストを確認してください。

関連製品の機能

このワークフローを続行します AIエージェントの監視

レビュー可能な SQL を使用して、エージェントの実行、ツールの使用、モデルのコスト、品質、製品の結果を結び付けます。

関連する SQL レシピ

SQL で次の質問に答えてください

このワークフローの構造化フィールドに対してクエリを実行し、結果の例を検査して、有用な回答をダッシュボードまたはアラートに変換します。

すべてのレシピを参照する
完全なコレクションAIとLLM SQL

次のステップ

エージェントが使用する API キーを作成します

プロンプトの実行、テスト イベントの送信、最初のダッシュボードの確認には無料プランで十分です。

関連ページ