本文へ移動
Telemetry
AIとLLM SQL レシピ

AI エージェントのタスクの成功と人間による引き継ぎを測定する

エージェントのタスクの成功、レビュー担当者の承認、コスト、待ち時間、人による引き継ぎ率をワークフローとモデルごとに比較します。

中級者agent_run_outcomesレビュー済み 2026-07-28テスト済み アパッチ DataFusion 45.2.0

レビュー者 Telemetry 製品チーム . SQL の互換性、イベント コントラクト、合成出力、および操作上の注意事項. 基準と所有権を確認する

質問に回答しました

どのエージェントのワークフローが正常に終了し、受け入れられた結果をもたらしますか?

技術的に完了したエージェントの実行が必ずしも役立つとは限りません。このパターンでは、実行時の成功をレビューされた結果や人間による引き継ぎと並行して維持できるため、自動化の品質はワークフロー境界で測定されます。

イベント契約

クエリが期待するフィールド

フィールド種類なぜ存在するのか
timestamp_utcTimestampターミナル エージェントの実行時間 (UTC)。
workflowUtf8安定した製品ワークフローまたはタスク カテゴリ。
modelUtf8プロバイダーの応答から記録されたモデル識別子。
statusUtf8テクニカルランの成功または失敗。
reviewer_outcomeUtf8承認、改訂、拒否、または not_reviewed。
human_handoffBoolean人間がそのタスクを引き継いだかどうか。
duration_msFloat64エンドツーエンドのワークフローの期間。
estimated_cost_usdFloat64実行の正規化された推定モデルコスト。
DataFusion SQL

クエリをコピーする

sql
SELECT
  workflow,
  model,
  COUNT(*) AS runs,
  100.0 * SUM(CASE WHEN status = 'success' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS technical_success_rate_pct,
  100.0 * SUM(CASE WHEN reviewer_outcome = 'accepted' THEN 1 ELSE 0 END)
    / NULLIF(SUM(CASE
      WHEN reviewer_outcome <> 'not_reviewed' THEN 1 ELSE 0
    END), 0) AS reviewed_acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS human_handoff_rate_pct,
  AVG(duration_ms) AS average_duration_ms,
  SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0) AS cost_per_run_usd
FROM agent_run_outcomes
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY workflow, model
HAVING COUNT(*) >= 20
ORDER BY reviewed_acceptance_rate_pct, runs DESC;

この読み取り専用クエリは、空の型付きテーブルに対して計画され、実行されます。 アパッチ DataFusion 45.2.0。決定論的なサンプル出力は合成され、個別にレビューされます。フィールド タイプ、しきい値、ビジネス定義を独自のデータと照合して検証します。 テスト方法を読んでください。

クエリ結果

ワークフローごとにエージェントの受け入れを確認しました

払い戻しのレビューは技術的には完了しますが、他のワークフローよりも大幅に多くの修正や人間による引き継ぎが必要です。

workflowmodelrunstechnical_success_rate_pctreviewed_acceptance_rate_pcthuman_handoff_rate_pctaverage_duration_mscost_per_run_usd
support_triageconfigured-model-a1,84098.186.418.24,8200.04
refund_reviewconfigured-model-b62096.868.742.98,1100.07
knowledge_draftconfigured-model-a94099.291.68.43,9100.04

合成出力例。運用上の決定に使用する前に、独自のイベント スキーマとしきい値に対してクエリを実行します。

Reviewed agent acceptance by workflow: Measure AI Agent Task Success and Human Handoff 結果例からの合成 reviewed_acceptance_rate_pct 値の静的チャート
決定論的な出力例のインデックス可能な SVG。記事、ランブック、または出典を明示した設計レビューのためにダウンロードしてください。

例を再現する

パブリックフィクスチャをダウンロードする

JSON バンドルには、型付きイベント コントラクトが含まれています。 illustrative 入力行、正確な SQL、予想される出力、レビューメモ、およびエンジンのバージョン。 CSV には、表示された結果が含まれます。

SQL の仕組み

  1. 1技術的な成功とレビューされた承認は分離されたままであるため、完了した API コールは製品の品質を代用することはできません。
  2. 2合格分母は、欠落しているラベルを黙って拒否として扱うのではなく、未レビューの実行を除外します。
  3. 3ハンドオフ、期間、コストは、一見高い完了率の背後にある運用上のトレードオフを明らかにします。

決定すべきエッジケース

  • レビュー担当者の結果には、チームまたはモデルのバージョンを比較する前に、安定したルーブリックと評価者間チェックが必要です。
  • 自動的に解決される簡単なタスクは、承認を上方に偏らせる可能性があります。変更されるタスクの難易度ごとにセグメント化します。
  • 明示的に承認されない限り、未処理のプロンプト、入力完了、および機密ツールの結果をイベントに入れないでください。

推奨されるダッシュボード

  • バー: ワークフローによる受け入れの確認と人間による引き継ぎ
  • 傾向: モデルまたは即時リリース後に受け入れられる
  • 表: 管理されたレビュー担当者の結果ごとにグループ化された実行

アラートガイダンス

リリース後に受け入れが減少したり引き継ぎが増加した場合には、成熟したコホートをレビューします。ユーザーが直面する障害または安全境界のみのページ。

アラート設定を読む

レシピを活用する

関連する機器とガイド

ソースデータを定義する

この分析のイベント スキーマ

分析を続ける

実際のイベントで実行する

テーブルを作成し、フィールドを調整して、結果を保存します

無料で始めて、構造化されたイベントを送信し、クエリ結果をグラフ、共有ダッシュボード ウィジェット、またはアラート入力として使用します。

API キーを取得する