1. イベント契約
1行 agent_run_outcomes、クエリで使用される型が明示的に示されています。
- timestamp_utc
- Timestamp
- workflow
- Utf8
- model
- Utf8
- status
- Utf8
- reviewer_outcome
- Utf8
- human_handoff
- Boolean
エージェント、ツール、モデル、結果の境界でコンパクトなイベントをキャプチャし、検査可能な SQL を使用して、信頼性とコストをユーザーまたはビジネス ワークフローが受け取った結果と結びつけます。
結果
仕組み
完了したエージェントの実行またはビジネス操作ごとに 1 行を選択します。ステータス、期間、ワークフロー、リリース、ハンドオフ、コスト、および安全な相関識別子を記録します。
ツールとモデルが既知の信頼性、コスト、または品質に関する質問に回答したときのイベントをログに記録します。トレース全体や機密ペイロードをコピーしないでください。
承認、人間によるレビュー、タスクの成功、またはその他の明示的な製品の結果を記録し、レビューされた SQL と完全な分母を持つリリースを比較します。

Telemetry の AI エージェント結果イベント
エージェントの実行、ツール呼び出し、ターミナルの結果を検査するために使用されるイベント テーブルと SQL サーフェスを示す実際の Telemetry ワークスペース。
境界線
検査可能な証明パス
この例では、宣言されたスキーマ、読み取り専用の SQL、および決定論的な合成結果を使用します。顧客のベンチマークとしてサンプル データを提示せずにワークフローを示します。
1行 agent_run_outcomes、クエリで使用される型が明示的に示されています。
どのエージェントのワークフローが正常に終了し、受け入れられた結果をもたらしますか?
SELECT
workflow,
model,
COUNT(*) AS runs,
100.0 * SUM(CASE WHEN status = 'success' THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS technical_success_rate_pct,
100.0 * SUM(CASE WHEN reviewer_outcome = 'accepted' THEN 1 ELSE 0 END)
/ NULLIF(SUM(CASE
WHEN reviewer_outcome <> 'not_reviewed' THEN 1 ELSE 0
END), 0) AS reviewed_acceptance_rate_pct,
100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS human_handoff_rate_pct,
AVG(duration_ms) AS average_duration_ms,
SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0) AS cost_per_run_usd
FROM agent_run_outcomes
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY workflow, model
HAVING COUNT(*) >= 20
ORDER BY reviewed_acceptance_rate_pct, runs DESC;払い戻しのレビューは技術的には完了しますが、他のワークフローよりも大幅に多くの修正や人間による引き継ぎが必要です。
| ワークフロー | model | runs |
|---|---|---|
| support_triage | configured-model-a | 1840 |
| refund_review | configured-model-b | 620 |
| knowledge_draft | configured-model-a | 940 |
能力
エージェント固有のセットアップ パス
から始めます エージェント テレメトリ skill.md ガイド、次に、同じレビューされたテレメトリ境界を、焦点を当てた Claude Code、Cursor、または Codex 実装パスに運びます。
分析を見る
エージェントのタスクの成功、レビュー担当者の承認、コスト、待ち時間、人による引き継ぎ率をワークフローとモデルごとに比較します。
レシピを開く共有ワークフロー識別子から、順序付けられたサービス間ワークフロー ステップと経過時間を再構築します。
レシピを開く成功した結果に達することなく、小規模なツール セットを繰り返し呼び出すエージェントの実行を見つけます。
レシピを開くモデルの支出を、受け入れられた、保存された、またはその他の有用な製品の成果に結び付けます。
レシピを開くモデルの支出、トークン、リクエスト量、リクエストあたりのコストを製品機能に関連付けます。
レシピを開く元のイベント ペイロードを平坦化することなく、点線でネストされたフィールドをフィルターし、失敗したツールをランク付けします。
レシピを開く顧客の証拠
関連する機能
対象範囲を拡大する前に、焦点を絞ったプロンプトを使用し、合成イベントを送信し、最初の有用なクエリを検証します。