跳至主要內容
Telemetry
人工智慧和法學碩士 SQL查詢範例

衡量人工智慧代理任務的成功和人工交接

按工作流程和模型比較代理任務成功率、審閱者接受度、成本、延遲和人工切換率。

中級agent_run_outcomes已審查 2026-07-28測試用 阿帕奇 DataFusion 45.2.0

審閱者 Telemetry產品團隊 . SQL 相容性、事件契約、合成輸出和操作注意事項. 審查標準和所有權

問題已回答

哪些代理工作流程成功完成併產生可接受的結果?

技術上完成的代理執行不一定有用。這種模式除了審查結果和人工切換之外還可以保持執行時的成功,因此可以在工作流程邊界測量自動化品質。

活動合約

查詢期望的欄位

欄位型別為什麼存在
timestamp_utcTimestamp終端代理執行時間(UTC)。
workflowUtf8穩定的產品工作流程或任務類別。
modelUtf8從提供商回應中記錄的模型識別符號。
statusUtf8技術執行成功或失敗。
reviewer_outcomeUtf8接受、修改、拒絕或 not_reviewed。
human_handoffBoolean是否由人類接管該任務。
duration_msFloat64端到端工作流程持續時間。
estimated_cost_usdFloat64執行的標準化估計模型成本。
DataFusion SQL

複製查詢

sql
SELECT
  workflow,
  model,
  COUNT(*) AS runs,
  100.0 * SUM(CASE WHEN status = 'success' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS technical_success_rate_pct,
  100.0 * SUM(CASE WHEN reviewer_outcome = 'accepted' THEN 1 ELSE 0 END)
    / NULLIF(SUM(CASE
      WHEN reviewer_outcome <> 'not_reviewed' THEN 1 ELSE 0
    END), 0) AS reviewed_acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS human_handoff_rate_pct,
  AVG(duration_ms) AS average_duration_ms,
  SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0) AS cost_per_run_usd
FROM agent_run_outcomes
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY workflow, model
HAVING COUNT(*) >= 20
ORDER BY reviewed_acceptance_rate_pct, runs DESC;

此只讀查詢是針對空型別資料表計劃和執行的 阿帕奇 DataFusion 45.2.0。確定性樣本輸出是綜合的並單獨審查;根據您自己的資料驗證欄位型別、閾值和業務定義。 閱讀測試方法。

查詢結果

按工作流程審查代理接受情況

退款審查在技術上完成,但比其他工作流程需要更多的修改或人工接管。

workflowmodelrunstechnical_success_rate_pctreviewed_acceptance_rate_pcthuman_handoff_rate_pctaverage_duration_mscost_per_run_usd
support_triageconfigured-model-a1,84098.186.418.24,8200.04
refund_reviewconfigured-model-b62096.868.742.98,1100.07
knowledge_draftconfigured-model-a94099.291.68.43,9100.04

綜合範例輸出。在將其用於操作決策之前,針對您自己的事件架構和閾值執行查詢。

Reviewed agent acceptance by workflow:來自 Measure AI Agent Task Success and Human Handoff 範例結果的合成 reviewed_acceptance_rate_pct 值的靜態圖表
確定性範例輸出的可索引 SVG。下載它以獲取帶有歸屬的文章、操作手冊或設計評論。

重現範例

下載公共裝置

JSON 包包含型別化事件契約, illustrative 輸入行、確切的 SQL、預期輸出、審閱註釋和引擎版本。 CSV 包含顯示的結果。

SQL 是如何工作的

  1. 1技術成功和審查驗收仍然是分開的,因此完整的 API 呼叫不能代表產品品質。
  2. 2接受分母排除未經審查的執行,而不是默默地將丟失的標籤視為拒絕。
  3. 3交接、持續時間和成本暴露了表面上高完成率背後的運營權衡。

需要決定的邊緣情況

  • 在比較團隊或模型版本之前,審閱者的結果需要穩定的評分標準和評估者之間的檢查。
  • 自動解決的簡單任務可能會導致接受度上升;當任務難度發生變化時,按其難度進行細分。
  • 除非得到明確批准,否則請將原始提示、完成情況和敏感工具結果排除在活動之外。

推薦儀表板

  • 酒吧:按工作流程審查驗收和人工交接
  • 趨勢:模型或即時發布後接受
  • 資料表:按受控評審結果分組的執行

警示指導

當發布後接受度下降或交接率上升時,審查成熟群體;頁面僅適用於面向使用者的故障或安全邊界。

讀取警示設定

讓查詢範例發揮作用

相關埋點和指南

定義源資料

此分析的事件模式

繼續分析

在真實事件中執行它

建立資料表,調整欄位並儲存結果

免費開始,傳送結構化事件,並將查詢結果用作圖表、共享儀表板小工具或警示輸入。

獲取 API 金鑰