跳转到内容
Telemetry
人工智能和法学硕士 SQL查询示例

衡量人工智能智能体任务的成功和人工交接

按工作流程和模型比较智能体任务成功率、审阅者接受度、成本、延迟和人工切换率。

中级agent_run_outcomes已审核 2026-07-28测试用 阿帕奇 DataFusion 45.2.0

审阅者 Telemetry产品团队 . SQL 兼容性、事件契约、合成输出和操作注意事项. 审查标准和所有权

问题已回答

哪些智能体工作流程成功完成并产生可接受的结果?

技术上完成的智能体运行不一定有用。这种模式除了审查结果和人工切换之外还可以保持运行时的成功,因此可以在工作流程边界测量自动化质量。

活动合约

查询期望的字段

字段类型为什么存在
timestamp_utcTimestamp终端智能体运行时间(UTC)。
workflowUtf8稳定的产品工作流程或任务类别。
modelUtf8从提供商响应中记录的模型标识符。
statusUtf8技术运行成功或失败。
reviewer_outcomeUtf8接受、修改、拒绝或 not_reviewed。
human_handoffBoolean是否由人类接管该任务。
duration_msFloat64端到端工作流程持续时间。
estimated_cost_usdFloat64运行的标准化估计模型成本。
DataFusion SQL

复制查询

sql
SELECT
  workflow,
  model,
  COUNT(*) AS runs,
  100.0 * SUM(CASE WHEN status = 'success' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS technical_success_rate_pct,
  100.0 * SUM(CASE WHEN reviewer_outcome = 'accepted' THEN 1 ELSE 0 END)
    / NULLIF(SUM(CASE
      WHEN reviewer_outcome <> 'not_reviewed' THEN 1 ELSE 0
    END), 0) AS reviewed_acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS human_handoff_rate_pct,
  AVG(duration_ms) AS average_duration_ms,
  SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0) AS cost_per_run_usd
FROM agent_run_outcomes
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY workflow, model
HAVING COUNT(*) >= 20
ORDER BY reviewed_acceptance_rate_pct, runs DESC;

此只读查询是针对空类型表计划和执行的 阿帕奇 DataFusion 45.2.0。确定性样本输出是综合的并单独审查;根据您自己的数据验证字段类型、阈值和业务定义。 阅读测试方法。

查询结果

按工作流程审查智能体接受情况

退款审核在技术上完成,但比其他工作流程需要更多的修改或人工接管。

workflowmodelrunstechnical_success_rate_pctreviewed_acceptance_rate_pcthuman_handoff_rate_pctaverage_duration_mscost_per_run_usd
support_triageconfigured-model-a1,84098.186.418.24,8200.04
refund_reviewconfigured-model-b62096.868.742.98,1100.07
knowledge_draftconfigured-model-a94099.291.68.43,9100.04

综合示例输出。在将其用于操作决策之前,针对您自己的事件架构和阈值运行查询。

Reviewed agent acceptance by workflow:来自 Measure AI Agent Task Success and Human Handoff 示例结果的合成 reviewed_acceptance_rate_pct 值的静态图表
确定性示例输出的可索引 SVG。下载它以获取带有归属的文章、操作手册或设计评论。

重现示例

下载公共装置

JSON 包包含类型化事件契约, illustrative 输入行、确切的 SQL、预期输出、审阅注释和引擎版本。 CSV 包含显示的结果。

SQL 是如何工作的

  1. 1技术成功和审核验收仍然是分开的,因此完整的 API 调用不能代表产品质量。
  2. 2接受分母排除未经审查的运行,而不是默默地将丢失的标签视为拒绝。
  3. 3交接、持续时间和成本暴露了表面上高完成率背后的运营权衡。

需要决定的边缘情况

  • 在比较团队或模型版本之前,审阅者的结果需要稳定的评分标准和评估者之间的检查。
  • 自动解决的简单任务可能会导致接受度上升;当任务难度发生变化时,按其难度进行细分。
  • 除非得到明确批准,否则请将原始提示、完成情况和敏感工具结果排除在活动之外。

推荐仪表板

  • 酒吧:按工作流程审查验收和人工交接
  • 趋势:模型或即时发布后接受
  • 表:按受控评审结果分组的运行

警报指导

当发布后接受度下降或交接率上升时,审查成熟群体;页面仅适用于面向用户的故障或安全边界。

读取警报设置

让查询示例发挥作用

相关埋点和指南

定义源数据

此分析的事件模式

继续分析

在真实事件中运行它

创建表,调整字段并保存结果

免费开始,发送结构化事件,并将查询结果用作图表、共享仪表板小部件或警报输入。

获取 API 密钥