跳转到内容
Telemetry
适用于衡量 API 成功之外的智能体结果的团队

AI智能体质量与评估

将智能体运行、审阅者结果、人工交接、成本和发布更改连接到可重复的质量评估工作流程。

审阅者 Telemetry产品团队 . 事件契约、推荐分析和隐私边界. 审查标准和所有权

为什么这有效
  • 将技术完成情况与审查的任务成功情况分开。
  • 比较接受率、修改率、拒绝率和人工移交率。
  • 除了质量之外还跟踪成本和延迟,而不是单独优化它们。
测量路径

从一次智能体运行转向发布决策

有用的质量循环可以保留版本化的生产环境,将自动评分与审核结果分开,并使评估的覆盖范围保持可见。

  1. 1

    版本化运行

    记录工作流程、模型、提示、工具、发布、成本、终端状态。

  2. 2

    审查结果

    附上评分标准版本、评估者类型、分数以及接受或移交结果。

  3. 3

    SQL比较

    比较相同合格人群的质量、覆盖范围、故障、延迟和成本。

  4. 4

    发布决定

    在升级或回滚之前检查失败的示例和产品影响。

用例与模板

本页解释了要测量的内容以及原因

使用用例指南来选择结果、事件边界和分析问题。当您准备好接受较短的复制粘贴实施简介时,请打开匹配的模板。

打开 AI 智能体可观测性模板

智能体提示

将其粘贴到您的编码代理中

更换 YOUR_API_KEY 注册后,然后要求智能体运行产品流程并验证第一个事件。

代理提示

AI Agent Quality and Evaluation 设置提示

text
使用 Telemetry 检测 AI 代理质量和评估。

使用 /skill.md 和此 Telemetry API 密钥:YOUR_API_KEY

使用 run_id、workflow、model、prompt_version、release、status、reviewer_outcome、human_handoff、duration_ms、input_tokens、output_tokens 记录终端代理结果estimated_cost_usd、retry_count、受控error_type。使用共享的 run_id 单独记录工具结果。

创建技术成功、审核接受、修订和拒绝、人工交接、每个接受结果的成本以及发布质量的仪表板。从已审核的验收分母中排除未经审核的运行。

除非数据所有者明确批准其目的和保留,否则请勿记录原始提示、完成情况、工具有效负载、秘密或个人数据。

设置步骤

  1. 1定义任务级成功标准并控制审阅者结果。
  2. 2记录每个智能体运行的一个终端结果以及工具和切换事件。
  3. 3按工作流程、模型、提示和发布对成熟的审核群体进行细分。
  4. 4在更改自动化之前,请使用遥测之外的示例查看回归。

要捕获的事件

agent_run_completedagent_output_reviewedagent_handoff_requestedagent_tool_completedagent_release_evaluated

问题已解锁

  • 哪些工作流程在技术上已完成但未通过人工审核?
  • 发布后哪些地方的人为切换会增加?
  • 哪种模式以可持续的成本产生可接受的结果?

事件架构起点

在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。

相关产品功能

继续此工作流程 AI代理监控

通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。

相关 SQL 查询示例

用 SQL 回答下一个问题

针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。

浏览所有查询示例

下一步

创建您的智能体将使用的 API 密钥

免费计划足以运行提示、发送测试事件和查看第一个仪表板。

相关页面