测量路径
从一次智能体运行转向发布决策
有用的质量循环可以保留版本化的生产环境,将自动评分与审核结果分开,并使评估的覆盖范围保持可见。
- 1
版本化运行
记录工作流程、模型、提示、工具、发布、成本、终端状态。
- 2
审查结果
附上评分标准版本、评估者类型、分数以及接受或移交结果。
- 3
SQL比较
比较相同合格人群的质量、覆盖范围、故障、延迟和成本。
- 4
发布决定
在升级或回滚之前检查失败的示例和产品影响。
用例与模板
本页解释了要测量的内容以及原因
使用用例指南来选择结果、事件边界和分析问题。当您准备好接受较短的复制粘贴实施简介时,请打开匹配的模板。
智能体提示
将其粘贴到您的编码代理中
更换 YOUR_API_KEY 注册后,然后要求智能体运行产品流程并验证第一个事件。
代理提示
AI Agent Quality and Evaluation 设置提示
text
使用 Telemetry 检测 AI 代理质量和评估。
使用 /skill.md 和此 Telemetry API 密钥:YOUR_API_KEY
使用 run_id、workflow、model、prompt_version、release、status、reviewer_outcome、human_handoff、duration_ms、input_tokens、output_tokens 记录终端代理结果estimated_cost_usd、retry_count、受控error_type。使用共享的 run_id 单独记录工具结果。
创建技术成功、审核接受、修订和拒绝、人工交接、每个接受结果的成本以及发布质量的仪表板。从已审核的验收分母中排除未经审核的运行。
除非数据所有者明确批准其目的和保留,否则请勿记录原始提示、完成情况、工具有效负载、秘密或个人数据。设置步骤
- 1定义任务级成功标准并控制审阅者结果。
- 2记录每个智能体运行的一个终端结果以及工具和切换事件。
- 3按工作流程、模型、提示和发布对成熟的审核群体进行细分。
- 4在更改自动化之前,请使用遥测之外的示例查看回归。
要捕获的事件
agent_run_completedagent_output_reviewedagent_handoff_requestedagent_tool_completedagent_release_evaluated
问题已解锁
- 哪些工作流程在技术上已完成但未通过人工审核?
- 发布后哪些地方的人为切换会增加?
- 哪种模式以可持续的成本产生可接受的结果?
事件架构起点
此工作流程的事件契约
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 AI代理监控
通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。
相关 SQL 查询示例
用 SQL 回答下一个问题
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
人工智能和法学硕士中级
按提示版本查找 AI 质量回归
新的提示版本是否在不增加人工交接的情况下提高了质量?
打开查询示例人工智能和法学硕士中级
衡量人工智能智能体任务的成功和人工交接
哪些智能体工作流程成功完成并产生可接受的结果?
打开查询示例人工智能和法学硕士中级
衡量每美元所接受的人工智能产出
哪种模型和功能组合可以产生最受接受的单位美元产出?
打开查询示例人工智能和法学硕士中级
检测重复的 AI 智能体工具循环
哪些智能体运行似乎陷入了重复的工具循环?
打开查询示例人工智能和法学硕士入门
按功能和模型计算 LLM 成本
哪些产品功能和型号正在推动法学硕士支出?
打开查询示例人工智能和法学硕士中级
测量 LLM 获得第一个令牌的时间
在输出开始之前,哪些模型和功能组合感觉很慢?
打开查询示例人工智能和法学硕士中级
按版本评估 RAG 检索质量
新的 RAG 管道是否提高了检索率和接地答案率?
打开查询示例完整系列人工智能和法学硕士 SQL
相关页面