将详细的执行与持久的产品成果联系起来
在专家跟踪路径中保留步骤级跟踪,然后发出一个紧凑的终端事件,该事件可以将智能体质量、成本、可靠性和产品行为结合起来。
- 1
智能体运行
从批准的运行标识符、工作流程、模型和提示版本开始。
- 2
工具和重试
保留跟踪和分类故障的详细步骤,而无需复制有效负载。
- 3
最终结果
发出成功、失败、取消或人工切换以及成本和持续时间。
- 4
SQL决策
按功能和版本比较可接受的结果、失败和单位经济效益。
开始之前
开始之前
- 在服务器运行时初始化的 OpenAI Agents SDK 和 telemetry-sh 包
- 记录的工作流程名称和终端成功、失败和切换结果
- 决定必须排除哪些提示、工具输入和输出内容
交货设置
安装并初始化服务器端
在仅服务器代码中导入 telemetry-sh 并使用 process.env.TELEMETRY_API_KEY 对其进行一次初始化。 将摄取凭据保留在浏览器包、客户端可见的环境变量、源代码控制、日志和异常消息之外。
npm安装
npm install telemetry-sh- 1准备一个具有有限网络行为的可重用服务器端交付客户端。
- 2在成功、失败、重试或超时边界处添加结果事件。
- 3在启用警报之前发送受控装置并检查存储的行。
片段
从一个结构化事件开始
在工作流程完成、失败或重试的位置添加此形状。然后从真实的字段构建仪表板。
OpenAI agent telemetry事件
await telemetry.log("agent_tool_called", {
run_id: runId,
workflow: "support_resolution",
agent_name: "support_agent",
model: "gpt-4.1",
tool_name: "lookup_order",
status: "success",
latency_ms: 842,
retry_count: 0,
estimated_cost_usd: 0.018,
prompt_version: "support-v3",
release: process.env.APP_RELEASE,
});事件结构
run_id、工作流程、agent_name、模型和 prompt_version
状态、duration_ms、retry_count、total_tokens 和 estimated_cost_usd
tool_name、tool_status、human_handoff、reviewer_outcome 和释放
检查配置
检查站 1
当整个运行结束时,发出一个紧凑的产品结果;保留 SDK 跟踪以进行步骤级调试,而不是将每个跨度复制到第二个系统中。
检查站 2
使用共享的 run_id 或批准的 trace_id 连接单独的工具事件,而不存储工具参数或结果。
检查站 3
在依赖完成率仪表板之前,先练习工具故障、护栏拒绝、移交、取消和导出器刷新行为。
验证
证明事件已到达
在演练已知的成功和失败案例后运行此命令。如果您的最终事件契约与代码片段不同,请替换后备表名称。
OpenAI agent telemetry 验证查询
SELECT *
FROM agent_tool_called
ORDER BY timestamp_utc DESC
LIMIT 20;实施参考
在启用新的生产路径之前,请检查事件合同、数据安全指南和上游主要文档。
在哪里记录事件
保持结果事件小且可恢复
该模式提供了
- 除了上游工作流程之外,还有一个有界的、SQL 就绪的结果。
- 用于仪表板、警报和跨事件关联的稳定字段。
- 用于验证成功、失败、重试和超时行为的夹具驱动路径。
该模式不提供
- OTLP 导出器、自动收集管道或详细跟踪和诊断日志的替代品。
- 仅因为有效负载包含事件 ID,所以仅传送一次。
- 收集原始提供商有效负载、用户内容、凭证或受监管数据的权限。
事件模式示例
此工作流的事件模式
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 AI代理监控
通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。
相关 SQL 查询示例
更多 SQL 示例
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
审核AI智能体工具授权决策
哪些智能体工具最常被拒绝或转而寻求人工批准?
打开查询示例按提示版本查找 AI 质量回归
新的提示版本是否在不增加人工交接的情况下提高了质量?
打开查询示例重建相关的工作流程时间线
在最近一次失败的工作流程中,按顺序发生了什么?
打开查询示例查询嵌套 AI 工具调用事件
哪些人工智能工具和参数与失败次数最多的调用相关?
打开查询示例检测重复的 AI 智能体工具循环
哪些智能体运行似乎陷入了重复的工具循环?
打开查询示例按功能和模型计算 LLM 成本
哪些产品功能和型号正在推动法学硕士支出?
打开查询示例衡量 LLM 缓存节省和重试成本
有多少模型成本与重试和缓存未命中相关?
打开查询示例测量 LLM 获得第一个令牌的时间
在输出开始之前,哪些模型和功能组合感觉很慢?
打开查询示例衡量每美元所接受的人工智能产出
哪种模型和功能组合可以产生最受接受的单位美元产出?
打开查询示例衡量人工智能智能体任务的成功和人工交接
哪些智能体工作流程成功完成并产生可接受的结果?
打开查询示例按版本评估 RAG 检索质量
新的 RAG 管道是否提高了检索率和接地答案率?
打开查询示例按实施系列浏览
比较相关集成模式
与此集成配对的模板
更多集成