跳转到内容
Telemetry
集成指南

OpenAI 智能体Telemetry

使用结构化事件记录 OpenAI 智能体运行、工具调用、模型使用、延迟、成本和最终结果。

审阅者 Telemetry产品团队 . 我们检查了要发送的事件、要排除的数据和代码添加方法. 谁负责审核此页面

无需信用卡,样品运行会自动创建。对于可重用的编程智能体工作流程,请阅读 智能体遥测skill.md 指南.

准备好将模型使用与可接受的产品结果联系起来了吗?回顾 OpenAI 成本跟踪指南.

有用于
  • AI智能体可观测性
  • LLM成本跟踪
  • 工具调用调试
记录和检查什么

将详细的执行与持久的产品成果联系起来

在专家跟踪路径中保留步骤级跟踪,然后发出一个紧凑的终端事件,该事件可以将智能体质量、成本、可靠性和产品行为结合起来。

  1. 1

    智能体运行

    从批准的运行标识符、工作流程、模型和提示版本开始。

  2. 2

    工具和重试

    保留跟踪和分类故障的详细步骤,而无需复制有效负载。

  3. 3

    最终结果

    发出成功、失败、取消或人工切换以及成本和持续时间。

  4. 4

    SQL决策

    按功能和版本比较可接受的结果、失败和单位经济效益。

开始之前

开始之前

  • 在服务器运行时初始化的 OpenAI Agents SDK 和 telemetry-sh 包
  • 记录的工作流程名称和终端成功、失败和切换结果
  • 决定必须排除哪些提示、工具输入和输出内容

交货设置

安装并初始化服务器端

在仅服务器代码中导入 telemetry-sh 并使用 process.env.TELEMETRY_API_KEY 对其进行一次初始化。 将摄取凭据保留在浏览器包、客户端可见的环境变量、源代码控制、日志和异常消息之外。

openai-agents-安装

npm安装

bash
npm install telemetry-sh
  1. 1准备一个具有有限网络行为的可重用服务器端交付客户端。
  2. 2在成功、失败、重试或超时边界处添加结果事件。
  3. 3在启用警报之前发送受控装置并检查存储的行。

片段

从一个结构化事件开始

在工作流程完成、失败或重试的位置添加此形状。然后从真实的字段构建仪表板。

openai-agents

OpenAI agent telemetry事件

javascript
await telemetry.log("agent_tool_called", {
  run_id: runId,
  workflow: "support_resolution",
  agent_name: "support_agent",
  model: "gpt-4.1",
  tool_name: "lookup_order",
  status: "success",
  latency_ms: 842,
  retry_count: 0,
  estimated_cost_usd: 0.018,
  prompt_version: "support-v3",
  release: process.env.APP_RELEASE,
});

事件结构

run_id、工作流程、agent_name、模型和 prompt_version

状态、duration_ms、retry_count、total_tokens 和 estimated_cost_usd

tool_name、tool_status、human_handoff、reviewer_outcome 和释放

检查配置

检查站 1

当整个运行结束时,发出一个紧凑的产品结果;保留 SDK 跟踪以进行步骤级调试,而不是将每个跨度复制到第二个系统中。

检查站 2

使用共享的 run_id 或批准的 trace_id 连接单独的工具事件,而不存储工具参数或结果。

检查站 3

在依赖完成率仪表板之前,先练习工具故障、护栏拒绝、移交、取消和导出器刷新行为。

验证

证明事件已到达

在演练已知的成功和失败案例后运行此命令。如果您的最终事件契约与代码片段不同,请替换后备表名称。

openai-agents-验证

OpenAI agent telemetry 验证查询

sql
SELECT *
FROM agent_tool_called
ORDER BY timestamp_utc DESC
LIMIT 20;
确认每个逻辑结果的一个终端行,以及预期状态、标识符、单位和 UTC 时间。
检查推断的架构并验证重试不会更改字段类型或生成新的逻辑事件 ID。
在存储的字段中搜索凭据、原始有效负载、提示、私有内容和无限制的错误消息。
在将仪表板视为完整之前,请执行提供程序超时、摄取拒绝和进程关闭。

实施参考

在启用新的生产路径之前,请检查事件合同、数据安全指南和上游主要文档。

在哪里记录事件

保持结果事件小且可恢复

该模式提供了

  • 除了上游工作流程之外,还有一个有界的、SQL 就绪的结果。
  • 用于仪表板、警报和跨事件关联的稳定字段。
  • 用于验证成功、失败、重试和超时行为的夹具驱动路径。

该模式不提供

  • OTLP 导出器、自动收集管道或详细跟踪和诊断日志的替代品。
  • 仅因为有效负载包含事件 ID,所以仅传送一次。
  • 收集原始提供商有效负载、用户内容、凭证或受监管数据的权限。

事件模式示例

在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。

相关产品功能

继续此工作流程 AI代理监控

通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。

相关 SQL 查询示例

更多 SQL 示例

针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。

浏览所有查询示例
安全和审计入门

审核AI智能体工具授权决策

哪些智能体工具最常被拒绝或转而寻求人工批准?

打开查询示例
人工智能和法学硕士中级

按提示版本查找 AI 质量回归

新的提示版本是否在不增加人工交接的情况下提高了质量?

打开查询示例
结构化事件高级

重建相关的工作流程时间线

在最近一次失败的工作流程中,按顺序发生了什么?

打开查询示例
结构化事件中级

查询嵌套 AI 工具调用事件

哪些人工智能工具和参数与失败次数最多的调用相关?

打开查询示例
人工智能和法学硕士中级

检测重复的 AI 智能体工具循环

哪些智能体运行似乎陷入了重复的工具循环?

打开查询示例
人工智能和法学硕士入门

按功能和模型计算 LLM 成本

哪些产品功能和型号正在推动法学硕士支出?

打开查询示例
人工智能和法学硕士中级

衡量 LLM 缓存节省和重试成本

有多少模型成本与重试和缓存未命中相关?

打开查询示例
人工智能和法学硕士中级

测量 LLM 获得第一个令牌的时间

在输出开始之前,哪些模型和功能组合感觉很慢?

打开查询示例
人工智能和法学硕士中级

衡量每美元所接受的人工智能产出

哪种模型和功能组合可以产生最受接受的单位美元产出?

打开查询示例
人工智能和法学硕士中级

衡量人工智能智能体任务的成功和人工交接

哪些智能体工作流程成功完成并产生可接受的结果?

打开查询示例
人工智能和法学硕士中级

按版本评估 RAG 检索质量

新的 RAG 管道是否提高了检索率和接地答案率?

打开查询示例

按实施系列浏览

比较相关集成模式

与此集成配对的模板

更多集成