使用 Vercel AI SDK telemetry 发送并验证事件
在受控应用程序边界使用 Vercel AI SDK telemetry,保持事件契约较小,并在构建聚合视图之前验证已知结果。
- 1
选择结果
流媒体 LLM 分析
- 2
定义合同
功能、提供商、型号、prompt_version 和 finish_reason
- 3
在结果处发出
流完成后记录终端生成结果,以便令牌使用和完成原因完整。
- 4
核实证据
Exercise a known fixture, then inspect llm_request_completed for one correctly typed terminal row.
开始之前
开始之前
- AI SDK 生成或在可信服务器边界上运行的流式调用
- 用于比较各代的稳定功能和提示版本分类法
- 遥测元数据的白名单,不包括提示、响应、标头和工具负载
交货设置
安装并初始化服务器端
在仅服务器代码中导入 telemetry-sh 并使用 process.env.TELEMETRY_API_KEY 对其进行一次初始化。 将摄取凭据保留在浏览器包、客户端可见的环境变量、源代码控制、日志和异常消息之外。
npm安装
npm install telemetry-sh- 1准备一个具有有限网络行为的可重用服务器端交付客户端。
- 2在成功、失败、重试或超时边界处添加结果事件。
- 3在启用警报之前发送受控装置并检查存储的行。
片段
从一个结构化事件开始
在工作流程完成、失败或重试的位置添加此形状。然后从真实的字段构建仪表板。
Vercel AI SDK telemetry事件
await telemetry.log("llm_request_completed", {
provider: "openai",
model: "gpt-4.1-mini",
feature: "draft_reply",
prompt_version: "draft-reply-v4",
input_tokens: 924,
output_tokens: 218,
latency_ms: 1380,
finish_reason: "stop",
status: "success",
accepted: true,
});事件结构
功能、提供商、型号、prompt_version 和 finish_reason
input_tokens、output_tokens、total_tokens、estimated_cost_usd 和 latency_ms
状态、retry_count、time_to_first_token_ms、已接受、已发布
检查配置
检查站 1
流完成后记录终端生成结果,以便令牌使用和完成原因完整。
检查站 2
使用 AI SDK 生命周期回调或遥测集成来实现一致的覆盖范围,而不是在每个调用周围重复临时日志记录。
检查站 3
在升级期间检查 SDK 的实验性遥测行为,并明确排除提示、响应、请求标头和工具参数属性。
验证
证明事件已到达
在演练已知的成功和失败案例后运行此命令。如果您的最终事件契约与代码片段不同,请替换后备表名称。
Vercel AI SDK telemetry 验证查询
SELECT *
FROM llm_request_completed
ORDER BY timestamp_utc DESC
LIMIT 20;实施参考
在启用新的生产路径之前,请检查事件合同、数据安全指南和上游主要文档。
在哪里记录事件
保持结果事件小且可恢复
该模式提供了
- 除了上游工作流程之外,还有一个有界的、SQL 就绪的结果。
- 用于仪表板、警报和跨事件关联的稳定字段。
- 用于验证成功、失败、重试和超时行为的夹具驱动路径。
该模式不提供
- OTLP 导出器、自动收集管道或详细跟踪和诊断日志的替代品。
- 仅因为有效负载包含事件 ID,所以仅传送一次。
- 收集原始提供商有效负载、用户内容、凭证或受监管数据的权限。
事件模式示例
此工作流的事件模式
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 AI代理监控
通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。
相关 SQL 查询示例
更多 SQL 示例
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
按提示版本查找 AI 质量回归
新的提示版本是否在不增加人工交接的情况下提高了质量?
打开查询示例按功能和模型计算 LLM 成本
哪些产品功能和型号正在推动法学硕士支出?
打开查询示例衡量 LLM 缓存节省和重试成本
有多少模型成本与重试和缓存未命中相关?
打开查询示例测量 LLM 获得第一个令牌的时间
在输出开始之前,哪些模型和功能组合感觉很慢?
打开查询示例衡量每美元所接受的人工智能产出
哪种模型和功能组合可以产生最受接受的单位美元产出?
打开查询示例按版本评估 RAG 检索质量
新的 RAG 管道是否提高了检索率和接地答案率?
打开查询示例按实施系列浏览
比较相关集成模式
与此集成配对的模板
更多集成