AI agent observability template:实施到决策
将提示视为实施概要。有用的工件不仅仅是复制的代码,而是经过审查的事件契约,可以产生值得信赖的答案。
- 1
设定边界
Instrument the point where agent_run_started becomes final.
- 2
创建合同
Start with agent_run_started, agent_tool_called, agent_run_completed and keep every field typed, bounded, and privacy-reviewed.
- 3
运行夹具
在依赖汇总结果之前,先练习已知的成功、失败、重试和空结果案例。
- 4
回答问题
哪些工具最常失败?
模板与用例
使用此模板添加事件
当测量目标已经明确时,复制此模板。使用匹配的用例指南来查看事件边界、成功定义以及生成的 SQL 应支持的决策。
模板
将其粘贴到您的编码代理中
更换 YOUR_API_KEY,在本地运行流程,然后验证生成的事件和仪表板。
AI智能体可观测性模板
将 Telemetry 添加到此 AI 代理工作流程。
使用 /skill.md 和此 Telemetry API 密钥:YOUR_API_KEY
日志:
1. agent_run_started 与 agent_name、route、user_id、team_id、model、provider 和 input_category。
2. agent_tool_called 与 tool_name、status、latency_ms、retry_count 和 error_type。
3. agent_run_completed 以及 status、duration_ms、total_tokens、estimated_cost_usd、output_category 和 accepted(如果有)。
4. agent_run_failed 与 error_type、failed_step、retry_count 和 duration_ms。
针对运行量、按工具列出的故障率、p95 持续时间、按功能列出的模型成本以及可接受的输出率创建 SQL 查询。
除非明确批准,否则请勿记录原始提示、完成、秘密、身份验证标头或个人数据。要捕获的事件
验证清单
完整的埋点通行证留下了什么
活动
综合事件以稳定的名称和字段类型到达预期的表。
查询
第一个 SQL 查询返回具有明确时间窗口的合理行。
意见
仪表板使用真实字段并包含足够的上下文来解释更改。
安全
检查提示、正文、凭据、签名和私人内容是否经过编辑。
事件模式示例
此工作流的事件模式
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 AI代理监控
通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。
相关 SQL 查询示例
更多 SQL 示例
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
重建相关的工作流程时间线
在最近一次失败的工作流程中,按顺序发生了什么?
打开查询示例按提示版本查找 AI 质量回归
新的提示版本是否在不增加人工交接的情况下提高了质量?
打开查询示例查询嵌套 AI 工具调用事件
哪些人工智能工具和参数与失败次数最多的调用相关?
打开查询示例检测重复的 AI 智能体工具循环
哪些智能体运行似乎陷入了重复的工具循环?
打开查询示例按功能和模型计算 LLM 成本
哪些产品功能和型号正在推动法学硕士支出?
打开查询示例衡量每美元所接受的人工智能产出
哪种模型和功能组合可以产生最受接受的单位美元产出?
打开查询示例按版本评估 RAG 检索质量
新的 RAG 管道是否提高了检索率和接地答案率?
打开查询示例更多模板