共同事件契约
使这些查询可重用的字段
- timestamp_utc、run_id、功能、提供商、型号和状态
- input_tokens、output_tokens、estimated_cost_usd 和 latency_ms
- tool_name、retry_count、cache_hit、reviewer_outcome 和 human_handoff
SQL 之前的定义
查询无法为您做出的决定
- 1尽可能将模型定价版本保持在事件生产者之外。
- 2默认情况下,将请求与产品结果连接起来,而不存储原始提示。
- 3将提供程序重试与故意的用户重新生成分开。
推荐顺序
先建立检测,然后诊断
分析模式
让结果解释决定
测量有用输出
将令牌、延迟和提供商成本与已接受或已完成的产品结果联系起来,而不是单独优化请求量。
保留执行路径
保持运行、模型、工具、缓存和重试字段,以便昂贵或不可靠的分支保持可见。
版本变更假设
记录模型和定价版本,以便可以重现历史成本和质量比较。
完整的查询示例
复制查询,然后验证假设
入门llm_request_completed
按功能和模型计算 LLM 成本
将模型支出、代币、请求量和每个请求的成本归因于产品功能。
哪些产品功能和型号正在推动法学硕士支出?
查看 SQL 和结果中级llm_requests
衡量每美元所接受的人工智能产出
将模型支出与已接受、已保存或其他有用的产品结果联系起来。
哪种模型和功能组合可以产生最受接受的单位美元产出?
查看 SQL 和结果中级llm_requests
衡量 LLM 缓存节省和重试成本
按模型比较缓存的请求、重试量和估计支出,以找到可避免的 AI 成本。
有多少模型成本与重试和缓存未命中相关?
查看 SQL 和结果中级llm_requests
测量 LLM 获得第一个令牌的时间
按模型和功能比较流响应能力和总生成延迟。
在输出开始之前,哪些模型和功能组合感觉很慢?
查看 SQL 和结果中级agent_tool_calls
检测重复的 AI 智能体工具循环
查找智能体运行重复调用一小组工具但未取得成功结果的情况。
哪些智能体运行似乎陷入了重复的工具循环?
查看 SQL 和结果中级agent_run_outcomes
衡量人工智能智能体任务的成功和人工交接
按工作流程和模型比较智能体任务成功率、审阅者接受度、成本、延迟和人工切换率。
哪些智能体工作流程成功完成并产生可接受的结果?
查看 SQL 和结果中级ai_quality_events
按提示版本查找 AI 质量回归
按提示版本比较评估的质量、验收、移交和成本。
新的提示版本是否在不增加人工交接的情况下提高了质量?
查看 SQL 和结果中级rag_evaluation_events
按版本评估 RAG 检索质量
比较跨 RAG 管道版本的相关文档检索、接地答案、检索延迟和评估成本。
新的 RAG 管道是否提高了检索率和接地答案率?
查看 SQL 和结果