跳转到内容
Telemetry
SQL查询示例集合

人工智能和法学硕士 SQL 查询示例

连接人工智能产品工作流程的令牌使用、模型成本、缓存行为、延迟、工具可靠性、审核的任务质量和人工切换。

共同事件契约

使这些查询可重用的字段

  • timestamp_utc、run_id、功能、提供商、型号和状态
  • input_tokens、output_tokens、estimated_cost_usd 和 latency_ms
  • tool_name、retry_count、cache_hit、reviewer_outcome 和 human_handoff

SQL 之前的定义

查询无法为您做出的决定

  1. 1尽可能将模型定价版本保持在事件生产者之外。
  2. 2默认情况下,将请求与产品结果连接起来,而不存储原始提示。
  3. 3将提供程序重试与故意的用户重新生成分开。

推荐顺序

先建立检测,然后诊断

分析模式

让结果解释决定

测量有用输出

将令牌、延迟和提供商成本与已接受或已完成的产品结果联系起来,而不是单独优化请求量。

保留执行路径

保持运行、模型、工具、缓存和重试字段,以便昂贵或不可靠的分支保持可见。

版本变更假设

记录模型和定价版本,以便可以重现历史成本和质量比较。

完整的查询示例

复制查询,然后验证假设

入门llm_request_completed

按功能和模型计算 LLM 成本

将模型支出、代币、请求量和每个请求的成本归因于产品功能。

哪些产品功能和型号正在推动法学硕士支出?

查看 SQL 和结果
中级llm_requests

衡量每美元所接受的人工智能产出

将模型支出与已接受、已保存或其他有用的产品结果联系起来。

哪种模型和功能组合可以产生最受接受的单位美元产出?

查看 SQL 和结果
中级llm_requests

衡量 LLM 缓存节省和重试成本

按模型比较缓存的请求、重试量和估计支出,以找到可避免的 AI 成本。

有多少模型成本与重试和缓存未命中相关?

查看 SQL 和结果
中级llm_requests

测量 LLM 获得第一个令牌的时间

按模型和功能比较流响应能力和总生成延迟。

在输出开始之前,哪些模型和功能组合感觉很慢?

查看 SQL 和结果
中级agent_tool_calls

检测重复的 AI 智能体工具循环

查找智能体运行重复调用一小组工具但未取得成功结果的情况。

哪些智能体运行似乎陷入了重复的工具循环?

查看 SQL 和结果
中级agent_run_outcomes

衡量人工智能智能体任务的成功和人工交接

按工作流程和模型比较智能体任务成功率、审阅者接受度、成本、延迟和人工切换率。

哪些智能体工作流程成功完成并产生可接受的结果?

查看 SQL 和结果
中级ai_quality_events

按提示版本查找 AI 质量回归

按提示版本比较评估的质量、验收、移交和成本。

新的提示版本是否在不增加人工交接的情况下提高了质量?

查看 SQL 和结果
中级rag_evaluation_events

按版本评估 RAG 检索质量

比较跨 RAG 管道版本的相关文档检索、接地答案、检索延迟和评估成本。

新的 RAG 管道是否提高了检索率和接地答案率?

查看 SQL 和结果

在阈值之前调整事件契约

保留分析模式,但根据您自己的事件验证表名称、字段类型、业务定义、时间窗口和最小量规则。每个已发布的查询也会针对具有固定引擎的空类型表进行规划和执行。