跳转到内容
Telemetry
人工智能和法学硕士 SQL查询示例

衡量 LLM 缓存节省和重试成本

按模型比较缓存的请求、重试量和估计支出,以找到可避免的 AI 成本。

中级llm_requests已审核 2026-07-27测试用 阿帕奇 DataFusion 45.2.0

审阅者 Telemetry产品团队 . SQL 兼容性、事件契约、合成输出和操作注意事项. 审查标准和所有权

问题已回答

有多少模型成本与重试和缓存未命中相关?

模型总支出掩盖了其变化的原因。缓存结果和尝试使可避免的重复工作可见,而无需存储提示或完成情况。

活动合约

查询期望的字段

字段类型为什么存在
timestamp_utcTimestamp模型请求完成时间。
modelUtf8型号标识符。
cache_outcomeUtf8命中、未命中或不可用。
attemptInt64基于一的尝试次数。
estimated_cost_usdFloat64估计请求成本。
DataFusion SQL

复制查询

sql
SELECT
  model,
  COUNT(*) AS requests,
  SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END) AS cache_hits,
  SUM(CASE WHEN attempt > 1 THEN 1 ELSE 0 END) AS retries,
  100.0 * SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS cache_hit_rate_pct,
  SUM(CASE WHEN attempt > 1 THEN estimated_cost_usd ELSE 0 END) AS retry_cost_usd,
  SUM(estimated_cost_usd) AS total_cost_usd
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY model
ORDER BY retry_cost_usd DESC;

此只读查询是针对空类型表计划和执行的 阿帕奇 DataFusion 45.2.0。确定性样本输出是综合的并单独审查;根据您自己的数据验证字段类型、阈值和业务定义。 阅读测试方法。

查询结果

总模型成本内的重试成本

较大的模型具有较低的缓存命中率和较大的重试成本负担。

modelrequestscache_hitsretriescache_hit_rate_pctretry_cost_usdtotal_cost_usd
gpt-5.118,4006,62074035.9892.41,480.2
gpt-5.1-mini49,20023,81038048.3911.8604.6

综合示例输出。在将其用于操作决策之前,针对您自己的事件架构和阈值运行查询。

Retry cost within total model cost:来自 Measure LLM Cache Savings and Retry Cost 示例结果的合成 retry_cost_usd 值的静态图表
确定性示例输出的可索引 SVG。下载它以获取带有归属的文章、操作手册或设计评论。

重现示例

下载公共装置

JSON 包包含类型化事件契约, illustrative 输入行、确切的 SQL、预期输出、审阅注释和引擎版本。 CSV 包含显示的结果。

SQL 是如何工作的

  1. 1缓存命中率计算所有记录请求中的显式缓存命中数。
  2. 2大于一次的尝试将重复的模型工作与第一次尝试的成本隔离开来。
  3. 3结果解释了成本机制;在纯粹针对支出进行优化之前,将其与已接受或保留的结果联系起来。

需要决定的边缘情况

  • 提供者端提示缓存和应用程序响应缓存是不同的机制。
  • 当一个逻辑请求同时发出尝试事件和摘要事件时,避免重复计算成本。
  • 成本估算必须使用请求运行时处于活动状态的价格和令牌规则。

推荐仪表板

  • 堆叠条:按模型划分的重试和总成本
  • 趋势:缓存命中率
  • 表:具有昂贵重试循环的功能

警报指导

针对重试成本峰值或在最小请求量后突然缓存命中崩溃发出警报。

读取警报设置

让查询示例发挥作用

相关埋点和指南

继续分析

在真实事件中运行它

创建表,调整字段并保存结果

免费开始,发送结构化事件,并将查询结果用作图表、共享仪表板小部件或警报输入。

获取 API 密钥