活动合约
查询期望的字段
| 字段 | 类型 | 为什么存在 |
|---|---|---|
| timestamp_utc | Timestamp | 模型请求完成时间。 |
| model | Utf8 | 型号标识符。 |
| cache_outcome | Utf8 | 命中、未命中或不可用。 |
| attempt | Int64 | 基于一的尝试次数。 |
| estimated_cost_usd | Float64 | 估计请求成本。 |
DataFusion SQL
复制查询
sql
SELECT
model,
COUNT(*) AS requests,
SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END) AS cache_hits,
SUM(CASE WHEN attempt > 1 THEN 1 ELSE 0 END) AS retries,
100.0 * SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS cache_hit_rate_pct,
SUM(CASE WHEN attempt > 1 THEN estimated_cost_usd ELSE 0 END) AS retry_cost_usd,
SUM(estimated_cost_usd) AS total_cost_usd
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY model
ORDER BY retry_cost_usd DESC;此只读查询是针对空类型表计划和执行的 阿帕奇 DataFusion 45.2.0。确定性样本输出是综合的并单独审查;根据您自己的数据验证字段类型、阈值和业务定义。 阅读测试方法。
查询结果
总模型成本内的重试成本
较大的模型具有较低的缓存命中率和较大的重试成本负担。
gpt-5.1
92.4 USD
1,480.2 USD
gpt-5.1-mini
11.8 USD
604.6 USD
| model | requests | cache_hits | retries | cache_hit_rate_pct | retry_cost_usd | total_cost_usd |
|---|---|---|---|---|---|---|
| gpt-5.1 | 18,400 | 6,620 | 740 | 35.98 | 92.4 | 1,480.2 |
| gpt-5.1-mini | 49,200 | 23,810 | 380 | 48.39 | 11.8 | 604.6 |
综合示例输出。在将其用于操作决策之前,针对您自己的事件架构和阈值运行查询。
SQL 是如何工作的
- 1缓存命中率计算所有记录请求中的显式缓存命中数。
- 2大于一次的尝试将重复的模型工作与第一次尝试的成本隔离开来。
- 3结果解释了成本机制;在纯粹针对支出进行优化之前,将其与已接受或保留的结果联系起来。
需要决定的边缘情况
- 提供者端提示缓存和应用程序响应缓存是不同的机制。
- 当一个逻辑请求同时发出尝试事件和摘要事件时,避免重复计算成本。
- 成本估算必须使用请求运行时处于活动状态的价格和令牌规则。
推荐仪表板
- 堆叠条:按模型划分的重试和总成本
- 趋势:缓存命中率
- 表:具有昂贵重试循环的功能
让查询示例发挥作用
相关埋点和指南
继续分析
在真实事件中运行它
创建表,调整字段并保存结果
免费开始,发送结构化事件,并将查询结果用作图表、共享仪表板小部件或警报输入。