活动合约
查询期望的字段
| 字段 | 类型 | 为什么存在 |
|---|---|---|
| timestamp_utc | Timestamp | 评估完成时间(UTC)。 |
| pipeline_version | Utf8 | 版本化检索器、索引和提示配置。 |
| test_case_id | Utf8 | 稳定的评估案例标识符。 |
| relevant_document_retrieved | Boolean | 审查检索相关性结果。 |
| answer_grounded | Boolean | 审查了接地答案的结果。 |
| retrieval_latency_ms | Int64 | 检索阶段延迟(以毫秒为单位)。 |
| cost_usd | Float64 | 以美元为单位的版本估计评估成本。 |
| environment | Utf8 | 评估或生产环境。 |
DataFusion SQL
复制查询
sql
SELECT
pipeline_version,
COUNT(*) AS test_cases,
100.0 * SUM(CASE WHEN relevant_document_retrieved THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS retrieval_relevance_pct,
100.0 * SUM(CASE WHEN answer_grounded THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS grounded_answer_pct,
AVG(retrieval_latency_ms) AS avg_retrieval_latency_ms,
SUM(cost_usd) AS evaluation_cost_usd
FROM rag_evaluation_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
AND environment = 'evaluation'
GROUP BY pipeline_version
ORDER BY grounded_answer_pct DESC, retrieval_relevance_pct DESC, pipeline_version;此只读查询是针对空类型表计划和执行的 阿帕奇 DataFusion 45.2.0。确定性样本输出是综合的并单独审查;根据您自己的数据验证字段类型、阈值和业务定义。 阅读测试方法。
查询结果
RAG 检索和接地结果
第二版提高了综合评估集中的审核率,但成本稍高。
rag-v2
75%
75%
rag-v1
50%
50%
| pipeline_version | test_cases | retrieval_relevance_pct | grounded_answer_pct | avg_retrieval_latency_ms | evaluation_cost_usd |
|---|---|---|---|---|---|
| rag-v2 | 4 | 75 | 75 | 95 | 0.05 |
| rag-v1 | 4 | 50 | 50 | 120 | 0.04 |
综合示例输出。在将其用于操作决策之前,针对您自己的事件架构和阈值运行查询。
SQL 是如何工作的
- 1管道版本应标识用于测试的检索器、索引快照、重新排序器和答案提示。
- 2检索相关性和答案基础仍然是分开的,因为好的文档仍然可以产生不受支持的答案。
- 3延迟和成本使质量比较与生产限制相关联。
需要决定的边缘情况
- 跨管道使用相同版本的测试用例并报告新添加或删除的用例。
- 人类和基于模型的评分者需要记录的评分标准、校准和分歧审查。
- 默认情况下,不要在一般遥测中存储私人源段落或原始答案。
推荐仪表板
- 堆叠条:按版本划分的 retrieval_relevance_pct 和 grounded_answer_pct
- 趋势:测试集变化时的评估结果
- 表:延迟、成本、测试计数和评分器版本
让查询示例发挥作用
相关埋点和指南
定义源数据
此分析的事件模式
继续分析
在真实事件中运行它
创建表,调整字段并保存结果
免费开始,发送结构化事件,并将查询结果用作图表、共享仪表板小部件或警报输入。