活動合約
查詢期望的欄位
| 欄位 | 型別 | 為什麼存在 |
|---|---|---|
| timestamp_utc | Timestamp | 評估完成時間(UTC)。 |
| pipeline_version | Utf8 | 版本化檢索器、索引和提示設定。 |
| test_case_id | Utf8 | 穩定的評估案例識別符號。 |
| relevant_document_retrieved | Boolean | 審查檢索相關性結果。 |
| answer_grounded | Boolean | 審查了接地答案的結果。 |
| retrieval_latency_ms | Int64 | 檢索階段延遲(以毫秒為單位)。 |
| cost_usd | Float64 | 以美元為單位的版本估計評估成本。 |
| environment | Utf8 | 評估或生產環境。 |
DataFusion SQL
複製查詢
sql
SELECT
pipeline_version,
COUNT(*) AS test_cases,
100.0 * SUM(CASE WHEN relevant_document_retrieved THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS retrieval_relevance_pct,
100.0 * SUM(CASE WHEN answer_grounded THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS grounded_answer_pct,
AVG(retrieval_latency_ms) AS avg_retrieval_latency_ms,
SUM(cost_usd) AS evaluation_cost_usd
FROM rag_evaluation_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
AND environment = 'evaluation'
GROUP BY pipeline_version
ORDER BY grounded_answer_pct DESC, retrieval_relevance_pct DESC, pipeline_version;此只讀查詢是針對空型別資料表計劃和執行的 阿帕奇 DataFusion 45.2.0。確定性樣本輸出是綜合的並單獨審查;根據您自己的資料驗證欄位型別、閾值和業務定義。 閱讀測試方法。
查詢結果
RAG 檢索和接地結果
第二版提高了綜合評估集中的審查率,但成本稍高。
rag-v2
75%
75%
rag-v1
50%
50%
| pipeline_version | test_cases | retrieval_relevance_pct | grounded_answer_pct | avg_retrieval_latency_ms | evaluation_cost_usd |
|---|---|---|---|---|---|
| rag-v2 | 4 | 75 | 75 | 95 | 0.05 |
| rag-v1 | 4 | 50 | 50 | 120 | 0.04 |
綜合範例輸出。在將其用於操作決策之前,針對您自己的事件架構和閾值執行查詢。
SQL 是如何工作的
- 1管道版本應標識用於測試的檢索器、索引快照、重新排序器和答案提示。
- 2檢索相關性和答案基礎仍然是分開的,因為好的文件仍然可以產生不受支援的答案。
- 3延遲和成本使品質比較與生產限制相關聯。
需要決定的邊緣情況
- 跨管道使用相同版本的測試用例並報告新新增或刪除的用例。
- 人類和基於模型的評分者需要記錄的評分標準、校準和分歧審查。
- 預設情況下,不要在一般遙測中儲存私人源段落或原始答案。
推薦儀表板
- 堆疊條:按版本劃分的 retrieval_relevance_pct 和 grounded_answer_pct
- 趨勢:測試集變化時的評估結果
- 資料表:延遲、成本、測試計數和評分器版本
讓查詢範例發揮作用
相關埋點和指南
定義源資料
此分析的事件模式
繼續分析
在真實事件中執行它
建立資料表,調整欄位並儲存結果
免費開始,傳送結構化事件,並將查詢結果用作圖表、共享儀表板小工具或警示輸入。