本文へ移動
Telemetry
AIとLLM SQL レシピ

バージョンごとの RAG 取得品質の評価

RAG パイプラインのバージョン全体で、関連ドキュメントの取得、根拠のある回答、取得レイテンシ、評価コストを比較します。

中級者rag_evaluation_eventsレビュー済み 2026-07-28テスト済み アパッチ DataFusion 45.2.0

レビュー者 Telemetry 製品チーム . SQL の互換性、イベント コントラクト、合成出力、および操作上の注意事項. 基準と所有権を確認する

質問に回答しました

新しい RAG パイプラインにより、検索率と根拠のある回答率は向上しましたか?

RAGの品質は1点ではありません。このクエリは、バージョン化されたテスト セットの検索の関連性、回答の根拠、待ち時間、および評価コストをまとめて保持するため、運用上のトレードオフに対して明らかな品質の向上を確認できます。

イベント契約

クエリが期待するフィールド

フィールド種類なぜ存在するのか
timestamp_utcTimestampUTC での評価完了時間。
pipeline_versionUtf8バージョン管理された取得者、インデックス、およびプロンプトの構成。
test_case_idUtf8安定した評価ケースの識別子。
relevant_document_retrievedBoolean検索関連性の結果をレビューしました。
answer_groundedBoolean根拠のある回答結果をレビューしました。
retrieval_latency_msInt64取得段階の遅延 (ミリ秒単位)。
cost_usdFloat64バージョン化された推定評価コスト (USD)。
environmentUtf8評価環境または実稼働環境。
DataFusion SQL

クエリをコピーする

sql
SELECT
  pipeline_version,
  COUNT(*) AS test_cases,
  100.0 * SUM(CASE WHEN relevant_document_retrieved THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS retrieval_relevance_pct,
  100.0 * SUM(CASE WHEN answer_grounded THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS grounded_answer_pct,
  AVG(retrieval_latency_ms) AS avg_retrieval_latency_ms,
  SUM(cost_usd) AS evaluation_cost_usd
FROM rag_evaluation_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
  AND environment = 'evaluation'
GROUP BY pipeline_version
ORDER BY grounded_answer_pct DESC, retrieval_relevance_pct DESC, pipeline_version;

この読み取り専用クエリは、空の型付きテーブルに対して計画され、実行されます。 アパッチ DataFusion 45.2.0。決定論的なサンプル出力は合成され、個別にレビューされます。フィールド タイプ、しきい値、ビジネス定義を独自のデータと照合して検証します。 テスト方法を読んでください。

クエリ結果

RAG の回収とグラウンディングの結果

バージョン 2 では、合成評価セットの両方のレビュー率が向上しますが、コストは若干高くなります。

pipeline_versiontest_casesretrieval_relevance_pctgrounded_answer_pctavg_retrieval_latency_msevaluation_cost_usd
rag-v247575950.05
rag-v1450501200.04

合成出力例。運用上の決定に使用する前に、独自のイベント スキーマとしきい値に対してクエリを実行します。

RAG retrieval and grounding outcomes: Evaluate RAG Retrieval Quality by Version 結果例からの合成 retrieval_relevance_pct 値の静的チャート
決定論的な出力例のインデックス可能な SVG。記事、ランブック、または出典を明示した設計レビューのためにダウンロードしてください。

例を再現する

パブリックフィクスチャをダウンロードする

JSON バンドルには、型付きイベント コントラクトが含まれています。 reproducible 入力行、正確な SQL、予想される出力、レビューメモ、およびエンジンのバージョン。 CSV には、表示された結果が含まれます。

SQL の仕組み

  1. 1パイプライン バージョンでは、テストに使用される取得者、インデックス スナップショット、リランカー、および回答プロンプトを識別する必要があります。
  2. 2適切な文書であってもサポートされていない回答が生成される可能性があるため、検索の関連性と回答の根拠は分離されたままになります。
  3. 3レイテンシとコストにより、品質の比較が生産上の制約に結びつきます。

決定すべきエッジケース

  • パイプライン間で同じバージョン管理されたテスト ケースを使用し、新しく追加または削除されたケースをレポートします。
  • 人間およびモデルベースの採点者には、文書化されたルーブリック、校正、および意見の相違のレビューが必要です。
  • デフォルトでは、プライベートなソースの一節や生の回答を一般テレメトリに保存しないでください。

推奨されるダッシュボード

  • 積み上げバー: バージョン別の retrieval_relevance_pct および grounded_answer_pct
  • 傾向: テストセットの変化に伴う評価結果
  • 表: レイテンシー、コスト、テスト数、採点者のバージョン

アラートガイダンス

本番環境のページング アラートではなく、最小限のテスト数とレビューされた回帰許容値を備えた評価リリース ゲートを使用します。

アラート設定を読む

レシピを活用する

関連する機器とガイド

ソースデータを定義する

この分析のイベント スキーマ

分析を続ける

実際のイベントで実行する

テーブルを作成し、フィールドを調整して、結果を保存します

無料で始めて、構造化されたイベントを送信し、クエリ結果をグラフ、共有ダッシュボード ウィジェット、またはアラート入力として使用します。

API キーを取得する