本文へ移動
Telemetry
AIとLLM SQL レシピ

プロンプト バージョンごとに AI 品質の低下を見つける

評価された品質、受け入れ、引き継ぎ、コストをプロンプト バージョンごとに比較します。

中級者ai_quality_eventsレビュー済み 2026-07-28テスト済み アパッチ DataFusion 45.2.0

レビュー者 Telemetry 製品チーム . SQL の互換性、イベント コントラクト、合成出力、および操作上の注意事項. 基準と所有権を確認する

質問に回答しました

新しいプロンプト バージョンでは、人間による引き継ぎを増やすことなく品質が向上しましたか?

レイテンシとトークン コストでは、AI ワークフローが有用かどうかを判断できません。このパターンは、制限されたプロンプト バージョンをレビュー済みの品質結果と結合するため、ロールアウトを以前のバージョンと比較して評価できます。

イベント契約

クエリが期待するフィールド

フィールド種類なぜ存在するのか
timestamp_utcTimestampUTC での評価完了時間。
workflow_nameUtf8境界付き AI ワークフロー名。
prompt_versionUtf8プロンプトまたはポリシーのバージョンを確認しました。
model_nameUtf8境界付きモデル名。
quality_scoreFloat64文書化された評価者からの正規化されたスコア。
quality_passedBoolean実行がレビューされた品質しきい値を超えたかどうか。
accepted_without_editBooleanユーザーが編集せずに出力を受け入れたかどうか。
human_handoffBooleanワークフローが担当者にエスカレーションされたかどうか。
cost_usdFloat64実行のための正規化されたモデルコスト。
environmentUtf8導入環境。
DataFusion SQL

クエリをコピーする

sql
SELECT
  workflow_name,
  prompt_version,
  COUNT(*) AS evaluated_runs,
  100.0 * SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS quality_pass_rate_pct,
  100.0 * SUM(CASE WHEN accepted_without_edit THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS handoff_rate_pct,
  AVG(quality_score) AS average_quality_score,
  SUM(cost_usd) / NULLIF(
    SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END),
    0
  ) AS cost_per_quality_pass_usd
FROM ai_quality_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
  AND environment = 'production'
GROUP BY workflow_name, prompt_version
ORDER BY workflow_name, prompt_version;

この読み取り専用クエリは、空の型付きテーブルに対して計画され、実行されます。 アパッチ DataFusion 45.2.0。決定論的なサンプル出力は合成され、個別にレビューされます。フィールド タイプ、しきい値、ビジネス定義を独自のデータと照合して検証します。 テスト方法を読んでください。

クエリ結果

プロンプトバージョンごとの AI 品質

バージョン 4 では、ハンドオフが観察されず、品質の合格率と合格率が高くなります。

workflow_nameprompt_versionevaluated_runsquality_pass_rate_pctacceptance_rate_pcthandoff_rate_pctaverage_quality_scorecost_per_quality_pass_usd
support_replysupport-v356060400.690.03
support_replysupport-v45808000.830.03

合成出力例。運用上の決定に使用する前に、独自のイベント スキーマとしきい値に対してクエリを実行します。

AI quality by prompt version: Find AI Quality Regressions by Prompt Version 結果例からの合成 quality_pass_rate_pct 値の静的チャート
決定論的な出力例のインデックス可能な SVG。記事、ランブック、または出典を明示した設計レビューのためにダウンロードしてください。

例を再現する

パブリックフィクスチャをダウンロードする

JSON バンドルには、型付きイベント コントラクトが含まれています。 reproducible 入力行、正確な SQL、予想される出力、レビューメモ、およびエンジンのバージョン。 CSV には、表示された結果が含まれます。

SQL の仕組み

  1. 1プロンプト バージョンは明示的なイベント フィールドであり、ロールアウトの比較を再現可能にします。
  2. 2品質合格、製品の受け入れ、引き渡し率は、有用性のさまざまな側面を示しています。
  3. 3コストは、実際の実行ではなく、成功した品質の結果によって分割されるため、安価な失敗が効率的に見えるのを防ぎます。

決定すべきエッジケース

  • 比較したバージョン間でエバリュエーターの定義としきい値を安定させます。
  • オフライン評価者のスコアを実際のユーザーの受け入れ結果から分離し、どちらかをグラウンド トゥルースとして扱うのではなく。
  • プロンプト バージョンが大幅に異なるトラフィックを受信する場合は、タスクの難易度または顧客コホートごとにセグメント化します。

推奨されるダッシュボード

  • バー: prompt_version による品質と合格率
  • 傾向: ロールアウト アノテーションによるハンドオフ率
  • 表: 評価された実行と品質パスあたりのコスト

アラートガイダンス

新しいバージョンがレビューされた評価量に達した後にのみ、持続的な品質または受け入れの低下について警告します。

アラート設定を読む

レシピを活用する

関連する機器とガイド

分析を続ける

実際のイベントで実行する

テーブルを作成し、フィールドを調整して、結果を保存します

無料で始めて、構造化されたイベントを送信し、クエリ結果をグラフ、共有ダッシュボード ウィジェット、またはアラート入力として使用します。

API キーを取得する