コモンイベント契約書
これらのクエリを再利用可能に保つフィールド
- timestamp_utc、run_id、機能、プロバイダー、モデル、ステータス
- input_tokens、output_tokens、estimated_cost_usd、および latency_ms
- tool_name、retry_count、cache_hit、reviewer_outcome、および human_handoff
SQL より前の定義
クエリでは決定できないこと
- 1可能な場合は、モデルの価格設定をイベント プロデューサーの外部でバージョン管理してください。
- 2デフォルトでは生のプロンプトを保存せずに、リクエストを製品の結果に接続します。
- 3プロバイダーの再試行とユーザーの意図的な再生成を分離します。
推奨される順序
最初にビルド検出、次に診断
分析パターン
結果で決定を説明する
有用な成果を測定する
リクエスト量だけを最適化するのではなく、トークン、レイテンシー、プロバイダーのコストを製品の承認または完了に結びつけます。
実行パスを保存する
実行、モデル、ツール、キャッシュ、および再試行フィールドを維持することで、高価なブランチや信頼性の低いブランチが表示されたままになります。
バージョン変更の前提条件
モデルと価格のバージョンを記録して、過去のコストと品質の比較を再現できるようにします。
完全なレシピ
クエリをコピーし、仮定を検証します
機能とモデルごとに LLM コストを計算する
モデルの支出、トークン、リクエスト量、リクエストあたりのコストを製品機能に関連付けます。
LLM の支出を促進しているのはどの製品機能とモデルですか?
SQL と結果を参照してください。1 ドルあたりの受け入れられた AI 出力を測定する
モデルの支出を、受け入れられた、保存された、またはその他の有用な製品の成果に結び付けます。
どのモデルと機能の組み合わせが、1 ドルあたり最も受け入れられる出力を生成しますか?
SQL と結果を参照してください。LLM キャッシュの節約と再試行コストを測定する
キャッシュされたリクエスト、再試行量、推定費用をモデルごとに比較して、回避可能な AI コストを見つけます。
再試行とキャッシュミスに関連するモデルコストはどれくらいですか?
SQL と結果を参照してください。最初のトークンまでの LLM 時間を測定する
ストリーミングの応答性と総生成遅延をモデルと機能ごとに比較します。
出力が開始される前に速度が遅いと感じるモデルと機能の組み合わせはどれですか?
SQL と結果を参照してください。繰り返しを検出する AI エージェント ツール Loops
成功した結果に達することなく、小規模なツール セットを繰り返し呼び出すエージェントの実行を見つけます。
どのエージェントの実行が繰り返しのツール ループに陥っているように見えますか?
SQL と結果を参照してください。AI エージェントのタスクの成功と人間による引き継ぎを測定する
エージェントのタスクの成功、レビュー担当者の承認、コスト、待ち時間、人による引き継ぎ率をワークフローとモデルごとに比較します。
どのエージェントのワークフローが正常に終了し、受け入れられた結果をもたらしますか?
SQL と結果を参照してください。プロンプト バージョンごとに AI 品質の低下を見つける
評価された品質、受け入れ、引き継ぎ、コストをプロンプト バージョンごとに比較します。
新しいプロンプト バージョンでは、人間による引き継ぎを増やすことなく品質が向上しましたか?
SQL と結果を参照してください。バージョンごとの RAG 取得品質の評価
RAG パイプラインのバージョン全体で、関連ドキュメントの取得、根拠のある回答、取得レイテンシ、評価コストを比較します。
新しい RAG パイプラインにより、検索率と根拠のある回答率は向上しましたか?
SQL と結果を参照してください。しきい値の前にイベント コントラクトを適応させる
分析パターンを維持しますが、テーブル名、フィールド タイプ、ビジネス定義、時間枠、および最小ボリューム ルールを独自のイベントに対して検証します。パブリッシュされたすべてのクエリも計画され、ピン留めされたエンジンを使用して空の型付きテーブルに対して実行されます。