1 つのエージェントの実行からリリースの決定までの移行
有用な品質ループにより、バージョン管理された運用コンテキストが保存され、自動化されたスコアがレビュー結果から分離され、評価されたカバレッジが常に可視化されます。
- 1
バージョン管理された実行
ワークフロー、モデル、プロンプト、ツール、リリース、コスト、ターミナルのステータスを記録します。
- 2
レビューされた結果
ルーブリックのバージョン、評価者のタイプ、スコア、承認または引き継ぎの結果を添付します。
- 3
SQLの比較
同じ対象集団間で品質、カバレッジ、障害、レイテンシ、コストを比較します。
- 4
発売決定
昇格またはロールバックする前に、失敗した例と製品への影響を検査します。
ユースケースとテンプレートの比較
このページでは、何を測定するのか、なぜ測定するのかについて説明します。
ユースケース ガイドを使用して、結果、イベントの境界、分析の質問を選択します。短いコピーアンドペースト実装の概要の準備ができたら、一致するテンプレートを開きます。
エージェントプロンプト
これをコーディングエージェントに貼り付けます
交換する YOUR_API_KEY サインアップ後、エージェントに製品フローを実行して最初のイベントを確認するように依頼します。
AI Agent Quality and Evaluation セットアップ プロンプト
Telemetry を使用して AI エージェントの品質と評価を計測します。
/skill.md とこの Telemetry API キーを使用します: YOUR_API_KEY
ターミナル エージェントの結果を run_id、ワークフロー、model、prompt_version、リリース、status、reviewer_outcome、human_handoff、duration_ms、input_tokens、output_tokens、で記録します。 estimated_cost_usd、retry_count、および制御対象の error_type。共有 run_id を使用してツールの結果を個別に記録します。
技術的な成功、レビューされた承認、改訂と拒否、人による引き継ぎ、承認された結果ごとのコスト、リリースごとの品質に関するダッシュボードを作成します。未レビューの実行をレビュー済みの受け入れ分母から除外します。
データ所有者が目的と保持を明示的に承認していない限り、生のプロンプト、完了、ツールのペイロード、秘密、または個人データをログに記録しないでください。セットアップ手順
- 1タスクレベルの成功ルーブリックと管理されたレビュー担当者の結果を定義します。
- 2エージェントの実行ごとに 1 つのターミナル結果と、ツールおよびハンドオフ イベントをログに記録します。
- 3成熟したレビュー済みコホートをワークフロー、モデル、プロンプト、リリースごとにセグメント化します。
- 4自動化を変更する前に、テレメトリ以外の例で回帰を確認してください。
キャプチャするイベント
質問のロックが解除されました
- 技術的には完了したが、人間によるレビューに失敗したワークフローはどれですか?
- リリース後に人間による引き継ぎが増加しているのはどこですか?
- 持続可能なコストで受け入れられる結果を生み出すモデルはどれですか?
イベントスキーマの開始点
このワークフローのイベント コントラクト
クエリまたはスニペットを運用環境に適用する前に、行粒度、出力境界、必要なタイプ、プライバシー クラス、サンプル ペイロード、および検証チェックリストを確認してください。
関連製品の機能
このワークフローを続行します AIエージェントの監視
レビュー可能な SQL を使用して、エージェントの実行、ツールの使用、モデルのコスト、品質、製品の結果を結び付けます。
関連する SQL レシピ
SQL で次の質問に答えてください
このワークフローの構造化フィールドに対してクエリを実行し、結果の例を検査して、有用な回答をダッシュボードまたはアラートに変換します。
プロンプト バージョンごとに AI 品質の低下を見つける
新しいプロンプト バージョンでは、人間による引き継ぎを増やすことなく品質が向上しましたか?
レシピを開くAI エージェントのタスクの成功と人間による引き継ぎを測定する
どのエージェントのワークフローが正常に終了し、受け入れられた結果をもたらしますか?
レシピを開く1 ドルあたりの受け入れられた AI 出力を測定する
どのモデルと機能の組み合わせが、1 ドルあたり最も受け入れられる出力を生成しますか?
レシピを開く繰り返しを検出する AI エージェント ツール Loops
どのエージェントの実行が繰り返しのツール ループに陥っているように見えますか?
レシピを開く機能とモデルごとに LLM コストを計算する
LLM の支出を促進しているのはどの製品機能とモデルですか?
レシピを開く最初のトークンまでの LLM 時間を測定する
出力が開始される前に速度が遅いと感じるモデルと機能の組み合わせはどれですか?
レシピを開くバージョンごとの RAG 取得品質の評価
新しい RAG パイプラインにより、検索率と根拠のある回答率は向上しましたか?
レシピを開く次のステップ
エージェントが使用する API キーを作成します
プロンプトの実行、テスト イベントの送信、最初のダッシュボードの確認には無料プランで十分です。
関連ページ
AI エージェント Telemetry と可観測性
SQL 対応イベント テーブルで、実行、ツール呼び出し、再試行、レイテンシー、モデル コスト、失敗、および受け入れられた結果に関する AI エージェント テレメトリを計測します。
ページを開くOpenAI コスト監視
SQL ダッシュボードと予算アラートを使用して、モデル、機能、顧客、レイテンシ、エラー率、結果ごとに OpenAI と LLM の支出を監視します。
ページを開くAIエージェントのセキュリティ監視
プロンプト、資格情報、またはツールのペイロードを保存せずに、ツールの承認、ポリシーの拒否、承認キュー、危険なアクション クラス、およびリリースの変更を監視します。
ページを開く