跳至主要內容
Telemetry
適用於衡量 API 成功之外的代理結果的團隊

AI代理品質與評估

將代理執行、審閱者結果、人工交接、成本和發布更改連線到可重複的品質評估工作流程。

審閱者 Telemetry產品團隊 . 事件契約、推薦分析和隱私邊界. 審查標準和所有權

為什麼這有效
  • 將技術完成情況與審查的任務成功情況分開。
  • 比較接受率、修改率、拒絕率和人工移交率。
  • 除了品質之外還追蹤成本和延遲,而不是單獨最佳化它們。
測量路徑

從一次代理執行轉向發布決策

有用的品質迴圈可以保留版本化的生產環境,將自動評分與審查結果分開,並使評估的覆蓋範圍保持可見。

  1. 1

    版本化執行

    記錄工作流程、模型、提示、工具、發布、成本、終端狀態。

  2. 2

    審查結果

    附上評分標準版本、評估者型別、分數以及接受或移交結果。

  3. 3

    SQL比較

    比較相同合格人群的品質、覆蓋範圍、故障、延遲和成本。

  4. 4

    發布決定

    在升級或回滾之前檢查失敗的範例和產品影響。

用例與範本

本頁解釋了要測量的內容以及原因

使用用例指南來選擇結果、事件邊界和分析問題。當您準備好接受較短的複製貼上實施簡介時,請開啟匹配的範本。

開啟 AI 代理可觀測性範本

代理提示

將其貼上到您的編碼代理中

更換 YOUR_API_KEY 註冊後,然後要求代理執行產品流程並驗證第一個事件。

代理提示

AI Agent Quality and Evaluation 設定提示

text
使用 Telemetry 檢測 AI 代理品質和評估。

使用 /skill.md 和此 Telemetry API 金鑰:YOUR_API_KEY

使用 run_id、workflow、model、prompt_version、release、status、reviewer_outcome、human_handoff、duration_ms、input_tokens、output_tokens 記錄終端代理結果estimated_cost_usd、retry_count、受控error_type。使用共享的 run_id 單獨記錄工具結果。

建立技術成功、審查接受、修訂和拒絕、人工交接、每個接受結果的成本以及發布品質的儀表板。從已審查的驗收分母中排除未經審查的執行。

除非資料所有者明確批准其目的和保留,否則請勿記錄原始提示、完成情況、工具有效負載、秘密或個人資料。

設定步驟

  1. 1定義任務級成功標準並控制審閱者結果。
  2. 2記錄每個代理執行的一個終端結果以及工具和切換事件。
  3. 3按工作流程、模型、提示和發布對成熟的審查群體進行細分。
  4. 4在更改自動化之前,請使用遙測之外的範例檢視回歸。

要捕獲的事件

agent_run_completedagent_output_reviewedagent_handoff_requestedagent_tool_completedagent_release_evaluated

問題已解鎖

  • 哪些工作流程在技術上已完成但未透過人工審查?
  • 發布後哪些地方的人為切換會增加?
  • 哪種模式以可持續的成本產生可接受的結果?

事件架構起點

在將查詢或程式碼片段適應生產之前,請檢查行粒度、發出邊界、所需型別、隱私類、範例有效負載和驗證清單。

相關產品功能

繼續此工作流程 AI代理監控

透過可審查的 SQL 連線代理執行、工具使用、模型成本、品質和產品結果。

相關 SQL 查詢範例

用 SQL 回答下一個問題

針對此工作流程中的結構化欄位執行查詢,檢查範例結果,並將有用的答案轉換為儀表板或警示。

瀏覽所有查詢範例

下一步

建立您的代理將使用的 API 金鑰

免費計劃足以執行提示、傳送測試事件和檢視第一個儀表板。

相關頁面