測量路徑
從一次代理執行轉向發布決策
有用的品質迴圈可以保留版本化的生產環境,將自動評分與審查結果分開,並使評估的覆蓋範圍保持可見。
- 1
版本化執行
記錄工作流程、模型、提示、工具、發布、成本、終端狀態。
- 2
審查結果
附上評分標準版本、評估者型別、分數以及接受或移交結果。
- 3
SQL比較
比較相同合格人群的品質、覆蓋範圍、故障、延遲和成本。
- 4
發布決定
在升級或回滾之前檢查失敗的範例和產品影響。
用例與範本
本頁解釋了要測量的內容以及原因
使用用例指南來選擇結果、事件邊界和分析問題。當您準備好接受較短的複製貼上實施簡介時,請開啟匹配的範本。
代理提示
將其貼上到您的編碼代理中
更換 YOUR_API_KEY 註冊後,然後要求代理執行產品流程並驗證第一個事件。
代理提示
AI Agent Quality and Evaluation 設定提示
text
使用 Telemetry 檢測 AI 代理品質和評估。
使用 /skill.md 和此 Telemetry API 金鑰:YOUR_API_KEY
使用 run_id、workflow、model、prompt_version、release、status、reviewer_outcome、human_handoff、duration_ms、input_tokens、output_tokens 記錄終端代理結果estimated_cost_usd、retry_count、受控error_type。使用共享的 run_id 單獨記錄工具結果。
建立技術成功、審查接受、修訂和拒絕、人工交接、每個接受結果的成本以及發布品質的儀表板。從已審查的驗收分母中排除未經審查的執行。
除非資料所有者明確批准其目的和保留,否則請勿記錄原始提示、完成情況、工具有效負載、秘密或個人資料。設定步驟
- 1定義任務級成功標準並控制審閱者結果。
- 2記錄每個代理執行的一個終端結果以及工具和切換事件。
- 3按工作流程、模型、提示和發布對成熟的審查群體進行細分。
- 4在更改自動化之前,請使用遙測之外的範例檢視回歸。
要捕獲的事件
agent_run_completedagent_output_reviewedagent_handoff_requestedagent_tool_completedagent_release_evaluated
問題已解鎖
- 哪些工作流程在技術上已完成但未透過人工審查?
- 發布後哪些地方的人為切換會增加?
- 哪種模式以可持續的成本產生可接受的結果?
事件架構起點
此工作流程的事件契約
在將查詢或程式碼片段適應生產之前,請檢查行粒度、發出邊界、所需型別、隱私類、範例有效負載和驗證清單。
相關產品功能
繼續此工作流程 AI代理監控
透過可審查的 SQL 連線代理執行、工具使用、模型成本、品質和產品結果。
相關 SQL 查詢範例
用 SQL 回答下一個問題
針對此工作流程中的結構化欄位執行查詢,檢查範例結果,並將有用的答案轉換為儀表板或警示。
人工智慧和法學碩士中級
按提示版本查詢 AI 品質回歸
新的提示版本是否在不增加人工交接的情況下提高了品質?
開啟查詢範例人工智慧和法學碩士中級
衡量人工智慧代理任務的成功和人工交接
哪些代理工作流程成功完成併產生可接受的結果?
開啟查詢範例人工智慧和法學碩士中級
衡量每美元所接受的人工智慧產出
哪種模型和功能組合可以產生最受接受的單位美元產出?
開啟查詢範例人工智慧和法學碩士中級
檢測重複的 AI 代理工具迴圈
哪些代理執行似乎陷入了重複的工具迴圈?
開啟查詢範例人工智慧和法學碩士入門
按功能和模型計算 LLM 成本
哪些產品功能和型號正在推動法學碩士支出?
開啟查詢範例人工智慧和法學碩士中級
測量 LLM 獲得第一個權杖的時間
在輸出開始之前,哪些模型和功能組合感覺很慢?
開啟查詢範例人工智慧和法學碩士中級
按版本評估 RAG 檢索品質
新的 RAG 管道是否提高了檢索率和接地答案率?
開啟查詢範例完整系列人工智慧和法學碩士 SQL
相關頁面