共同事件契約
使這些查詢可重用的欄位
- timestamp_utc、run_id、功能、提供商、型號和狀態
- input_tokens、output_tokens、estimated_cost_usd 和 latency_ms
- tool_name、retry_count、cache_hit、reviewer_outcome 和 human_handoff
SQL 之前的定義
查詢無法為您做出的決定
- 1儘可能將模型定價版本保持在事件生產者之外。
- 2預設情況下,將請求與產品結果連線起來,而不儲存原始提示。
- 3將提供程式重試與故意的使用者重新生成分開。
推薦順序
先建立檢測,然後診斷
分析模式
讓結果解釋決定
測量有用輸出
將權杖、延遲和提供商成本與已接受或已完成的產品結果聯絡起來,而不是單獨最佳化請求量。
保留執行路徑
保持執行、模型、工具、快取和重試欄位,以便昂貴或不可靠的分支保持可見。
版本變更假設
記錄模型和定價版本,以便可以重現歷史成本和品質比較。
完整的查詢範例
複製查詢,然後驗證假設
入門llm_request_completed
按功能和模型計算 LLM 成本
將模型支出、代幣、請求量和每個請求的成本歸因於產品功能。
哪些產品功能和型號正在推動法學碩士支出?
檢視 SQL 和結果中級llm_requests
衡量每美元所接受的人工智慧產出
將模型支出與已接受、已儲存或其他有用的產品結果聯絡起來。
哪種模型和功能組合可以產生最受接受的單位美元產出?
檢視 SQL 和結果中級llm_requests
衡量 LLM 快取節省和重試成本
按模型比較快取的請求、重試量和估計支出,以找到可避免的 AI 成本。
有多少模型成本與重試和快取未命中相關?
檢視 SQL 和結果中級llm_requests
測量 LLM 獲得第一個權杖的時間
按模型和功能比較流回應能力和總生成延遲。
在輸出開始之前,哪些模型和功能組合感覺很慢?
檢視 SQL 和結果中級agent_tool_calls
檢測重複的 AI 代理工具迴圈
查詢代理執行重複呼叫一小組工具但未取得成功結果的情況。
哪些代理執行似乎陷入了重複的工具迴圈?
檢視 SQL 和結果中級agent_run_outcomes
衡量人工智慧代理任務的成功和人工交接
按工作流程和模型比較代理任務成功率、審閱者接受度、成本、延遲和人工切換率。
哪些代理工作流程成功完成併產生可接受的結果?
檢視 SQL 和結果中級ai_quality_events
按提示版本查詢 AI 品質回歸
按提示版本比較評估的品質、驗收、移交和成本。
新的提示版本是否在不增加人工交接的情況下提高了品質?
檢視 SQL 和結果中級rag_evaluation_events
按版本評估 RAG 檢索品質
比較跨 RAG 管道版本的相關文件檢索、接地答案、檢索延遲和評估成本。
新的 RAG 管道是否提高了檢索率和接地答案率?
檢視 SQL 和結果