DSPy Program Evaluation Telemetry:從邊界到驗證行
在受控應用程式邊界使用 DSPy Program Evaluation Telemetry,保持事件契約較小,並在建置聚合檢視之前驗證已知結果。
- 1
選擇結果
DSPy 程式可靠性
- 2
定義合約
operation_id、program_name、program_version、model_alias、optimizer_name 和釋放
- 3
埋點邊界
包裝公共 DSPy 模組呼叫以獲取生產結果,並在 dspy.Evaluate 完成後單獨發出評估器結果。
- 4
核實證據
Exercise a known fixture, then inspect dspy_program_completed for one correctly typed terminal row.
開始之前
先決條件和界限
- DSPy 和 telemetry-sh 在可信 Python 處理程序中初始化
- 穩定的程式、模型、最佳化器、資料集、指標和發布版本
- 即時預測和離線評估結果的獨立事件粒度
交貨設定
安裝並初始化伺服器端
使用伺服器端金鑰為每個處理程序初始化一次 Telemetry 同步程式碼或 TelemetryAsync 非同步程式碼。 將攝取憑據保留在瀏覽器包、客戶端可見的環境變數、原始碼控制、日誌和異常訊息之外。
pip安裝
python -m pip install telemetry-sh- 1準備一個具有有限網路行為的可重用伺服器端交付客戶端。
- 2在成功、失敗、重試或超時邊界處新增結果事件。
- 3在啟用警示之前傳送受控裝置並檢查儲存的行。
片段
從一個結構化事件開始
在工作流程完成、失敗或重試的位置新增此形狀。然後從真實的欄位建置儀表板。
DSPy Program Evaluation Telemetry事件
from time import perf_counter
def run_support_program(program, question: str, operation_id: str):
started_at = perf_counter()
status = "success"
error_type = None
try:
return program(question=question)
except Exception as error:
status = "failed"
error_type = classify_program_error(error)
raise
finally:
telemetry.log("dspy_program_completed", {
"operation_id": operation_id,
"program_name": "support_answer",
"program_version": PROGRAM_VERSION,
"model_alias": MODEL_ALIAS,
"status": status,
"error_type": error_type,
"duration_ms": round((perf_counter() - started_at) * 1000),
"release": APP_RELEASE,
})活動合約
operation_id、program_name、program_version、model_alias、optimizer_name 和釋放
狀態、duration_ms、estimated_cost_usd、已接受和 error_type
dataset_version、metric_name、metric_version、evaluation_score、透過和 evaluated_at 用於評估事件
實施檢查點
檢查站 1
包裝公共 DSPy 模組呼叫以獲取生產結果,並在 dspy.Evaluate 完成後單獨發出評估器結果。
檢查站 2
不要在不分離這些版本的情況下比較使用不同資料集、指標、判斷模型、閾值或評估覆蓋率的候選最佳化器。
檢查站 3
將範例、預測、追蹤、度量回饋、提示和模型歷史記錄保留在批准的 DSPy 或可觀測性工作流程中,而不是將它們複製到 Telemetry 中。
驗證
證明事件已到達
在演練已知的成功和失敗案例後執行此命令。如果您的最終事件契約與程式碼片段不同,請替換後備資料表名稱。
DSPy Program Evaluation Telemetry 驗證查詢
SELECT *
FROM dspy_program_completed
ORDER BY timestamp_utc DESC
LIMIT 20;實施參考
在啟用新的生產路徑之前,請檢查事件合約、資料安全指南和上游主要文件。
生產邊界
保持結果事件小且可恢復
該模式提供了
- 除了上游工作流程之外,還有一個有界的、SQL 就緒的結果。
- 用於儀表板、警示和跨事件關聯的穩定欄位。
- 用於驗證成功、失敗、重試和超時行為的夾具驅動路徑。
該模式不提供
- OTLP 匯出器、自動收集管道或詳細追蹤和診斷日誌的替代品。
- 僅因為有效負載包含事件 ID,所以僅傳送一次。
- 收集原始提供商有效負載、使用者內容、憑證或受監管資料的權限。
事件架構起點
此工作流程的事件契約
在將查詢或程式碼片段適應生產之前,請檢查行粒度、發出邊界、所需型別、隱私類、範例有效負載和驗證清單。
相關產品功能
繼續此工作流程 AI代理監控
透過可審查的 SQL 連線代理執行、工具使用、模型成本、品質和產品結果。
相關 SQL 查詢範例
用 SQL 回答下一個問題
針對此工作流程中的結構化欄位執行查詢,檢查範例結果,並將有用的答案轉換為儀表板或警示。
按提示版本查詢 AI 品質回歸
新的提示版本是否在不增加人工交接的情況下提高了品質?
開啟查詢範例按版本評估 RAG 檢索品質
新的 RAG 管道是否提高了檢索率和接地答案率?
開啟查詢範例衡量每美元所接受的人工智慧產出
哪種模型和功能組合可以產生最受接受的單位美元產出?
開啟查詢範例按功能和模型計算 LLM 成本
哪些產品功能和型號正在推動法學碩士支出?
開啟查詢範例按實施系列瀏覽
比較相關整合模式
與此整合配對的範本
更多整合