DSPy Program Evaluation Telemetry:从边界到验证行
在受控应用程序边界使用 DSPy Program Evaluation Telemetry,保持事件契约较小,并在构建聚合视图之前验证已知结果。
- 1
选择结果
DSPy 程序可靠性
- 2
定义合同
operation_id、program_name、program_version、model_alias、optimizer_name 和释放
- 3
埋点边界
包装公共 DSPy 模块调用以获取生产结果,并在 dspy.Evaluate 完成后单独发出评估器结果。
- 4
核实证据
Exercise a known fixture, then inspect dspy_program_completed for one correctly typed terminal row.
开始之前
先决条件和界限
- DSPy 和 telemetry-sh 在可信 Python 进程中初始化
- 稳定的程序、模型、优化器、数据集、指标和发布版本
- 实时预测和离线评估结果的独立事件粒度
交货设置
安装并初始化服务器端
使用服务器端密钥为每个进程初始化一次 Telemetry 同步代码或 TelemetryAsync 异步代码。 将摄取凭据保留在浏览器包、客户端可见的环境变量、源代码控制、日志和异常消息之外。
pip安装
python -m pip install telemetry-sh- 1准备一个具有有限网络行为的可重用服务器端交付客户端。
- 2在成功、失败、重试或超时边界处添加结果事件。
- 3在启用警报之前发送受控装置并检查存储的行。
片段
从一个结构化事件开始
在工作流程完成、失败或重试的位置添加此形状。然后从真实的字段构建仪表板。
DSPy Program Evaluation Telemetry事件
from time import perf_counter
def run_support_program(program, question: str, operation_id: str):
started_at = perf_counter()
status = "success"
error_type = None
try:
return program(question=question)
except Exception as error:
status = "failed"
error_type = classify_program_error(error)
raise
finally:
telemetry.log("dspy_program_completed", {
"operation_id": operation_id,
"program_name": "support_answer",
"program_version": PROGRAM_VERSION,
"model_alias": MODEL_ALIAS,
"status": status,
"error_type": error_type,
"duration_ms": round((perf_counter() - started_at) * 1000),
"release": APP_RELEASE,
})活动合约
operation_id、program_name、program_version、model_alias、optimizer_name 和释放
状态、duration_ms、estimated_cost_usd、已接受和 error_type
dataset_version、metric_name、metric_version、evaluation_score、通过和 evaluated_at 用于评估事件
实施检查点
检查站 1
包装公共 DSPy 模块调用以获取生产结果,并在 dspy.Evaluate 完成后单独发出评估器结果。
检查站 2
不要在不分离这些版本的情况下比较使用不同数据集、指标、判断模型、阈值或评估覆盖率的候选优化器。
检查站 3
将示例、预测、跟踪、度量反馈、提示和模型历史记录保留在批准的 DSPy 或可观测性工作流程中,而不是将它们复制到 Telemetry 中。
验证
证明事件已到达
在演练已知的成功和失败案例后运行此命令。如果您的最终事件契约与代码片段不同,请替换后备表名称。
DSPy Program Evaluation Telemetry 验证查询
SELECT *
FROM dspy_program_completed
ORDER BY timestamp_utc DESC
LIMIT 20;实施参考
在启用新的生产路径之前,请检查事件合同、数据安全指南和上游主要文档。
生产边界
保持结果事件小且可恢复
该模式提供了
- 除了上游工作流程之外,还有一个有界的、SQL 就绪的结果。
- 用于仪表板、警报和跨事件关联的稳定字段。
- 用于验证成功、失败、重试和超时行为的夹具驱动路径。
该模式不提供
- OTLP 导出器、自动收集管道或详细跟踪和诊断日志的替代品。
- 仅因为有效负载包含事件 ID,所以仅传送一次。
- 收集原始提供商有效负载、用户内容、凭证或受监管数据的权限。
事件架构起点
此工作流程的事件契约
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 AI代理监控
通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。
相关 SQL 查询示例
用 SQL 回答下一个问题
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
按提示版本查找 AI 质量回归
新的提示版本是否在不增加人工交接的情况下提高了质量?
打开查询示例按版本评估 RAG 检索质量
新的 RAG 管道是否提高了检索率和接地答案率?
打开查询示例衡量每美元所接受的人工智能产出
哪种模型和功能组合可以产生最受接受的单位美元产出?
打开查询示例按功能和模型计算 LLM 成本
哪些产品功能和型号正在推动法学硕士支出?
打开查询示例按实施系列浏览
比较相关集成模式
与此集成配对的模板
更多集成