跳转到内容
Telemetry
浏览文档
指南更新于 2026年7月28日由 Telemetry 编辑团队和产品团队审核阅读约需 2 分钟

让编程智能体使用这篇文档

打开 Claude Code、Codex、Cursor 或其他编码代理的集中提示包,然后将其适应此处介绍的工作流程。

本页内容
  1. 评估合同版本
  2. 比较质量和约束
  3. 使用释放门

使用 SQL 进行 RAG 评估

检索增强生成至少有两个不同的质量边界:系统是否检索到相关证据以及最终答案是否以该证据为基础。将它们组合成一个乐谱会隐藏管道中发生更改的部分。

评估合同版本

使用 pipeline_versiontest_case_idrelevant_document_retrievedanswer_groundedretrieval_latency_mscost_usd、分级机版本和环境记录每个测试用例一个终端事件。管道版本应足够准确地识别检索器、索引快照、重新排序器和答案提示,以重现比较。

跨管道使用相同版本的测试集。记录评分标准并审查人类评分者和基于模型的评分者之间的分歧。不要将私人源段落、原始用户问题、完整的模型答案、秘密或不受限制的工具输出放入一般遥测中。

比较质量和约束

RAG品质SQL配方 计算每个管道版本的检索相关率、接地答案率、平均检索延迟和评估成本。其确定性夹具展示了一个在改变成本的同时提高审查质量率的版本。

分别解释各列:

  1. 较差的检索相关性意味着索引、分块、过滤、嵌入或排名。
  2. 基础较差的相关检索指向上下文构建、提示或答案评估。
  3. 更好的质量和不可接受的延迟或成本可能无法投入生产。
  4. 少量的测试计数应该阻止发布结论,而不是隐藏在百分比后面。

浏览器 SQL 游乐场 中运行夹具,然后用版本化的评估集替换其测试用例。

使用释放门

RAG 评估通常属于发布审核而不是待命页面。在比较版本之前设置最小测试计数、回归容差、分级器版本和所需切片。将生产反馈作为单独的信号,并具有自己的同意和隐私规则。

AI质量评估用例 涵盖人工切换、可接受的结果和提示版本。 AI和LLM食谱合集 添加了模型成本、​​延迟、缓存、工具调用和代理运行分析。

相关产品功能

连接代理运行、工具使用、代币成本、质量和产品成果。

内容责任与技术参考

Telemetry 编辑团队负责维护本文;产品团队审核功能行为、示例和适用范围。

查看编辑规范