使用 SQL 进行 RAG 评估
检索增强生成至少有两个不同的质量边界:系统是否检索到相关证据以及最终答案是否以该证据为基础。将它们组合成一个乐谱会隐藏管道中发生更改的部分。
评估合同版本
使用 pipeline_version、test_case_id、relevant_document_retrieved、answer_grounded、retrieval_latency_ms、cost_usd、分级机版本和环境记录每个测试用例一个终端事件。管道版本应足够准确地识别检索器、索引快照、重新排序器和答案提示,以重现比较。
跨管道使用相同版本的测试集。记录评分标准并审查人类评分者和基于模型的评分者之间的分歧。不要将私人源段落、原始用户问题、完整的模型答案、秘密或不受限制的工具输出放入一般遥测中。
比较质量和约束
RAG品质SQL配方 计算每个管道版本的检索相关率、接地答案率、平均检索延迟和评估成本。其确定性夹具展示了一个在改变成本的同时提高审查质量率的版本。
分别解释各列:
- 较差的检索相关性意味着索引、分块、过滤、嵌入或排名。
- 基础较差的相关检索指向上下文构建、提示或答案评估。
- 更好的质量和不可接受的延迟或成本可能无法投入生产。
- 少量的测试计数应该阻止发布结论,而不是隐藏在百分比后面。
在 浏览器 SQL 游乐场 中运行夹具,然后用版本化的评估集替换其测试用例。
使用释放门
RAG 评估通常属于发布审核而不是待命页面。在比较版本之前设置最小测试计数、回归容差、分级器版本和所需切片。将生产反馈作为单独的信号,并具有自己的同意和隐私规则。
AI质量评估用例 涵盖人工切换、可接受的结果和提示版本。 AI和LLM食谱合集 添加了模型成本、延迟、缓存、工具调用和代理运行分析。