SQL을 사용한 RAG 평가
검색 증강 생성에는 시스템이 관련 증거를 검색했는지 여부와 최종 답변이 해당 증거에 기반을 두고 있는지 여부라는 두 가지 이상의 뚜렷한 품질 경계가 있습니다. 이를 하나의 점수로 결합하면 변경된 파이프라인 부분이 숨겨집니다.
평가 계약 버전 지정
pipeline_version, test_case_id, relevant_document_retrieved, answer_grounded, retrieval_latency_ms, cost_usd, 그레이더 버전 및 환경을 사용하여 테스트 케이스당 하나의 터미널 이벤트를 기록합니다. 파이프라인 버전은 비교를 재현할 수 있을 만큼 검색기, 인덱스 스냅샷, 순위 재지정기 및 응답 프롬프트를 자세히 식별해야 합니다.
파이프라인 전반에 걸쳐 동일한 버전의 테스트 세트를 사용합니다. 채점 기준표를 문서화하고 사람과 모델 기반 채점자 간의 불일치를 검토합니다. 개인 소스 구절, 원시 사용자 질문, 완전한 모델 답변, 비밀 또는 무제한 도구 출력을 일반 텔레메트리에 넣지 마십시오.
품질 및 제약 조건 비교
RAG 품질 SQL 레시피는 모든 파이프라인 버전에 대한 검색 관련률, 정답률, 평균 검색 대기 시간 및 평가 비용을 계산합니다. 결정론적 고정 장치는 비용을 변경하면서 검토된 품질 비율을 모두 향상시키는 버전을 보여줍니다.
열을 별도로 해석합니다.
- 낮은 검색 관련성은 인덱싱, 청킹, 필터링, 임베딩 또는 순위 지정을 가리킵니다.
- 맥락 구성, 촉구 또는 답변 평가에 대한 기반이 부족한 관련 검색.
- 허용할 수 없는 지연 시간이나 비용이 있는 더 나은 품질은 프로덕션 준비가 되지 않았을 수 있습니다.
- 작은 테스트 횟수는 릴리스 결론을 차단해야 하며 백분율 뒤에 숨겨서는 안 됩니다.
브라우저 SQL 플레이그라운드에서 픽스처를 실행한 다음 해당 테스트 사례를 버전이 지정된 평가 세트로 바꿉니다.
릴리스 게이트를 사용하세요
RAG 평가는 일반적으로 대기 중인 페이지가 아닌 릴리스 검토에 속합니다. 버전을 비교하기 전에 최소 테스트 횟수, 회귀 허용 오차, 그레이더 버전 및 필수 슬라이스를 설정합니다. 자체 동의 및 개인 정보 보호 규칙을 통해 프로덕션 피드백을 별도의 신호로 유지하세요.
AI 품질 평가 사용 사례에서는 인간 핸드오프, 허용된 결과 및 프롬프트 버전을 다룹니다. AI 및 LLM 레시피 모음에는 모델 비용, 대기 시간, 캐시, 도구 호출 및 에이전트 실행 분석이 추가됩니다.