콘텐츠로 건너뛰기
Telemetry
문서 찾아보기
가이드업데이트된 2026년 7월 28일Telemetry 편집 및 제품 팀의 검토2 최소 읽기

코딩 에이전트와 함께 이 문서를 사용하세요.

Claude Code, Codex, Cursor 또는 다른 코딩 에이전트에 대한 집중 프롬프트 팩을 연 다음 여기에서 다루는 워크플로에 맞게 조정하세요.

이 페이지에서
  1. 평가 계약 버전 지정
  2. 품질 및 제약 조건 비교
  3. 릴리스 게이트를 사용하세요

SQL을 사용한 RAG 평가

검색 증강 생성에는 시스템이 관련 증거를 검색했는지 여부와 최종 답변이 해당 증거에 기반을 두고 있는지 여부라는 두 가지 이상의 뚜렷한 품질 경계가 있습니다. 이를 하나의 점수로 결합하면 변경된 파이프라인 부분이 숨겨집니다.

평가 계약 버전 지정

pipeline_version, test_case_id, relevant_document_retrieved, answer_grounded, retrieval_latency_ms, cost_usd, 그레이더 버전 및 환경을 사용하여 테스트 케이스당 하나의 터미널 이벤트를 기록합니다. 파이프라인 버전은 비교를 재현할 수 있을 만큼 검색기, 인덱스 스냅샷, 순위 재지정기 및 응답 프롬프트를 자세히 식별해야 합니다.

파이프라인 전반에 걸쳐 동일한 버전의 테스트 세트를 사용합니다. 채점 기준표를 문서화하고 사람과 모델 기반 채점자 간의 불일치를 검토합니다. 개인 소스 구절, 원시 사용자 질문, 완전한 모델 답변, 비밀 또는 무제한 도구 출력을 일반 텔레메트리에 넣지 마십시오.

품질 및 제약 조건 비교

RAG 품질 SQL 레시피는 모든 파이프라인 버전에 대한 검색 관련률, 정답률, 평균 검색 대기 시간 및 평가 비용을 계산합니다. 결정론적 고정 장치는 비용을 변경하면서 검토된 품질 비율을 모두 향상시키는 버전을 보여줍니다.

열을 별도로 해석합니다.

  1. 낮은 검색 관련성은 인덱싱, 청킹, 필터링, 임베딩 또는 순위 지정을 가리킵니다.
  2. 맥락 구성, 촉구 또는 답변 평가에 대한 기반이 부족한 관련 검색.
  3. 허용할 수 없는 지연 시간이나 비용이 있는 더 나은 품질은 프로덕션 준비가 되지 않았을 수 있습니다.
  4. 작은 테스트 횟수는 릴리스 결론을 차단해야 하며 백분율 뒤에 숨겨서는 안 됩니다.

브라우저 SQL 플레이그라운드에서 픽스처를 실행한 다음 해당 테스트 사례를 버전이 지정된 평가 세트로 바꿉니다.

릴리스 게이트를 사용하세요

RAG 평가는 일반적으로 대기 중인 페이지가 아닌 릴리스 검토에 속합니다. 버전을 비교하기 전에 최소 테스트 횟수, 회귀 허용 오차, 그레이더 버전 및 필수 슬라이스를 설정합니다. 자체 동의 및 개인 정보 보호 규칙을 통해 프로덕션 피드백을 별도의 신호로 유지하세요.

AI 품질 평가 사용 사례에서는 인간 핸드오프, 허용된 결과 및 프롬프트 버전을 다룹니다. AI 및 LLM 레시피 모음에는 모델 비용, 대기 시간, 캐시, 도구 호출 및 에이전트 실행 분석이 추가됩니다.

관련 제품 기능

Connect 에이전트 실행, 도구 사용, 토큰 비용, 품질 및 제품 결과.

소유권 및 기술 참조

이 설명은 Telemetry 편집팀의 소유입니다. 제품 팀은 동작, 예시, 경계를 검토합니다.

편집 기준 검토