콘텐츠로 건너뛰기
Telemetry
AI 및 LLM SQL 레시피

프롬프트 버전별 AI 품질 회귀 찾기

프롬프트 버전별로 평가된 품질, 수용도, 전달 및 비용을 비교합니다.

중급ai_quality_events검토됨 2026-07-28테스트됨 아파치 DataFusion 45.2.0

검토자 Telemetry 제품 팀 . SQL 호환성, 이벤트 계약, 합성 출력 및 운영상의 주의사항. 표준 및 소유권 검토

질문에 답변됨

새로운 프롬프트 버전은 사람의 핸드오프를 늘리지 않고도 품질을 향상시켰습니까?

지연 시간과 토큰 비용은 AI 워크플로가 유용한지 여부를 알 수 없습니다. 이 패턴은 품질 결과가 검토된 제한된 프롬프트 버전과 결합되므로 이전 버전과 비교하여 롤아웃을 평가할 수 있습니다.

이벤트 계약

쿼리가 예상하는 필드

필드유형그것이 존재하는 이유
timestamp_utcTimestamp평가 완료 시간(UTC)입니다.
workflow_nameUtf8제한된 AI 워크플로 이름입니다.
prompt_versionUtf8프롬프트 또는 정책 버전을 검토했습니다.
model_nameUtf8제한된 모델 이름.
quality_scoreFloat64문서화된 평가자의 정규화된 점수입니다.
quality_passedBoolean실행이 검토된 품질 임계값을 통과했는지 여부입니다.
accepted_without_editBoolean사용자가 편집 없이 출력을 수락했는지 여부입니다.
human_handoffBoolean워크플로가 개인에게 에스컬레이션되었는지 여부입니다.
cost_usdFloat64실행에 대한 정규화된 모델 비용입니다.
environmentUtf8배포 환경.
DataFusion SQL

쿼리 복사

sql
SELECT
  workflow_name,
  prompt_version,
  COUNT(*) AS evaluated_runs,
  100.0 * SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS quality_pass_rate_pct,
  100.0 * SUM(CASE WHEN accepted_without_edit THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS handoff_rate_pct,
  AVG(quality_score) AS average_quality_score,
  SUM(cost_usd) / NULLIF(
    SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END),
    0
  ) AS cost_per_quality_pass_usd
FROM ai_quality_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
  AND environment = 'production'
GROUP BY workflow_name, prompt_version
ORDER BY workflow_name, prompt_version;

이 읽기 전용 쿼리는 빈 유형의 테이블에 대해 계획되고 실행됩니다. 아파치 DataFusion 45.2.0. 결정론적 샘플 출력은 합성되어 별도로 검토됩니다. 자신의 데이터에 대해 필드 유형, 임계값 및 비즈니스 정의를 검증합니다. 테스트 방법론을 읽어보세요.

쿼리 결과

프롬프트 버전별 AI 품질

버전 4는 관찰된 핸드오프 없이 더 높은 품질 통과 및 승인률을 제공합니다.

workflow_nameprompt_versionevaluated_runsquality_pass_rate_pctacceptance_rate_pcthandoff_rate_pctaverage_quality_scorecost_per_quality_pass_usd
support_replysupport-v356060400.690.03
support_replysupport-v45808000.830.03

합성 예제 출력. 운영 결정에 사용하기 전에 자체 이벤트 스키마 및 임계값에 대해 쿼리를 실행하세요.

AI quality by prompt version: Find AI Quality Regressions by Prompt Version 예제 결과의 합성 quality_pass_rate_pct 값에 대한 정적 차트
결정론적 예제 출력의 색인 생성 가능한 SVG입니다. 기사, 런북 또는 저작자가 포함된 디자인 검토를 위해 다운로드하세요.

예제 재현

공공 픽스처 다운로드

JSON 번들은 타입이 지정된 이벤트 계약을 포함합니다. reproducible 입력 행, 정확한 SQL, 예상 출력, 검토 참고 사항 및 엔진 버전. CSV에는 표시된 결과가 포함됩니다.

SQL 작동 방식

  1. 1프롬프트 버전은 명시적인 이벤트 필드이므로 롤아웃 비교를 재현할 수 있습니다.
  2. 2품질 합격, 제품 승인, 핸드오프 비율은 유용성의 다양한 측면을 보여줍니다.
  3. 3비용은 원시 실행이 아닌 성공적인 품질 결과로 나누어지므로 값싼 실패가 효율적으로 보이지 않습니다.

결정해야 할 극단적인 경우

  • 비교된 버전 전체에서 평가자 정의 및 임계값을 안정적으로 유지합니다.
  • 오프라인 평가자 점수를 실제 사용자 승인과 분리하여 둘 중 하나를 근거로 간주합니다.
  • 프롬프트 버전이 실질적으로 다른 트래픽을 수신하는 경우 작업 난이도 또는 고객 집단별로 분류합니다.

추천 대시보드

  • 바: prompt_version의 품질 및 합격률
  • 추세: 출시 주석이 포함된 핸드오프 비율
  • 표: 평가된 실행 및 품질 통과당 비용

알림 안내

새 버전이 검토된 평가 수준에 도달한 후에만 지속적인 품질 또는 승인 회귀에 대해 알림합니다.

알림 설정 읽기

레시피를 활용해 보세요

관련 계측 및 가이드

분석 계속하기

실제 이벤트에서 실행

테이블을 만들고, 필드를 조정하고, 결과를 저장하세요.

무료로 시작하고, 구조화된 이벤트를 보내고, 쿼리 결과를 차트, 공유 대시보드 위젯 또는 알림 입력으로 사용하세요.

API 키 받기