단일 에이전트 실행에서 릴리스 결정으로 이동
유용한 품질 루프는 버전이 지정된 프로덕션 컨텍스트를 보존하고, 검토된 결과에서 자동화된 점수를 분리하며, 평가된 적용 범위를 계속 표시합니다.
- 1
버전이 지정된 실행
워크플로, 모델, 프롬프트, 도구, 릴리스, 비용 및 터미널 상태를 기록합니다.
- 2
검토 결과
루브릭 버전, 평가자 유형, 점수, 합격 또는 전달 결과를 첨부하세요.
- 3
SQL 비교
동일한 적격 모집단의 품질, 적용 범위, 오류, 대기 시간 및 비용을 비교하십시오.
- 4
출시 결정
승격하거나 롤백하기 전에 실패한 사례와 제품 영향을 검사하세요.
사용 사례와 템플릿
이 페이지에서는 측정 대상과 그 이유를 설명합니다.
사용 사례 가이드를 사용하여 결과, 이벤트 경계 및 분석 질문을 선택하세요. 더 짧은 복사-붙여넣기 구현 개요를 작성할 준비가 되면 일치하는 템플릿을 엽니다.
에이전트 프롬프트
이것을 코딩 에이전트에 붙여넣으세요.
바꾸기 YOUR_API_KEY 가입 후 에이전트에게 제품 흐름을 실행하고 첫 번째 이벤트를 확인하도록 요청합니다.
AI Agent Quality and Evaluation 설정 프롬프트
Telemetry를 사용하여 AI 에이전트 품질 및 평가를 계측합니다.
/skill.md 및 이 Telemetry API 키를 사용하세요: YOUR_API_KEY
run_id, 워크플로, 모델, prompt_version, 릴리스, 상태, reviewer_outcome, human_handoff, duration_ms, input_tokens, output_tokens,를 사용하여 터미널 에이전트 결과를 기록합니다. estimated_cost_usd, retry_count 및 제어되는 error_type. 공유된 run_id를 사용하여 도구 결과를 별도로 기록합니다.
기술적 성공, 승인 검토, 개정 및 거부, 인계, 승인된 결과당 비용, 릴리스별 품질에 대한 대시보드를 만듭니다. 검토된 승인 분모에서 검토되지 않은 실행을 제외합니다.
데이터 소유자가 목적과 보존을 명시적으로 승인하지 않는 한 원시 프롬프트, 완성, 도구 페이로드, 비밀 또는 개인 데이터를 기록하지 마십시오.설정 단계
- 1작업 수준의 성공 기준표와 통제된 검토자 결과를 정의합니다.
- 2에이전트 실행당 하나의 최종 결과와 도구 및 전달 이벤트를 기록합니다.
- 3워크플로, 모델, 프롬프트 및 릴리스별로 성숙도가 검토된 집단을 분류합니다.
- 4자동화를 변경하기 전에 텔레메트리 외부의 예를 사용하여 회귀를 검토하세요.
캡처할 이벤트
질문 잠금 해제
- 기술적으로 완료되었지만 사람의 검토에 실패한 워크플로는 무엇입니까?
- 릴리스 후 사람의 핸드오프가 증가하는 곳은 어디입니까?
- 어떤 모델이 지속 가능한 비용으로 수용 가능한 결과를 프로덕션합니까?
이벤트 스키마 시작점
이 워크플로우에 대한 이벤트 계약
쿼리 또는 스니펫을 프로덕션에 적용하기 전에 행 그레인, 방출 경계, 필수 유형, 개인 정보 보호 클래스, 예제 페이로드 및 유효성 검사 체크리스트를 검토하세요.
관련 제품 기능
이 워크플로를 다음에서 계속하세요. AI 에이전트 모니터링
검토 가능한 SQL을 사용하여 에이전트 실행, 도구 사용, 모델 비용, 품질 및 제품 결과를 연결하세요.
관련 SQL 레시피
SQL로 다음 질문에 답하세요
이 워크플로의 구조화된 필드에 대해 쿼리를 실행하고, 예제 결과를 검사하고, 유용한 답변을 대시보드 또는 알림으로 전환하세요.
프롬프트 버전별 AI 품질 회귀 찾기
새로운 프롬프트 버전은 사람의 핸드오프를 늘리지 않고도 품질을 향상시켰습니까?
레시피 열기AI 에이전트 작업 성공 및 인간 핸드오프 측정
어떤 상담사 워크플로가 성공적으로 완료되고 허용되는 결과를 생성합니까?
레시피 열기달러당 허용되는 AI 출력 측정
어떤 모델과 기능 조합이 달러당 가장 많은 수용 결과를 생성합니까?
레시피 열기반복되는 AI 에이전트 도구 Loops 감지
반복적인 도구 루프에서 멈춘 것처럼 보이는 에이전트 실행은 무엇입니까?
레시피 열기기능 및 모델별로 LLM 비용 계산
LLM 지출을 주도하는 제품 기능과 모델은 무엇입니까?
레시피 열기첫 번째 토큰까지 LLM 시간 측정
출력이 시작되기 전에 어떤 모델과 기능 조합이 느리게 느껴지나요?
레시피 열기버전별 RAG 검색 품질 평가
새로운 RAG 파이프라인이 검색 및 근거 있는 답변 비율을 향상시켰습니까?
레시피 열기다음 단계
에이전트가 사용할 API 키를 생성하세요.
무료 플랜은 프롬프트를 실행하고, 테스트 이벤트를 보내고, 첫 번째 대시보드를 검토하는 데 충분합니다.
관련 페이지
AI 에이전트 Telemetry 및 옵저버빌리티
SQL 지원 이벤트 테이블에서 실행, 도구 호출, 재시도, 대기 시간, 모델 비용, 실패 및 허용된 결과에 대한 AI 에이전트 텔레메트리을 계측합니다.
페이지 열기OpenAI 비용 모니터링
SQL 대시보드 및 예산 알림을 통해 모델, 기능, 고객, 대기 시간, 오류율 및 결과별로 OpenAI 및 LLM 지출을 모니터링하세요.
페이지 열기AI 에이전트 보안 모니터링
프롬프트, 자격 증명 또는 도구 페이로드를 저장하지 않고 도구 승인, 정책 거부, 승인 대기열, 위험한 작업 클래스 및 릴리스 변경 사항을 모니터링합니다.
페이지 열기