콘텐츠로 건너뛰기
Telemetry
API 성공 이상의 에이전트 결과를 측정하는 팀용

AI 에이전트 품질 및 평가

에이전트 실행, 검토자 결과, 인계, 비용, 릴리스 변경 사항을 반복 가능한 품질 평가 워크플로에 연결합니다.

검토자 Telemetry 제품 팀 . 이벤트 계약, 권장 분석 및 개인정보 보호 경계. 표준 및 소유권 검토

이것이 작동하는 이유
  • 기술 완료를 검토된 작업 성공과 별도로 유지하세요.
  • 승인, 수정, 거부 및 사람이 직접 전달하는 비율을 비교합니다.
  • 품질만 최적화하는 대신 품질 외에도 비용과 대기 시간을 추적하세요.
측정 경로

단일 에이전트 실행에서 릴리스 결정으로 이동

유용한 품질 루프는 버전이 지정된 프로덕션 컨텍스트를 보존하고, 검토된 결과에서 자동화된 점수를 분리하며, 평가된 적용 범위를 계속 표시합니다.

  1. 1

    버전이 지정된 실행

    워크플로, 모델, 프롬프트, 도구, 릴리스, 비용 및 터미널 상태를 기록합니다.

  2. 2

    검토 결과

    루브릭 버전, 평가자 유형, 점수, 합격 또는 전달 결과를 첨부하세요.

  3. 3

    SQL 비교

    동일한 적격 모집단의 품질, 적용 범위, 오류, 대기 시간 및 비용을 비교하십시오.

  4. 4

    출시 결정

    승격하거나 롤백하기 전에 실패한 사례와 제품 영향을 검사하세요.

사용 사례와 템플릿

이 페이지에서는 측정 대상과 그 이유를 설명합니다.

사용 사례 가이드를 사용하여 결과, 이벤트 경계 및 분석 질문을 선택하세요. 더 짧은 복사-붙여넣기 구현 개요를 작성할 준비가 되면 일치하는 템플릿을 엽니다.

열기 AI 에이전트 옵저버빌리티 템플릿

에이전트 프롬프트

이것을 코딩 에이전트에 붙여넣으세요.

바꾸기 YOUR_API_KEY 가입 후 에이전트에게 제품 흐름을 실행하고 첫 번째 이벤트를 확인하도록 요청합니다.

에이전트 프롬프트

AI Agent Quality and Evaluation 설정 프롬프트

text
Telemetry를 사용하여 AI 에이전트 품질 및 평가를 계측합니다.

/skill.md 및 이 Telemetry API 키를 사용하세요: YOUR_API_KEY

run_id, 워크플로, 모델, prompt_version, 릴리스, 상태, reviewer_outcome, human_handoff, duration_ms, input_tokens, output_tokens,를 사용하여 터미널 에이전트 결과를 기록합니다. estimated_cost_usd, retry_count 및 제어되는 error_type. 공유된 run_id를 사용하여 도구 결과를 별도로 기록합니다.

기술적 성공, 승인 검토, 개정 및 거부, 인계, 승인된 결과당 비용, 릴리스별 품질에 대한 대시보드를 만듭니다. 검토된 승인 분모에서 검토되지 않은 실행을 제외합니다.

데이터 소유자가 목적과 보존을 명시적으로 승인하지 않는 한 원시 프롬프트, 완성, 도구 페이로드, 비밀 또는 개인 데이터를 기록하지 마십시오.

설정 단계

  1. 1작업 수준의 성공 기준표와 통제된 검토자 결과를 정의합니다.
  2. 2에이전트 실행당 하나의 최종 결과와 도구 및 전달 이벤트를 기록합니다.
  3. 3워크플로, 모델, 프롬프트 및 릴리스별로 성숙도가 검토된 집단을 분류합니다.
  4. 4자동화를 변경하기 전에 텔레메트리 외부의 예를 사용하여 회귀를 검토하세요.

캡처할 이벤트

agent_run_completedagent_output_reviewedagent_handoff_requestedagent_tool_completedagent_release_evaluated

질문 잠금 해제

  • 기술적으로 완료되었지만 사람의 검토에 실패한 워크플로는 무엇입니까?
  • 릴리스 후 사람의 핸드오프가 증가하는 곳은 어디입니까?
  • 어떤 모델이 지속 가능한 비용으로 수용 가능한 결과를 프로덕션합니까?

이벤트 스키마 시작점

쿼리 또는 스니펫을 프로덕션에 적용하기 전에 행 그레인, 방출 경계, 필수 유형, 개인 정보 보호 클래스, 예제 페이로드 및 유효성 검사 체크리스트를 검토하세요.

관련 제품 기능

이 워크플로를 다음에서 계속하세요. AI 에이전트 모니터링

검토 가능한 SQL을 사용하여 에이전트 실행, 도구 사용, 모델 비용, 품질 및 제품 결과를 연결하세요.

관련 SQL 레시피

SQL로 다음 질문에 답하세요

이 워크플로의 구조화된 필드에 대해 쿼리를 실행하고, 예제 결과를 검사하고, 유용한 답변을 대시보드 또는 알림으로 전환하세요.

모든 레시피 찾아보기
완전한 컬렉션AI 및 LLM SQL

다음 단계

에이전트가 사용할 API 키를 생성하세요.

무료 플랜은 프롬프트를 실행하고, 테스트 이벤트를 보내고, 첫 번째 대시보드를 검토하는 데 충분합니다.

관련 페이지