콘텐츠로 건너뛰기
Telemetry
AI 및 LLM SQL 레시피

AI 에이전트 작업 성공 및 인간 핸드오프 측정

워크플로와 모델별로 에이전트 작업 성공, 검토자 수락, 비용, 대기 시간, 사람 핸드오프 비율을 비교하세요.

중급agent_run_outcomes검토됨 2026-07-28테스트됨 아파치 DataFusion 45.2.0

검토자 Telemetry 제품 팀 . SQL 호환성, 이벤트 계약, 합성 출력 및 운영상의 주의사항. 표준 및 소유권 검토

질문에 답변됨

어떤 상담사 워크플로가 성공적으로 완료되고 허용되는 결과를 생성합니까?

기술적으로 완료된 에이전트 실행이 반드시 유용한 것은 아닙니다. 이 패턴은 검토된 결과 및 사람의 전달 외에 런타임 성공을 유지하므로 워크플로 경계에서 자동화 품질이 측정됩니다.

이벤트 계약

쿼리가 예상하는 필드

필드유형그것이 존재하는 이유
timestamp_utcTimestampUTC 기준 터미널 에이전트 실행 시간입니다.
workflowUtf8안정적인 제품 워크플로우 또는 작업 카테고리.
modelUtf8공급자 응답에서 기록된 모델 식별자입니다.
statusUtf8기술 실행의 성공 또는 실패.
reviewer_outcomeUtf8승인, 수정, 거부 또는 not_reviewed.
human_handoffBoolean인간이 작업을 인수했는지 여부.
duration_msFloat64엔드투엔드 워크플로 기간.
estimated_cost_usdFloat64실행에 대한 정규화된 예상 모델 비용입니다.
DataFusion SQL

쿼리 복사

sql
SELECT
  workflow,
  model,
  COUNT(*) AS runs,
  100.0 * SUM(CASE WHEN status = 'success' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS technical_success_rate_pct,
  100.0 * SUM(CASE WHEN reviewer_outcome = 'accepted' THEN 1 ELSE 0 END)
    / NULLIF(SUM(CASE
      WHEN reviewer_outcome <> 'not_reviewed' THEN 1 ELSE 0
    END), 0) AS reviewed_acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS human_handoff_rate_pct,
  AVG(duration_ms) AS average_duration_ms,
  SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0) AS cost_per_run_usd
FROM agent_run_outcomes
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY workflow, model
HAVING COUNT(*) >= 20
ORDER BY reviewed_acceptance_rate_pct, runs DESC;

이 읽기 전용 쿼리는 빈 유형의 테이블에 대해 계획되고 실행됩니다. 아파치 DataFusion 45.2.0. 결정론적 샘플 출력은 합성되어 별도로 검토됩니다. 자신의 데이터에 대해 필드 유형, 임계값 및 비즈니스 정의를 검증합니다. 테스트 방법론을 읽어보세요.

쿼리 결과

워크플로별로 상담사 승인을 검토했습니다.

환불 검토는 기술적으로 완료되지만 다른 워크플로보다 훨씬 더 많은 수정이나 인계가 필요합니다.

workflowmodelrunstechnical_success_rate_pctreviewed_acceptance_rate_pcthuman_handoff_rate_pctaverage_duration_mscost_per_run_usd
support_triageconfigured-model-a1,84098.186.418.24,8200.04
refund_reviewconfigured-model-b62096.868.742.98,1100.07
knowledge_draftconfigured-model-a94099.291.68.43,9100.04

합성 예제 출력. 운영 결정에 사용하기 전에 자체 이벤트 스키마 및 임계값에 대해 쿼리를 실행하세요.

Reviewed agent acceptance by workflow: Measure AI Agent Task Success and Human Handoff 예제 결과의 합성 reviewed_acceptance_rate_pct 값에 대한 정적 차트
결정론적 예제 출력의 색인 생성 가능한 SVG입니다. 기사, 런북 또는 저작자가 포함된 디자인 검토를 위해 다운로드하세요.

예제 재현

공공 픽스처 다운로드

JSON 번들은 타입이 지정된 이벤트 계약을 포함합니다. illustrative 입력 행, 정확한 SQL, 예상 출력, 검토 참고 사항 및 엔진 버전. CSV에는 표시된 결과가 포함됩니다.

SQL 작동 방식

  1. 1기술적 성공과 승인 검토는 별도로 유지되므로 완료된 API 통화가 제품 품질을 대신할 수 없습니다.
  2. 2승인 분모는 누락된 레이블을 거부로 자동 처리하는 대신 검토되지 않은 실행을 제외합니다.
  3. 3핸드오프, 기간 및 비용은 분명히 높은 완료율 뒤에 운영상의 상충관계를 노출시킵니다.

결정해야 할 극단적인 경우

  • 검토자의 결과에는 팀이나 모델 버전을 비교하기 전에 안정적인 루브릭과 평가자 간 확인이 필요합니다.
  • 자동으로 해결된 쉬운 작업은 수용을 위쪽으로 편향시킬 수 있습니다. 변경되면 작업 난이도별로 분류합니다.
  • 명시적으로 승인되지 않는 한 원시 프롬프트, 완료 및 민감한 도구 결과를 이벤트에서 제외하세요.

추천 대시보드

  • 막대: 워크플로별 수락 및 사람의 전달을 검토했습니다.
  • 추세: 모델 출시 또는 프롬프트 출시 이후 수용
  • 표: 통제된 검토자 결과별로 그룹화된 실행

알림 안내

릴리스 후 승인이 떨어지거나 핸드오프가 증가하면 성숙한 코호트를 검토합니다. 사용자가 직면하는 오류 또는 안전 경계에 대해서만 페이지입니다.

알림 설정 읽기

레시피를 활용해 보세요

관련 계측 및 가이드

소스 데이터 정의

이 분석을 위한 이벤트 스키마

분석 계속하기

실제 이벤트에서 실행

테이블을 만들고, 필드를 조정하고, 결과를 저장하세요.

무료로 시작하고, 구조화된 이벤트를 보내고, 쿼리 결과를 차트, 공유 대시보드 위젯 또는 알림 입력으로 사용하세요.

API 키 받기