AI agent observability template: 구현에서 결정까지
프롬프트를 구현 개요로 간주하세요. 유용한 아티팩트는 코드만 복사되는 것이 아니라 신뢰할 수 있는 답변을 생성하는 검토된 이벤트 계약입니다.
- 1
경계를 설정하세요
Instrument the point where agent_run_started becomes final.
- 2
계약 생성
Start with agent_run_started, agent_tool_called, agent_run_completed and keep every field typed, bounded, and privacy-reviewed.
- 3
픽스처 실행
집계 결과에 의존하기 전에 알려진 성공, 실패, 재시도 및 빈 결과 사례를 연습해 보세요.
- 4
질문에 답하세요
가장 자주 실패하는 도구는 무엇입니까?
템플릿과 사용 사례
이 템플릿으로 이벤트 추가하기
측정 목표가 이미 명확한 경우 이 템플릿을 복사하세요. 일치하는 사용 사례 가이드를 사용하여 이벤트 경계, 성공 정의 및 결과 SQL이 지원해야 하는 결정을 검토하세요.
템플릿
이것을 코딩 에이전트에 붙여넣으세요.
바꾸기 YOUR_API_KEY, 로컬에서 흐름을 실행한 다음 생성된 이벤트 및 대시보드를 확인합니다.
AI 에이전트 옵저버빌리티 템플릿
이 AI 에이전트 워크플로에 Telemetry를 추가하세요.
/skill.md와 다음 Telemetry API 키를 사용하세요: YOUR_API_KEY
다음을 기록하세요:
1. agent_run_started: agent_name, route, user_id, team_id, model, provider, input_category.
2. agent_tool_called: tool_name, status, latency_ms, retry_count, error_type.
3. agent_run_completed: status, duration_ms, total_tokens, estimated_cost_usd, output_category와 가능한 경우 accepted.
4. agent_run_failed: error_type, failed_step, retry_count, duration_ms.
실행량, 도구별 실패율, p95 소요 시간, feature별 모델 비용, 승인된 출력의 비율을 계산하는 SQL 쿼리를 만드세요.
명시적인 승인이 없는 한 원시 프롬프트, 완성 결과, 비밀, 인증 헤더, 개인 데이터는 기록하지 마세요.캡처할 이벤트
검증 체크리스트
완전한 계측 단계가 남기는 것
이벤트
합성 이벤트는 안정적인 이름과 필드 유형을 사용하여 의도한 테이블에 도달합니다.
쿼리
첫 번째 SQL 쿼리는 명시적인 시간 범위를 사용하여 그럴듯한 행을 반환합니다.
조회수
대시보드는 실제 필드를 사용하며 변경 사항을 설명하기에 충분한 컨텍스트를 포함합니다.
안전
프롬프트, 본문, 자격 증명, 서명 및 비공개 콘텐츠에 대한 수정 여부를 확인했습니다.
이벤트 스키마 예제
이 워크플로의 이벤트 스키마
쿼리 또는 스니펫을 프로덕션에 적용하기 전에 행 그레인, 방출 경계, 필수 유형, 개인 정보 보호 클래스, 예제 페이로드 및 유효성 검사 체크리스트를 검토하세요.
관련 제품 기능
이 워크플로를 다음에서 계속하세요. AI 에이전트 모니터링
검토 가능한 SQL을 사용하여 에이전트 실행, 도구 사용, 모델 비용, 품질 및 제품 결과를 연결하세요.
관련 SQL 레시피
더 많은 SQL 예제
이 워크플로의 구조화된 필드에 대해 쿼리를 실행하고, 예제 결과를 검사하고, 유용한 답변을 대시보드 또는 알림으로 전환하세요.
상호 연관된 워크플로우 타임라인 재구성
최근 실패한 워크플로에서 순서대로 어떤 일이 발생했나요?
레시피 열기프롬프트 버전별 AI 품질 회귀 찾기
새로운 프롬프트 버전은 사람의 핸드오프를 늘리지 않고도 품질을 향상시켰습니까?
레시피 열기중첩된 AI 도구 호출 이벤트 쿼리
가장 많이 실패한 호출과 관련된 AI 도구 및 인수는 무엇입니까?
레시피 열기반복되는 AI 에이전트 도구 Loops 감지
반복적인 도구 루프에서 멈춘 것처럼 보이는 에이전트 실행은 무엇입니까?
레시피 열기기능 및 모델별로 LLM 비용 계산
LLM 지출을 주도하는 제품 기능과 모델은 무엇입니까?
레시피 열기달러당 허용되는 AI 출력 측정
어떤 모델과 기능 조합이 달러당 가장 많은 수용 결과를 생성합니까?
레시피 열기버전별 RAG 검색 품질 평가
새로운 RAG 파이프라인이 검색 및 근거 있는 답변 비율을 향상시켰습니까?
레시피 열기더 많은 템플릿