공통 이벤트 계약
이러한 쿼리를 재사용 가능하게 유지하는 필드
- timestamp_utc, run_id, 기능, 공급자, 모델 및 상태
- input_tokens, output_tokens, estimated_cost_usd 및 latency_ms
- tool_name, retry_count, cache_hit, reviewer_outcome 및 human_handoff
SQL 이전의 정의
쿼리가 대신 내릴 수 없는 결정
- 1가능하면 이벤트 제작자 외부에서 모델 가격 버전을 유지하세요.
- 2기본적으로 원시 프롬프트를 저장하지 않고 요청을 제품 결과에 연결합니다.
- 3의도적인 사용자 재생성과 별도의 공급자 재시도가 가능합니다.
권장 순서
먼저 탐지를 구축한 다음 진단을 구축하세요.
분석 패턴
결과를 통해 결정을 설명
유용한 출력 측정
요청 볼륨만 최적화하는 대신 토큰, 대기 시간 및 공급자 비용을 승인되거나 완료된 제품 결과에 연결하세요.
실행 경로 유지
비용이 많이 들거나 신뢰할 수 없는 분기가 계속 표시되도록 실행, 모델, 도구, 캐시 및 재시도 필드를 유지하세요.
버전 변경 가정
모델 및 가격 버전을 기록하여 과거 비용 및 품질 비교를 재현할 수 있습니다.
완전한 레시피
쿼리를 복사한 다음 가정 검증
기능 및 모델별로 LLM 비용 계산
모델 지출, 토큰, 요청량, 요청당 비용을 제품 기능에 반영합니다.
LLM 지출을 주도하는 제품 기능과 모델은 무엇입니까?
SQL 및 결과를 참조하세요.달러당 허용되는 AI 출력 측정
모델 지출을 수락, 저장 또는 기타 유용한 제품 결과에 연결합니다.
어떤 모델과 기능 조합이 달러당 가장 많은 수용 결과를 생성합니까?
SQL 및 결과를 참조하세요.LLM 캐시 절감 및 재시도 비용 측정
캐시된 요청, 재시도량, 모델별 예상 지출을 비교하여 피할 수 있는 AI 비용을 찾아보세요.
재시도 및 캐시 누락과 관련된 모델 비용은 얼마입니까?
SQL 및 결과를 참조하세요.첫 번째 토큰까지 LLM 시간 측정
모델 및 기능별로 스트리밍 응답성과 총 생성 대기 시간을 비교하세요.
출력이 시작되기 전에 어떤 모델과 기능 조합이 느리게 느껴지나요?
SQL 및 결과를 참조하세요.반복되는 AI 에이전트 도구 Loops 감지
성공적인 결과에 도달하지 못한 채 소규모 도구 세트를 반복적으로 호출하는 에이전트 실행을 찾아보세요.
반복적인 도구 루프에서 멈춘 것처럼 보이는 에이전트 실행은 무엇입니까?
SQL 및 결과를 참조하세요.AI 에이전트 작업 성공 및 인간 핸드오프 측정
워크플로와 모델별로 에이전트 작업 성공, 검토자 수락, 비용, 대기 시간, 사람 핸드오프 비율을 비교하세요.
어떤 상담사 워크플로가 성공적으로 완료되고 허용되는 결과를 생성합니까?
SQL 및 결과를 참조하세요.프롬프트 버전별 AI 품질 회귀 찾기
프롬프트 버전별로 평가된 품질, 수용도, 전달 및 비용을 비교합니다.
새로운 프롬프트 버전은 사람의 핸드오프를 늘리지 않고도 품질을 향상시켰습니까?
SQL 및 결과를 참조하세요.버전별 RAG 검색 품질 평가
RAG 파이프라인 버전 전체에서 관련 문서 검색, 근거 있는 답변, 검색 대기 시간 및 평가 비용을 비교하세요.
새로운 RAG 파이프라인이 검색 및 근거 있는 답변 비율을 향상시켰습니까?
SQL 및 결과를 참조하세요.