Pasar de la ejecución de un agente a una decisión de liberación
Un bucle de calidad útil preserva el contexto de producción versionado, separa las puntuaciones automatizadas de los resultados revisados y mantiene visible la cobertura evaluada.
- 1
Ejecución versionada
Registre el flujo de trabajo, el modelo, el aviso, las herramientas, la versión, el costo y el estado del terminal.
- 2
Resultado revisado
Adjunte una versión de la rúbrica, el tipo de evaluador, la puntuación y el resultado de aceptación o transferencia.
- 3
Comparación de SQL
Compare la calidad, la cobertura, las fallas, la latencia y el costo en la misma población elegible.
- 4
Decisión de liberación
Inspeccione los ejemplos fallidos y el impacto del producto antes de promocionarlos o retroceder.
Caso de uso versus plantilla
Esta página explica qué medir y por qué.
Utilice la guía de casos de uso para elegir resultados, límites de eventos y preguntas de análisis. Abra la plantilla correspondiente cuando esté listo para un breve resumen de implementación de copiar y pegar.
Aviso del agente
Pega esto en tu agente de codificación
Reemplazar YOUR_API_KEY después del registro, solicite al agente que ejecute el flujo del producto y verifique los primeros eventos.
Mensaje de configuración AI Agent Quality and Evaluation
Instrumente la calidad y evaluación del agente de IA con Telemetry.
Utilice /skill.md y esta clave API Telemetry: YOUR_API_KEY
Registre los resultados del agente terminal con run_id, workflow, model, prompt_version, release, status, reviewer_outcome, human_handoff, duration_ms, input_tokens, output_tokens, estimated_cost_usd, retry_count y controlados. error_type. Registre los resultados de la herramienta por separado con un run_id compartido.
Cree paneles de control para el éxito técnico, la aceptación revisada, la revisión y el rechazo, la transferencia humana, el costo por resultado aceptado y la calidad por lanzamiento. Excluya las ejecuciones no revisadas del denominador de aceptación revisada.
No registre indicaciones sin procesar, finalizaciones, cargas útiles de herramientas, secretos o datos personales a menos que el propietario de los datos haya aprobado explícitamente el propósito y la retención.Pasos de configuración
- 1Defina una rúbrica de éxito a nivel de tarea y resultados controlados del revisor.
- 2Registre un resultado de terminal por ejecución de agente más eventos de herramienta y transferencia.
- 3Segmente cohortes maduras revisadas por flujo de trabajo, modelo, solicitud y lanzamiento.
- 4Revise las regresiones con ejemplos fuera de la telemetría antes de cambiar la automatización.
Eventos para capturar
Preguntas desbloqueadas
- ¿Qué flujos de trabajo se completan técnicamente pero no pasan la revisión humana?
- ¿Dónde aumenta la transferencia humana después de una liberación?
- ¿Qué modelo produce resultados aceptados a un costo sostenible?
Puntos de partida del esquema de eventos
Contratos de eventos para este flujo de trabajo
Revise el detalle de la fila, el límite de emisión, los tipos requeridos, las clases de privacidad, la carga útil de ejemplo y la lista de verificación de validación antes de adaptar una consulta o fragmento a producción.
llm_request_completed
Una solicitud de proveedor de modelo completa.
inspeccionar contratoai_agent_run_completed
Un resultado de terminal por ejecución de agente lógico.
inspeccionar contratoagent_tool_call_completed
Un intento de llamada a herramienta completado dentro de una ejecución de agente.
inspeccionar contratoFunción relacionada del producto
Continúe este flujo de trabajo en Monitoreo de agentes de IA
Conecte las ejecuciones de agentes, el uso de herramientas, el costo del modelo, la calidad y los resultados del producto con SQL revisable.
Recetas SQL relacionadas
Responde la siguiente pregunta con SQL
Ejecute la consulta en los campos estructurados de este flujo de trabajo, inspeccione el resultado del ejemplo y convierta una respuesta útil en un panel o alerta.
Encuentre regresiones de calidad de IA por versión de solicitud
¿La nueva versión del mensaje mejoró la calidad sin aumentar las transferencias humanas?
Receta abiertaMida el éxito de las tareas de los agentes de IA y la transferencia humana
¿Qué flujos de trabajo de agentes finalizan exitosamente y producen resultados aceptados?
Receta abiertaMedir las producciones de IA aceptadas por dólar
¿Qué combinación de modelo y características produce los resultados por dólar más aceptados?
Receta abiertaDetectar bucles repetidos de herramientas de agentes de IA
¿Qué ejecuciones de agentes aparecen atrapadas en un bucle de herramientas repetitivo?
Receta abiertaCalcular el costo de LLM por característica y modelo
¿Qué características y modelos de productos impulsan el gasto en LLM?
Receta abiertaMedir el tiempo de LLM hasta el primer token
¿Qué combinaciones de modelos y características se sienten lentas antes de que comience la producción?
Receta abiertaEvaluar la calidad de recuperación de RAG por versión
¿Mejoró el nuevo oleoducto RAG las tasas de recuperación y respuesta en tierra?
Receta abiertaSiguiente paso
Cree la clave API que utilizará su agente
El plan gratuito es suficiente para ejecutar el mensaje, enviar eventos de prueba y revisar el primer panel.
Páginas relacionadas
Agente de IA Telemetry y observabilidad
Instrumente la telemetría del agente de IA para ejecuciones, llamadas de herramientas, reintentos, latencia, costo del modelo, fallas y resultados aceptados en tablas de eventos listas para SQL.
Abrir páginaOpenAI Monitoreo de costos
Supervise el gasto en OpenAI y LLM por modelo, característica, cliente, latencia, tasa de error y resultado con paneles SQL y alertas de presupuesto.
Abrir páginaMonitoreo de seguridad del agente de IA
Supervise la autorización de herramientas, los rechazos de políticas, las colas de aprobación, las clases de acciones riesgosas y publique cambios sin almacenar indicaciones, credenciales ni cargas útiles de herramientas.
Abrir página