Saltar al contenido
Telemetry
Para equipos que miden los resultados de los agentes más allá del éxito de la API

Calidad y evaluación del agente de IA

Conecte las ejecuciones de agentes, los resultados de los revisores, las transferencias humanas, los costos y los cambios de versiones a un flujo de trabajo repetible de evaluación de calidad.

Revisado por el equipo de producto Telemetry en . Contrato de evento, análisis recomendado y límites de privacidad. Revisar los estándares y la propiedad

¿Por qué esto funciona?
  • Mantenga la finalización técnica separada del éxito de la tarea revisada.
  • Compare las tasas de aceptación, revisión, rechazo y transferencia humana.
  • Realice un seguimiento del coste y la latencia además de la calidad en lugar de optimizarlos únicamente.
Ruta de medición

Pasar de la ejecución de un agente a una decisión de liberación

Un bucle de calidad útil preserva el contexto de producción versionado, separa las puntuaciones automatizadas de los resultados revisados y mantiene visible la cobertura evaluada.

  1. 1

    Ejecución versionada

    Registre el flujo de trabajo, el modelo, el aviso, las herramientas, la versión, el costo y el estado del terminal.

  2. 2

    Resultado revisado

    Adjunte una versión de la rúbrica, el tipo de evaluador, la puntuación y el resultado de aceptación o transferencia.

  3. 3

    Comparación de SQL

    Compare la calidad, la cobertura, las fallas, la latencia y el costo en la misma población elegible.

  4. 4

    Decisión de liberación

    Inspeccione los ejemplos fallidos y el impacto del producto antes de promocionarlos o retroceder.

Caso de uso versus plantilla

Esta página explica qué medir y por qué.

Utilice la guía de casos de uso para elegir resultados, límites de eventos y preguntas de análisis. Abra la plantilla correspondiente cuando esté listo para un breve resumen de implementación de copiar y pegar.

Abierto Plantilla de observabilidad de agentes de IA

Aviso del agente

Pega esto en tu agente de codificación

Reemplazar YOUR_API_KEY después del registro, solicite al agente que ejecute el flujo del producto y verifique los primeros eventos.

aviso del agente

Mensaje de configuración AI Agent Quality and Evaluation

text
Instrumente la calidad y evaluación del agente de IA con Telemetry.

Utilice /skill.md y esta clave API Telemetry: YOUR_API_KEY

Registre los resultados del agente terminal con run_id, workflow, model, prompt_version, release, status, reviewer_outcome, human_handoff, duration_ms, input_tokens, output_tokens, estimated_cost_usd, retry_count y controlados. error_type. Registre los resultados de la herramienta por separado con un run_id compartido.

Cree paneles de control para el éxito técnico, la aceptación revisada, la revisión y el rechazo, la transferencia humana, el costo por resultado aceptado y la calidad por lanzamiento. Excluya las ejecuciones no revisadas del denominador de aceptación revisada.

No registre indicaciones sin procesar, finalizaciones, cargas útiles de herramientas, secretos o datos personales a menos que el propietario de los datos haya aprobado explícitamente el propósito y la retención.

Pasos de configuración

  1. 1Defina una rúbrica de éxito a nivel de tarea y resultados controlados del revisor.
  2. 2Registre un resultado de terminal por ejecución de agente más eventos de herramienta y transferencia.
  3. 3Segmente cohortes maduras revisadas por flujo de trabajo, modelo, solicitud y lanzamiento.
  4. 4Revise las regresiones con ejemplos fuera de la telemetría antes de cambiar la automatización.

Eventos para capturar

agent_run_completedagent_output_reviewedagent_handoff_requestedagent_tool_completedagent_release_evaluated

Preguntas desbloqueadas

  • ¿Qué flujos de trabajo se completan técnicamente pero no pasan la revisión humana?
  • ¿Dónde aumenta la transferencia humana después de una liberación?
  • ¿Qué modelo produce resultados aceptados a un costo sostenible?

Puntos de partida del esquema de eventos

Revise el detalle de la fila, el límite de emisión, los tipos requeridos, las clases de privacidad, la carga útil de ejemplo y la lista de verificación de validación antes de adaptar una consulta o fragmento a producción.

Función relacionada del producto

Continúe este flujo de trabajo en Monitoreo de agentes de IA

Conecte las ejecuciones de agentes, el uso de herramientas, el costo del modelo, la calidad y los resultados del producto con SQL revisable.

Recetas SQL relacionadas

Responde la siguiente pregunta con SQL

Ejecute la consulta en los campos estructurados de este flujo de trabajo, inspeccione el resultado del ejemplo y convierta una respuesta útil en un panel o alerta.

Explorar todas las recetas
colecciones completasIA y LLM SQL

Siguiente paso

Cree la clave API que utilizará su agente

El plan gratuito es suficiente para ejecutar el mensaje, enviar eventos de prueba y revisar el primer panel.

Páginas relacionadas