Saltar al contenido
Telemetry
IA y LLM receta SQL

Mida el éxito de las tareas de los agentes de IA y la transferencia humana

Compare el éxito de las tareas de los agentes, la aceptación de los revisores, el costo, la latencia y la tasa de transferencia humana por flujo de trabajo y modelo.

Intermedioagent_run_outcomesRevisado 2026-07-28Probado con Apache DataFusion 45.2.0

Revisado por el equipo de producto Telemetry en . Compatibilidad con SQL, contrato de eventos, resultados sintéticos y advertencias operativas. Revisar los estándares y la propiedad

Pregunta respondida

¿Qué flujos de trabajo de agentes finalizan exitosamente y producen resultados aceptados?

Una ejecución de agente técnicamente completa no es necesariamente útil. Este patrón mantiene el éxito del tiempo de ejecución además de un resultado revisado y una transferencia humana, de modo que la calidad de la automatización se mide en el límite del flujo de trabajo.

Contrato de evento

Campos que espera la consulta

CampoTipoPor que existe
timestamp_utcTimestampHora de ejecución del agente terminal en UTC.
workflowUtf8Flujo de trabajo de producto estable o categoría de tarea.
modelUtf8Identificador de modelo registrado a partir de la respuesta del proveedor.
statusUtf8éxito o fracaso en la ejecución técnica.
reviewer_outcomeUtf8aceptado, revisado, rechazado o not_reviewed.
human_handoffBooleanSi un humano se hizo cargo de la tarea.
duration_msFloat64Duración del flujo de trabajo de un extremo a otro.
estimated_cost_usdFloat64Costo del modelo estimado normalizado para la ejecución.
DataFusionSQL

Copiar la consulta

sql
SELECT
  workflow,
  model,
  COUNT(*) AS runs,
  100.0 * SUM(CASE WHEN status = 'success' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS technical_success_rate_pct,
  100.0 * SUM(CASE WHEN reviewer_outcome = 'accepted' THEN 1 ELSE 0 END)
    / NULLIF(SUM(CASE
      WHEN reviewer_outcome <> 'not_reviewed' THEN 1 ELSE 0
    END), 0) AS reviewed_acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS human_handoff_rate_pct,
  AVG(duration_ms) AS average_duration_ms,
  SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0) AS cost_per_run_usd
FROM agent_run_outcomes
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY workflow, model
HAVING COUNT(*) >= 20
ORDER BY reviewed_acceptance_rate_pct, runs DESC;

Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.

Resultado de la consulta

Aceptación de agentes revisada por flujo de trabajo.

La revisión de reembolso se completa técnicamente, pero necesita mucha más revisión o control humano que los otros flujos de trabajo.

workflowmodelrunstechnical_success_rate_pctreviewed_acceptance_rate_pcthuman_handoff_rate_pctaverage_duration_mscost_per_run_usd
support_triageconfigured-model-a184098,186,418,248200,04
refund_reviewconfigured-model-b62096,868,742,981100,07
knowledge_draftconfigured-model-a94099,291,68,439100,04

Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.

Reviewed agent acceptance by workflow: gráfico estático de valores sintéticos de reviewed_acceptance_rate_pct del resultado del ejemplo Measure AI Agent Task Success and Human Handoff
SVG indexable de la salida del ejemplo determinista. Descárguelo para ver un artículo, un runbook o una revisión de diseño con atribución.

Reproducir el ejemplo

Descargar el accesorio público

El paquete JSON incluye el contrato de evento escrito, illustrative filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.

Cómo funciona el SQL

  1. 1El éxito técnico y la aceptación revisada permanecen separados, por lo que una llamada API completa no puede sustituir la calidad del producto.
  2. 2El denominador de aceptación excluye las tiradas no revisadas en lugar de tratar silenciosamente las etiquetas faltantes como rechazo.
  3. 3La transferencia, la duración y el costo exponen el equilibrio operativo detrás de una tasa de finalización aparentemente alta.

Casos extremos para decidir

  • Los resultados de los revisores necesitan una rúbrica estable y controles entre evaluadores antes de comparar equipos o versiones de modelos.
  • Las tareas fáciles resueltas automáticamente pueden sesgar la aceptación hacia arriba; segmentar por dificultad de la tarea cuando cambia.
  • Mantenga las indicaciones sin procesar, las finalizaciones y los resultados de herramientas confidenciales fuera del evento a menos que se apruebe explícitamente.

Panel recomendado

  • Barras: aceptación revisada y transferencia humana por flujo de trabajo
  • Tendencia: aceptación después del lanzamiento del modelo o pronto
  • Tabla: series agrupadas por resultado del revisor controlado

Guía de alerta

Revisar cohortes maduras cuando la aceptación disminuye o la transferencia aumenta después de un lanzamiento; página solo para un límite de seguridad o falla de cara al usuario.

Leer configuración de alerta

Pon la receta a trabajar

Instrumentación y guías relacionadas.

Definir los datos de origen

Esquemas de eventos para este análisis.

Continuar el análisis

Ejecútelo en eventos reales.

Crea una tabla, adapta los campos y guarda el resultado.

Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.

Obtén una clave API