Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Hora de ejecución del agente terminal en UTC. |
| workflow | Utf8 | Flujo de trabajo de producto estable o categoría de tarea. |
| model | Utf8 | Identificador de modelo registrado a partir de la respuesta del proveedor. |
| status | Utf8 | éxito o fracaso en la ejecución técnica. |
| reviewer_outcome | Utf8 | aceptado, revisado, rechazado o not_reviewed. |
| human_handoff | Boolean | Si un humano se hizo cargo de la tarea. |
| duration_ms | Float64 | Duración del flujo de trabajo de un extremo a otro. |
| estimated_cost_usd | Float64 | Costo del modelo estimado normalizado para la ejecución. |
Copiar la consulta
SELECT
workflow,
model,
COUNT(*) AS runs,
100.0 * SUM(CASE WHEN status = 'success' THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS technical_success_rate_pct,
100.0 * SUM(CASE WHEN reviewer_outcome = 'accepted' THEN 1 ELSE 0 END)
/ NULLIF(SUM(CASE
WHEN reviewer_outcome <> 'not_reviewed' THEN 1 ELSE 0
END), 0) AS reviewed_acceptance_rate_pct,
100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS human_handoff_rate_pct,
AVG(duration_ms) AS average_duration_ms,
SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0) AS cost_per_run_usd
FROM agent_run_outcomes
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY workflow, model
HAVING COUNT(*) >= 20
ORDER BY reviewed_acceptance_rate_pct, runs DESC;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
Aceptación de agentes revisada por flujo de trabajo.
La revisión de reembolso se completa técnicamente, pero necesita mucha más revisión o control humano que los otros flujos de trabajo.
| workflow | model | runs | technical_success_rate_pct | reviewed_acceptance_rate_pct | human_handoff_rate_pct | average_duration_ms | cost_per_run_usd |
|---|---|---|---|---|---|---|---|
| support_triage | configured-model-a | 1840 | 98,1 | 86,4 | 18,2 | 4820 | 0,04 |
| refund_review | configured-model-b | 620 | 96,8 | 68,7 | 42,9 | 8110 | 0,07 |
| knowledge_draft | configured-model-a | 940 | 99,2 | 91,6 | 8,4 | 3910 | 0,04 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, illustrative filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1El éxito técnico y la aceptación revisada permanecen separados, por lo que una llamada API completa no puede sustituir la calidad del producto.
- 2El denominador de aceptación excluye las tiradas no revisadas en lugar de tratar silenciosamente las etiquetas faltantes como rechazo.
- 3La transferencia, la duración y el costo exponen el equilibrio operativo detrás de una tasa de finalización aparentemente alta.
Casos extremos para decidir
- Los resultados de los revisores necesitan una rúbrica estable y controles entre evaluadores antes de comparar equipos o versiones de modelos.
- Las tareas fáciles resueltas automáticamente pueden sesgar la aceptación hacia arriba; segmentar por dificultad de la tarea cuando cambia.
- Mantenga las indicaciones sin procesar, las finalizaciones y los resultados de herramientas confidenciales fuera del evento a menos que se apruebe explícitamente.
Panel recomendado
- Barras: aceptación revisada y transferencia humana por flujo de trabajo
- Tendencia: aceptación después del lanzamiento del modelo o pronto
- Tabla: series agrupadas por resultado del revisor controlado
Guía de alerta
Revisar cohortes maduras cuando la aceptación disminuye o la transferencia aumenta después de un lanzamiento; página solo para un límite de seguridad o falla de cara al usuario.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Definir los datos de origen
Esquemas de eventos para este análisis.
Continuar el análisis
Calcular el costo de LLM por característica y modelo
Atribuya el gasto del modelo, los tokens, el volumen de solicitudes y el costo por solicitud a las características del producto.
Receta abiertaMedir las producciones de IA aceptadas por dólar
Conecte el gasto modelo con resultados de productos aceptados, ahorrados o útiles.
Receta abiertaMedir el ahorro de caché de LLM y el costo de reintento
Compare las solicitudes almacenadas en caché, el volumen de reintentos y el gasto estimado por modelo para encontrar costos de IA evitables.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.