Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Hora de finalización de la evaluación en UTC. |
| workflow_name | Utf8 | Nombre del flujo de trabajo de IA limitado. |
| prompt_version | Utf8 | Versión de política o aviso revisado. |
| model_name | Utf8 | Nombre del modelo acotado. |
| quality_score | Float64 | Puntuación normalizada de un evaluador documentado. |
| quality_passed | Boolean | Si la ejecución superó el umbral de calidad revisado. |
| accepted_without_edit | Boolean | Si un usuario aceptó el resultado sin editarlo. |
| human_handoff | Boolean | Si el flujo de trabajo escaló a una persona. |
| cost_usd | Float64 | Costo del modelo normalizado para la ejecución. |
| environment | Utf8 | Entorno de implementación. |
Copiar la consulta
SELECT
workflow_name,
prompt_version,
COUNT(*) AS evaluated_runs,
100.0 * SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS quality_pass_rate_pct,
100.0 * SUM(CASE WHEN accepted_without_edit THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS acceptance_rate_pct,
100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS handoff_rate_pct,
AVG(quality_score) AS average_quality_score,
SUM(cost_usd) / NULLIF(
SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END),
0
) AS cost_per_quality_pass_usd
FROM ai_quality_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
AND environment = 'production'
GROUP BY workflow_name, prompt_version
ORDER BY workflow_name, prompt_version;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
Calidad de IA por versión inmediata
La versión 4 tiene tasas de aprobación y aceptación de mayor calidad sin transferencias observadas.
| workflow_name | prompt_version | evaluated_runs | quality_pass_rate_pct | acceptance_rate_pct | handoff_rate_pct | average_quality_score | cost_per_quality_pass_usd |
|---|---|---|---|---|---|---|---|
| support_reply | support-v3 | 5 | 60 | 60 | 40 | 0,69 | 0,03 |
| support_reply | support-v4 | 5 | 80 | 80 | 0 | 0,83 | 0,03 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1La versión rápida es un campo de evento explícito, lo que hace que las comparaciones de implementación sean reproducibles.
- 2La aprobación de calidad, la aceptación del producto y la tasa de transferencia muestran diferentes aspectos de la utilidad.
- 3El costo se divide por resultados de calidad exitosos en lugar de por ejecuciones brutas, lo que evita que las fallas baratas parezcan eficientes.
Casos extremos para decidir
- Mantenga estables las definiciones y los umbrales del evaluador en las versiones comparadas.
- Separe las puntuaciones de los evaluadores fuera de línea de la aceptación real del usuario en lugar de tratarlas como verdad sobre el terreno.
- Segmente por dificultad de la tarea o cohorte de clientes cuando las versiones rápidas reciban un tráfico materialmente diferente.
Panel recomendado
- Barras: calidad y tasa de aceptación por prompt_version
- Tendencia: tasa de transferencia con anotaciones de implementación
- Tabla: tiradas evaluadas y coste por pasada de calidad
Guía de alerta
Alerta sobre una regresión sostenida de calidad o aceptación solo después de que la nueva versión alcance un volumen de evaluación revisado.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Continuar el análisis
Calcular el costo de LLM por característica y modelo
Atribuya el gasto del modelo, los tokens, el volumen de solicitudes y el costo por solicitud a las características del producto.
Receta abiertaMedir las producciones de IA aceptadas por dólar
Conecte el gasto modelo con resultados de productos aceptados, ahorrados o útiles.
Receta abiertaMedir el ahorro de caché de LLM y el costo de reintento
Compare las solicitudes almacenadas en caché, el volumen de reintentos y el gasto estimado por modelo para encontrar costos de IA evitables.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.