Saltar al contenido
Telemetry
IA y LLM receta SQL

Encuentre regresiones de calidad de IA por versión de solicitud

Compare la calidad, la aceptación, la transferencia y el costo evaluados según la versión solicitada.

Intermedioai_quality_eventsRevisado 2026-07-28Probado con Apache DataFusion 45.2.0

Revisado por el equipo de producto Telemetry en . Compatibilidad con SQL, contrato de eventos, resultados sintéticos y advertencias operativas. Revisar los estándares y la propiedad

Pregunta respondida

¿La nueva versión del mensaje mejoró la calidad sin aumentar las transferencias humanas?

La latencia y el costo del token no pueden determinar si un flujo de trabajo de IA es útil. Este patrón se une a una versión de aviso limitada con resultados de calidad revisados ​​para que se pueda evaluar una implementación con respecto a su predecesor.

Contrato de evento

Campos que espera la consulta

CampoTipoPor que existe
timestamp_utcTimestampHora de finalización de la evaluación en UTC.
workflow_nameUtf8Nombre del flujo de trabajo de IA limitado.
prompt_versionUtf8Versión de política o aviso revisado.
model_nameUtf8Nombre del modelo acotado.
quality_scoreFloat64Puntuación normalizada de un evaluador documentado.
quality_passedBooleanSi la ejecución superó el umbral de calidad revisado.
accepted_without_editBooleanSi un usuario aceptó el resultado sin editarlo.
human_handoffBooleanSi el flujo de trabajo escaló a una persona.
cost_usdFloat64Costo del modelo normalizado para la ejecución.
environmentUtf8Entorno de implementación.
DataFusionSQL

Copiar la consulta

sql
SELECT
  workflow_name,
  prompt_version,
  COUNT(*) AS evaluated_runs,
  100.0 * SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS quality_pass_rate_pct,
  100.0 * SUM(CASE WHEN accepted_without_edit THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS acceptance_rate_pct,
  100.0 * SUM(CASE WHEN human_handoff THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS handoff_rate_pct,
  AVG(quality_score) AS average_quality_score,
  SUM(cost_usd) / NULLIF(
    SUM(CASE WHEN quality_passed THEN 1 ELSE 0 END),
    0
  ) AS cost_per_quality_pass_usd
FROM ai_quality_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
  AND environment = 'production'
GROUP BY workflow_name, prompt_version
ORDER BY workflow_name, prompt_version;

Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.

Resultado de la consulta

Calidad de IA por versión inmediata

La versión 4 tiene tasas de aprobación y aceptación de mayor calidad sin transferencias observadas.

workflow_nameprompt_versionevaluated_runsquality_pass_rate_pctacceptance_rate_pcthandoff_rate_pctaverage_quality_scorecost_per_quality_pass_usd
support_replysupport-v356060400,690,03
support_replysupport-v45808000,830,03

Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.

AI quality by prompt version: gráfico estático de valores sintéticos de quality_pass_rate_pct del resultado del ejemplo Find AI Quality Regressions by Prompt Version
SVG indexable de la salida del ejemplo determinista. Descárguelo para ver un artículo, un runbook o una revisión de diseño con atribución.

Reproducir el ejemplo

Descargar el accesorio público

El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.

Cómo funciona el SQL

  1. 1La versión rápida es un campo de evento explícito, lo que hace que las comparaciones de implementación sean reproducibles.
  2. 2La aprobación de calidad, la aceptación del producto y la tasa de transferencia muestran diferentes aspectos de la utilidad.
  3. 3El costo se divide por resultados de calidad exitosos en lugar de por ejecuciones brutas, lo que evita que las fallas baratas parezcan eficientes.

Casos extremos para decidir

  • Mantenga estables las definiciones y los umbrales del evaluador en las versiones comparadas.
  • Separe las puntuaciones de los evaluadores fuera de línea de la aceptación real del usuario en lugar de tratarlas como verdad sobre el terreno.
  • Segmente por dificultad de la tarea o cohorte de clientes cuando las versiones rápidas reciban un tráfico materialmente diferente.

Panel recomendado

  • Barras: calidad y tasa de aceptación por prompt_version
  • Tendencia: tasa de transferencia con anotaciones de implementación
  • Tabla: tiradas evaluadas y coste por pasada de calidad

Guía de alerta

Alerta sobre una regresión sostenida de calidad o aceptación solo después de que la nueva versión alcance un volumen de evaluación revisado.

Leer configuración de alerta

Pon la receta a trabajar

Instrumentación y guías relacionadas.

Continuar el análisis

Ejecútelo en eventos reales.

Crea una tabla, adapta los campos y guarda el resultado.

Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.

Obtén una clave API