Saltar al contenido
Telemetry
IA y LLM receta SQL

Evaluar la calidad de recuperación de RAG por versión

Compare la recuperación de documentos relevantes, las respuestas fundamentadas, la latencia de recuperación y el costo de evaluación en todas las versiones del canal RAG.

Intermediorag_evaluation_eventsRevisado 2026-07-28Probado con Apache DataFusion 45.2.0

Revisado por el equipo de producto Telemetry en . Compatibilidad con SQL, contrato de eventos, resultados sintéticos y advertencias operativas. Revisar los estándares y la propiedad

Pregunta respondida

¿Mejoró el nuevo oleoducto RAG las tasas de recuperación y respuesta en tierra?

La calidad del RAG no es una puntuación. Esta consulta mantiene juntos la relevancia de la recuperación, la conexión a tierra de la respuesta, la latencia y el costo de la evaluación para un conjunto de pruebas versionado, de modo que se pueda comparar una ganancia de calidad aparente con respecto a las compensaciones operativas.

Contrato de evento

Campos que espera la consulta

CampoTipoPor que existe
timestamp_utcTimestampHora de finalización de la evaluación en UTC.
pipeline_versionUtf8Recuperador versionado, índice y configuración de avisos.
test_case_idUtf8Identificador de caso de evaluación estable.
relevant_document_retrievedBooleanResultado de relevancia de recuperación revisado.
answer_groundedBooleanResultado de respuesta fundamentada revisado.
retrieval_latency_msInt64Latencia de la etapa de recuperación en milisegundos.
cost_usdFloat64Costo de evaluación estimado versionado en USD.
environmentUtf8Entorno de evaluación o producción.
DataFusionSQL

Copiar la consulta

sql
SELECT
  pipeline_version,
  COUNT(*) AS test_cases,
  100.0 * SUM(CASE WHEN relevant_document_retrieved THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS retrieval_relevance_pct,
  100.0 * SUM(CASE WHEN answer_grounded THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS grounded_answer_pct,
  AVG(retrieval_latency_ms) AS avg_retrieval_latency_ms,
  SUM(cost_usd) AS evaluation_cost_usd
FROM rag_evaluation_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
  AND environment = 'evaluation'
GROUP BY pipeline_version
ORDER BY grounded_answer_pct DESC, retrieval_relevance_pct DESC, pipeline_version;

Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.

Resultado de la consulta

Resultados de recuperación y puesta a tierra de RAG

La versión dos mejora ambas tarifas revisadas en el conjunto de evaluación sintética y cuesta un poco más.

pipeline_versiontest_casesretrieval_relevance_pctgrounded_answer_pctavg_retrieval_latency_msevaluation_cost_usd
rag-v247575950,05
rag-v1450501200,04

Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.

RAG retrieval and grounding outcomes: gráfico estático de valores sintéticos de retrieval_relevance_pct del resultado del ejemplo Evaluate RAG Retrieval Quality by Version
SVG indexable de la salida del ejemplo determinista. Descárguelo para ver un artículo, un runbook o una revisión de diseño con atribución.

Reproducir el ejemplo

Descargar el accesorio público

El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.

Cómo funciona el SQL

  1. 1La versión de canalización debe identificar el recuperador, la instantánea del índice, el reclasificador y el mensaje de respuesta utilizados para la prueba.
  2. 2La relevancia de la recuperación y la fundamentación de la respuesta permanecen separadas porque un buen documento aún puede producir una respuesta sin fundamento.
  3. 3La latencia y el costo mantienen la comparación de calidad conectada a las limitaciones de producción.

Casos extremos para decidir

  • Utilice los mismos casos de prueba versionados en todas las canalizaciones e informe los casos recién agregados o eliminados.
  • Los calificadores humanos y basados en modelos necesitan rúbricas documentadas, calibración y revisión de desacuerdos.
  • No almacene pasajes de fuentes privadas ni respuestas sin procesar en telemetría general de forma predeterminada.

Panel recomendado

  • Barras apiladas: retrieval_relevance_pct y grounded_answer_pct según versión
  • Tendencia: resultados de la evaluación a medida que cambia el conjunto de pruebas
  • Tabla: latencia, costo, recuento de pruebas y versión del calificador

Guía de alerta

Utilice una puerta de lanzamiento de evaluación con un recuento mínimo de pruebas y una tolerancia de regresión revisada en lugar de una alerta de paginación de producción.

Leer configuración de alerta

Pon la receta a trabajar

Instrumentación y guías relacionadas.

Definir los datos de origen

Esquemas de eventos para este análisis.

Continuar el análisis

Ejecútelo en eventos reales.

Crea una tabla, adapta los campos y guarda el resultado.

Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.

Obtén una clave API