Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Hora de finalización de la evaluación en UTC. |
| pipeline_version | Utf8 | Recuperador versionado, índice y configuración de avisos. |
| test_case_id | Utf8 | Identificador de caso de evaluación estable. |
| relevant_document_retrieved | Boolean | Resultado de relevancia de recuperación revisado. |
| answer_grounded | Boolean | Resultado de respuesta fundamentada revisado. |
| retrieval_latency_ms | Int64 | Latencia de la etapa de recuperación en milisegundos. |
| cost_usd | Float64 | Costo de evaluación estimado versionado en USD. |
| environment | Utf8 | Entorno de evaluación o producción. |
Copiar la consulta
SELECT
pipeline_version,
COUNT(*) AS test_cases,
100.0 * SUM(CASE WHEN relevant_document_retrieved THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS retrieval_relevance_pct,
100.0 * SUM(CASE WHEN answer_grounded THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS grounded_answer_pct,
AVG(retrieval_latency_ms) AS avg_retrieval_latency_ms,
SUM(cost_usd) AS evaluation_cost_usd
FROM rag_evaluation_events
WHERE timestamp_utc >= now() - INTERVAL '30 days'
AND environment = 'evaluation'
GROUP BY pipeline_version
ORDER BY grounded_answer_pct DESC, retrieval_relevance_pct DESC, pipeline_version;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
Resultados de recuperación y puesta a tierra de RAG
La versión dos mejora ambas tarifas revisadas en el conjunto de evaluación sintética y cuesta un poco más.
| pipeline_version | test_cases | retrieval_relevance_pct | grounded_answer_pct | avg_retrieval_latency_ms | evaluation_cost_usd |
|---|---|---|---|---|---|
| rag-v2 | 4 | 75 | 75 | 95 | 0,05 |
| rag-v1 | 4 | 50 | 50 | 120 | 0,04 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1La versión de canalización debe identificar el recuperador, la instantánea del índice, el reclasificador y el mensaje de respuesta utilizados para la prueba.
- 2La relevancia de la recuperación y la fundamentación de la respuesta permanecen separadas porque un buen documento aún puede producir una respuesta sin fundamento.
- 3La latencia y el costo mantienen la comparación de calidad conectada a las limitaciones de producción.
Casos extremos para decidir
- Utilice los mismos casos de prueba versionados en todas las canalizaciones e informe los casos recién agregados o eliminados.
- Los calificadores humanos y basados en modelos necesitan rúbricas documentadas, calibración y revisión de desacuerdos.
- No almacene pasajes de fuentes privadas ni respuestas sin procesar en telemetría general de forma predeterminada.
Panel recomendado
- Barras apiladas: retrieval_relevance_pct y grounded_answer_pct según versión
- Tendencia: resultados de la evaluación a medida que cambia el conjunto de pruebas
- Tabla: latencia, costo, recuento de pruebas y versión del calificador
Guía de alerta
Utilice una puerta de lanzamiento de evaluación con un recuento mínimo de pruebas y una tolerancia de regresión revisada en lugar de una alerta de paginación de producción.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Definir los datos de origen
Esquemas de eventos para este análisis.
Continuar el análisis
Calcular el costo de LLM por característica y modelo
Atribuya el gasto del modelo, los tokens, el volumen de solicitudes y el costo por solicitud a las características del producto.
Receta abiertaMedir las producciones de IA aceptadas por dólar
Conecte el gasto modelo con resultados de productos aceptados, ahorrados o útiles.
Receta abiertaMedir el ahorro de caché de LLM y el costo de reintento
Compare las solicitudes almacenadas en caché, el volumen de reintentos y el gasto estimado por modelo para encontrar costos de IA evitables.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.