Evaluación RAG con SQL
La generación de recuperación aumentada tiene al menos dos límites de calidad distintos: si el sistema recuperó evidencia relevante y si la respuesta final se mantuvo basada en esa evidencia. Combinarlos en una sola partitura oculta la parte del proceso que cambió.
Versionar el contrato de evaluación
Registre un evento de terminal por caso de prueba con pipeline_version, test_case_id, relevant_document_retrieved, answer_grounded, retrieval_latency_ms, cost_usd, versión de niveladora y entorno. La versión de canalización debe identificar el recuperador, la instantánea del índice, el reclasificador y el mensaje de respuesta con suficiente precisión para reproducir una comparación.
Utilice el mismo conjunto de pruebas versionado en todas las canalizaciones. Documente la rúbrica de calificación y revise los desacuerdos entre evaluadores humanos y basados en modelos. No incluya pasajes de fuentes privadas, preguntas sin procesar de los usuarios, respuestas completas de modelos, secretos o resultados de herramientas sin restricciones en la telemetría general.
Comparar calidad y limitaciones
El Receta de calidad RAG SQL calcula la tasa de relevancia de recuperación, la tasa de respuesta fundamentada, la latencia de recuperación promedio y el costo de evaluación para cada versión de canalización. Su fijación determinista muestra una versión que mejora los índices de calidad revisados al tiempo que cambia el coste.
Interprete las columnas por separado:
- La mala relevancia de la recuperación apunta a la indexación, fragmentación, filtrado, incrustación o clasificación.
- La recuperación relevante con una base deficiente apunta hacia la construcción del contexto, las indicaciones o la evaluación de respuestas.
- Es posible que una mejor calidad con una latencia o un costo inaceptables no esté lista para la producción.
- Un pequeño recuento de pruebas debería bloquear la conclusión de una publicación, no ocultarse detrás de un porcentaje.
Ejecute el dispositivo en el navegador SQL parque infantil, luego reemplace sus casos de prueba con un conjunto de evaluación versionado.
Utilice una puerta de liberación
La evaluación de RAG normalmente pertenece a una revisión de lanzamiento y no a una página de guardia. Establezca el recuento mínimo de pruebas, las tolerancias de regresión, la versión del calificador y los cortes requeridos antes de comparar versiones. Mantenga los comentarios de producción como una señal separada con sus propias reglas de consentimiento y privacidad.
El Caso de uso de evaluación de la calidad de la IA cubre transferencias humanas, resultados aceptados y versiones rápidas. El Colección de recetas de IA y LLM agrega costo de modelo, latencia, caché, llamada de herramientas y análisis de ejecución de agentes.