Saltar al contenido
Telemetry
Explorar documentación
GuíasActualizado el 28 de julio de 2026Revisado por los equipos editorial y de producto de Telemetry2 min de lectura

Usa esta documentación con tu agente de programación

Abra un paquete de mensajes enfocados para Claude Code, Codex, Cursor u otro agente de codificación, luego adáptelo al flujo de trabajo que se describe aquí.

En esta página
  1. Versionar el contrato de evaluación
  2. Comparar calidad y limitaciones
  3. Utilice una puerta de liberación

Evaluación RAG con SQL

La generación de recuperación aumentada tiene al menos dos límites de calidad distintos: si el sistema recuperó evidencia relevante y si la respuesta final se mantuvo basada en esa evidencia. Combinarlos en una sola partitura oculta la parte del proceso que cambió.

Versionar el contrato de evaluación

Registre un evento de terminal por caso de prueba con pipeline_version, test_case_id, relevant_document_retrieved, answer_grounded, retrieval_latency_ms, cost_usd, versión de niveladora y entorno. La versión de canalización debe identificar el recuperador, la instantánea del índice, el reclasificador y el mensaje de respuesta con suficiente precisión para reproducir una comparación.

Utilice el mismo conjunto de pruebas versionado en todas las canalizaciones. Documente la rúbrica de calificación y revise los desacuerdos entre evaluadores humanos y basados ​​en modelos. No incluya pasajes de fuentes privadas, preguntas sin procesar de los usuarios, respuestas completas de modelos, secretos o resultados de herramientas sin restricciones en la telemetría general.

Comparar calidad y limitaciones

El Receta de calidad RAG SQL calcula la tasa de relevancia de recuperación, la tasa de respuesta fundamentada, la latencia de recuperación promedio y el costo de evaluación para cada versión de canalización. Su fijación determinista muestra una versión que mejora los índices de calidad revisados ​​al tiempo que cambia el coste.

Interprete las columnas por separado:

  1. La mala relevancia de la recuperación apunta a la indexación, fragmentación, filtrado, incrustación o clasificación.
  2. La recuperación relevante con una base deficiente apunta hacia la construcción del contexto, las indicaciones o la evaluación de respuestas.
  3. Es posible que una mejor calidad con una latencia o un costo inaceptables no esté lista para la producción.
  4. Un pequeño recuento de pruebas debería bloquear la conclusión de una publicación, no ocultarse detrás de un porcentaje.

Ejecute el dispositivo en el navegador SQL parque infantil, luego reemplace sus casos de prueba con un conjunto de evaluación versionado.

Utilice una puerta de liberación

La evaluación de RAG normalmente pertenece a una revisión de lanzamiento y no a una página de guardia. Establezca el recuento mínimo de pruebas, las tolerancias de regresión, la versión del calificador y los cortes requeridos antes de comparar versiones. Mantenga los comentarios de producción como una señal separada con sus propias reglas de consentimiento y privacidad.

El Caso de uso de evaluación de la calidad de la IA cubre transferencias humanas, resultados aceptados y versiones rápidas. El Colección de recetas de IA y LLM agrega costo de modelo, latencia, caché, llamada de herramientas y análisis de ejecución de agentes.

Función relacionada del producto

Conecte las ejecuciones de agentes, el uso de herramientas, el costo de los tokens, la calidad y los resultados del producto.

Responsabilidad y referencias técnicas

El equipo editorial de Telemetry es responsable de esta explicación; el equipo de producto revisa el comportamiento, los ejemplos y las limitaciones.

Consultar los criterios editoriales