contrato de evento común
Campos que mantienen estas consultas reutilizables
- timestamp_utc, run_id, característica, proveedor, modelo y estado
- input_tokens, output_tokens, estimated_cost_usd y latency_ms
- tool_name, retry_count, cache_hit, reviewer_outcome y human_handoff
Definiciones antes de SQL
Decisiones que la consulta no puede tomar por usted
- 1Mantenga la versión de precios del modelo fuera del productor del evento cuando sea posible.
- 2Conecte las solicitudes con los resultados del producto sin almacenar mensajes sin formato de forma predeterminada.
- 3Separe los reintentos del proveedor de las regeneraciones deliberadas de usuarios.
Secuencia recomendada
Primero la detección de compilación, luego el diagnóstico
Patrones de análisis
Hacer que el resultado explique una decisión.
Medir la producción útil
Conecte el token, la latencia y el costo del proveedor con el resultado de un producto aceptado o completado en lugar de optimizar únicamente el volumen de solicitudes.
Preservar la ruta de ejecución
Mantenga los campos de ejecución, modelo, herramienta, caché y reintento para que las ramas costosas o poco confiables permanezcan visibles.
Supuestos de cambio de versión
Registre las versiones de modelos y precios para poder reproducir las comparaciones históricas de costos y calidad.
recetas completas
Copie la consulta y luego valide las suposiciones.
Calcular el costo de LLM por característica y modelo
Atribuya el gasto del modelo, los tokens, el volumen de solicitudes y el costo por solicitud a las características del producto.
¿Qué características y modelos de productos impulsan el gasto en LLM?
Ver SQL y resultadoMedir las producciones de IA aceptadas por dólar
Conecte el gasto modelo con resultados de productos aceptados, ahorrados o útiles.
¿Qué combinación de modelo y características produce los resultados por dólar más aceptados?
Ver SQL y resultadoMedir el ahorro de caché de LLM y el costo de reintento
Compare las solicitudes almacenadas en caché, el volumen de reintentos y el gasto estimado por modelo para encontrar costos de IA evitables.
¿Cuánto costo del modelo está asociado con los reintentos y los errores de caché?
Ver SQL y resultadoMedir el tiempo de LLM hasta el primer token
Compare la capacidad de respuesta de la transmisión y la latencia total de generación por modelo y característica.
¿Qué combinaciones de modelos y características se sienten lentas antes de que comience la producción?
Ver SQL y resultadoDetectar bucles repetidos de herramientas de agentes de IA
Encuentre ejecuciones de agentes que llamen repetidamente a un pequeño conjunto de herramientas sin alcanzar un resultado exitoso.
¿Qué ejecuciones de agentes aparecen atrapadas en un bucle de herramientas repetitivo?
Ver SQL y resultadoMida el éxito de las tareas de los agentes de IA y la transferencia humana
Compare el éxito de las tareas de los agentes, la aceptación de los revisores, el costo, la latencia y la tasa de transferencia humana por flujo de trabajo y modelo.
¿Qué flujos de trabajo de agentes finalizan exitosamente y producen resultados aceptados?
Ver SQL y resultadoEncuentre regresiones de calidad de IA por versión de solicitud
Compare la calidad, la aceptación, la transferencia y el costo evaluados según la versión solicitada.
¿La nueva versión del mensaje mejoró la calidad sin aumentar las transferencias humanas?
Ver SQL y resultadoEvaluar la calidad de recuperación de RAG por versión
Compare la recuperación de documentos relevantes, las respuestas fundamentadas, la latencia de recuperación y el costo de evaluación en todas las versiones del canal RAG.
¿Mejoró el nuevo oleoducto RAG las tasas de recuperación y respuesta en tierra?
Ver SQL y resultadoAdaptar el contrato del evento antes del umbral.
Mantenga el patrón de análisis, pero valide los nombres de las tablas, los tipos de campos, las definiciones comerciales, las ventanas de tiempo y las reglas de volumen mínimo con respecto a sus propios eventos. Cada consulta publicada también se planifica y ejecuta en una tabla escrita vacía con el motor fijado.