Estudio sintético para el portfolio
Estudio publicado
Estudio de RAG Reliability
Una dirección de producto propietaria para decidir cuándo un sistema RAG debe responder o diferir la respuesta, apoyada aquí por un estudio sintético de respuesta/diferimiento.
Esta página documenta un estudio sintético para el portfolio, completado con criterios de evaluación preregistrados. Aquí hay un resumen técnico y métricas públicas; el código fuente y los artefactos completos siguen siendo privados. Los resultados se aplican solo al benchmark fijo descrito más abajo.
Contexto
RAG Reliability es una dirección de producto propietaria para decidir cuándo un sistema RAG debe responder o diferir la respuesta. El estudio v1 usa un corpus sintético Atlas Support Operations con un holdout (conjunto de evaluación reservado y congelado) para que la evaluación, el análisis de fallos y la integridad de artefactos se puedan revisar. Los resultados públicos se resumen en esta página; los detalles de implementación y los artefactos completos siguen siendo privados. Una demostración pública controlada del Explorer está enlazada desde esta página.
Problema
Una relevancia alta en la recuperación no garantiza por sí sola que un sistema deba responder. El pipeline evaluado también debe gestionar resultados rank-1 léxicos y densos en conflicto, documentos obsoletos frente a actuales, consultas que admiten respuesta, consultas que requieren aclaración, consultas en las que la abstención es adecuada, y el compromiso precisión-cobertura que introduce el diferimiento.
Alcance
- Baseline léxico BM25.
- Baseline denso MiniLM.
- Fusión híbrida reciprocal-rank con pesos iguales.
- Reranking status-aware con prioridad a documentos actuales.
- Análisis de consenso de recuperación.
- Análisis de riesgo selectivo.
- Análisis de separabilidad de señales.
- Benchmark sintético versionado v2.
- Partición development/holdout congelada.
- Preregistro del gate top-1.
- Evaluación única del holdout.
- Registro determinista de artefactos y paquete de evidencia SHA-256.
Restricciones
- Solo benchmark sintético; sin tráfico de producción ni corpus empresarial real.
- Holdout de 36 consultas con composición fija.
- Las reglas del gate y los criterios de éxito se congelaron antes de la evaluación del holdout.
- Development y holdout permanecieron separados hasta la evaluación única.
- Estado del holdout: unblinded. El holdout no puede reutilizarse como evidencia no vista.
- Queda prohibido el ajuste del gate tras el holdout en este benchmark.
- La regeneración de integridad es solo una comprobación de reproducibilidad.
- Los resultados no pueden respaldar afirmaciones a nivel poblacional ni de despliegue en producción.
- El código fuente, las pruebas y los artefactos completos del estudio no se distribuyen públicamente.
Pipeline de evaluación
- 01
Recuperación léxica
BM25 aporta evidencia de términos exactos y solapamiento de tokens.
- 02
Recuperación densa
Los embeddings MiniLM fijados aportan evidencia semántica de recuperación.
- 03
Fusión híbrida
La reciprocal-rank fusion combina rankings léxicos y densos con pesos iguales.
- 04
Reranking status-aware
Se priorizan documentos actuales frente a evidencia obsoleta.
- 05
Gate de consenso top-1
Responder solo cuando BM25, denso y la evidencia actual final comparten el mismo documento rank-1; en caso contrario, diferir.
Enfoque
- 01
Establecer baselines
Definir baselines de recuperación léxico BM25 y denso MiniLM sobre los corpora sintéticos.
- 02
Evaluar recuperación híbrida
Combinar rankings léxicos y densos con reciprocal-rank fusion de pesos iguales y aplicar reranking status-aware con prioridad a documentos actuales.
- 03
Analizar fallos del gate
Examinar fallos del gate de consenso y la separabilidad de señales para entender cuándo la evidencia de recuperación respalda una decisión de respuesta.
- 04
Crear benchmark congelado
Construir el benchmark sintético versionado v2 con una partición fija development/holdout.
- 05
Preregistrar gate y criterios
Congelar las reglas del gate de consenso top-1 y tres criterios de éxito antes de cualquier acceso al holdout.
- 06
Ejecutar evaluación del holdout
Ejecutar la evaluación única del holdout unblinded sin cambiar el gate ni los umbrales.
- 07
Consolidar el paquete de evidencia
Ensamblar informes JSON deterministas, un registro de integridad de 33 artefactos y un paquete de estudio versionado.
Entregables
- Corpora sintéticos versionados.
- Implementación tipada de recuperación y evaluación.
- Informes JSON deterministas.
- Artefacto de preregistro.
- Informe de la evaluación única del holdout.
- Informe final del estudio.
- Registro de integridad de 33 artefactos.
- Comprobaciones automatizadas de integridad y reproducibilidad.
- Paquete de estudio versionado con verificación SHA-256.
Tecnologías
- Python
- uv
- pytest
- BM25
- sentence-transformers
- all-MiniLM-L6-v2
- reciprocal-rank fusion
- SHA-256 artifact verification
Evidencia
Resultado de holdout sintético preregistrado
Criterios de éxito congelados
PASS 3/3
Los tres criterios se congelaron antes de la evaluación del holdout y se cumplieron sin cambiar el gate ni los umbrales.
Métrica de holdout sintético
Precisión de consultas respondidas
17/20 = 0.850
El valor exigido era al menos 0.75.
Métrica de holdout sintético
Cobertura de consultas que admiten respuesta
17/22 = 0.773
El valor exigido era al menos 0.70.
Métrica de holdout sintético
Tasa de respuesta indebida
3/14 = 0.214
El valor exigido era como máximo 0.50 para consultas en las que se esperaba diferir.
Métrica descriptiva de holdout sintético
Exactitud de decisión
28/36 = 0.778
La exactitud se reportó junto con precisión, cobertura y errores de diferimiento; no fue un criterio de éxito congelado.
Evidencia de reproducibilidad
Paquete de evidencia
33 registered artifacts across 12 stages
El estudio se basa en un benchmark interno reproducible sobre un corpus sintético de soporte. Los resultados públicos se resumen aquí; el código fuente y los artefactos completos siguen siendo privados.
Limitaciones
- Un único benchmark sintético con un holdout fijo y pequeño de 36 consultas.
- Balance fijo de consultas answer, clarify y abstain.
- Sin evidencia sobre cargas reales de soporte ni corpora empresariales.
- No se produce probabilidad calibrada ni puntuación de confianza.
- No se evaluó la generación de respuestas.
- Se produjeron tres respuestas indebidas en consultas abstain.
- Se difirieron cinco consultas que admitían respuesta.
- Sin evidencia de generalización a otros corpora, dominios o idiomas.
- El holdout está unblinded y no puede reutilizarse como evidencia no vista.
- El estudio no afirma validación en producción ni corrección garantizada de respuestas.
Consideraciones de producción
- Holdout de corpus real diseñado de forma independiente, con tráfico representativo y estimaciones de prevalencia.
- Gobernanza del ciclo de vida y del estado de los documentos.
- Monitorización de recuperación y diferimiento con medición de latencia y coste.
- Control de acceso y manejo de datos sensibles.
- Rutas de escalado humano para consultas diferidas o de baja confianza.
- Evaluación de generación de respuestas más allá del consenso de recuperación.
- Revisión de incidentes y procedimientos de rollback.
- Nuevos datos confirmatorios para cualquier gate modificado antes del despliegue.
Relevancia para servicios
- RAG Reliability Audit de sistemas existentes.
- Diseño de políticas de capacidad de respuesta y abstención.
- Análisis de respuesta indebida y de conflictos de evidencia.
- Diseño de evaluación sintética y representativa.
- Recuperación de conocimiento status-aware.
- Diseño de protocolos de evaluación.
- Informes técnicos de evidencia y decisión.