Francisco MinguezDatos e IA

Estudio sintético para el portfolio

Estudio publicado

Estudio de RAG Reliability

Una dirección de producto propietaria para decidir cuándo un sistema RAG debe responder o diferir la respuesta, apoyada aquí por un estudio sintético de respuesta/diferimiento.

Esta página documenta un estudio sintético para el portfolio, completado con criterios de evaluación preregistrados. Aquí hay un resumen técnico y métricas públicas; el código fuente y los artefactos completos siguen siendo privados. Los resultados se aplican solo al benchmark fijo descrito más abajo.

Contexto

RAG Reliability es una dirección de producto propietaria para decidir cuándo un sistema RAG debe responder o diferir la respuesta. El estudio v1 usa un corpus sintético Atlas Support Operations con un holdout (conjunto de evaluación reservado y congelado) para que la evaluación, el análisis de fallos y la integridad de artefactos se puedan revisar. Los resultados públicos se resumen en esta página; los detalles de implementación y los artefactos completos siguen siendo privados. Una demostración pública controlada del Explorer está enlazada desde esta página.

Problema

Una relevancia alta en la recuperación no garantiza por sí sola que un sistema deba responder. El pipeline evaluado también debe gestionar resultados rank-1 léxicos y densos en conflicto, documentos obsoletos frente a actuales, consultas que admiten respuesta, consultas que requieren aclaración, consultas en las que la abstención es adecuada, y el compromiso precisión-cobertura que introduce el diferimiento.

Alcance

  • Baseline léxico BM25.
  • Baseline denso MiniLM.
  • Fusión híbrida reciprocal-rank con pesos iguales.
  • Reranking status-aware con prioridad a documentos actuales.
  • Análisis de consenso de recuperación.
  • Análisis de riesgo selectivo.
  • Análisis de separabilidad de señales.
  • Benchmark sintético versionado v2.
  • Partición development/holdout congelada.
  • Preregistro del gate top-1.
  • Evaluación única del holdout.
  • Registro determinista de artefactos y paquete de evidencia SHA-256.

Restricciones

  • Solo benchmark sintético; sin tráfico de producción ni corpus empresarial real.
  • Holdout de 36 consultas con composición fija.
  • Las reglas del gate y los criterios de éxito se congelaron antes de la evaluación del holdout.
  • Development y holdout permanecieron separados hasta la evaluación única.
  • Estado del holdout: unblinded. El holdout no puede reutilizarse como evidencia no vista.
  • Queda prohibido el ajuste del gate tras el holdout en este benchmark.
  • La regeneración de integridad es solo una comprobación de reproducibilidad.
  • Los resultados no pueden respaldar afirmaciones a nivel poblacional ni de despliegue en producción.
  • El código fuente, las pruebas y los artefactos completos del estudio no se distribuyen públicamente.

Pipeline de evaluación

  1. 01

    Recuperación léxica

    BM25 aporta evidencia de términos exactos y solapamiento de tokens.

  2. 02

    Recuperación densa

    Los embeddings MiniLM fijados aportan evidencia semántica de recuperación.

  3. 03

    Fusión híbrida

    La reciprocal-rank fusion combina rankings léxicos y densos con pesos iguales.

  4. 04

    Reranking status-aware

    Se priorizan documentos actuales frente a evidencia obsoleta.

  5. 05

    Gate de consenso top-1

    Responder solo cuando BM25, denso y la evidencia actual final comparten el mismo documento rank-1; en caso contrario, diferir.

Enfoque

  1. 01

    Establecer baselines

    Definir baselines de recuperación léxico BM25 y denso MiniLM sobre los corpora sintéticos.

  2. 02

    Evaluar recuperación híbrida

    Combinar rankings léxicos y densos con reciprocal-rank fusion de pesos iguales y aplicar reranking status-aware con prioridad a documentos actuales.

  3. 03

    Analizar fallos del gate

    Examinar fallos del gate de consenso y la separabilidad de señales para entender cuándo la evidencia de recuperación respalda una decisión de respuesta.

  4. 04

    Crear benchmark congelado

    Construir el benchmark sintético versionado v2 con una partición fija development/holdout.

  5. 05

    Preregistrar gate y criterios

    Congelar las reglas del gate de consenso top-1 y tres criterios de éxito antes de cualquier acceso al holdout.

  6. 06

    Ejecutar evaluación del holdout

    Ejecutar la evaluación única del holdout unblinded sin cambiar el gate ni los umbrales.

  7. 07

    Consolidar el paquete de evidencia

    Ensamblar informes JSON deterministas, un registro de integridad de 33 artefactos y un paquete de estudio versionado.

Entregables

  • Corpora sintéticos versionados.
  • Implementación tipada de recuperación y evaluación.
  • Informes JSON deterministas.
  • Artefacto de preregistro.
  • Informe de la evaluación única del holdout.
  • Informe final del estudio.
  • Registro de integridad de 33 artefactos.
  • Comprobaciones automatizadas de integridad y reproducibilidad.
  • Paquete de estudio versionado con verificación SHA-256.

Tecnologías

  • Python
  • uv
  • pytest
  • BM25
  • sentence-transformers
  • all-MiniLM-L6-v2
  • reciprocal-rank fusion
  • SHA-256 artifact verification

Evidencia

  • Resultado de holdout sintético preregistrado

    Criterios de éxito congelados

    PASS 3/3

    Los tres criterios se congelaron antes de la evaluación del holdout y se cumplieron sin cambiar el gate ni los umbrales.

  • Métrica de holdout sintético

    Precisión de consultas respondidas

    17/20 = 0.850

    El valor exigido era al menos 0.75.

  • Métrica de holdout sintético

    Cobertura de consultas que admiten respuesta

    17/22 = 0.773

    El valor exigido era al menos 0.70.

  • Métrica de holdout sintético

    Tasa de respuesta indebida

    3/14 = 0.214

    El valor exigido era como máximo 0.50 para consultas en las que se esperaba diferir.

  • Métrica descriptiva de holdout sintético

    Exactitud de decisión

    28/36 = 0.778

    La exactitud se reportó junto con precisión, cobertura y errores de diferimiento; no fue un criterio de éxito congelado.

  • Evidencia de reproducibilidad

    Paquete de evidencia

    33 registered artifacts across 12 stages

    El estudio se basa en un benchmark interno reproducible sobre un corpus sintético de soporte. Los resultados públicos se resumen aquí; el código fuente y los artefactos completos siguen siendo privados.

Limitaciones

  • Un único benchmark sintético con un holdout fijo y pequeño de 36 consultas.
  • Balance fijo de consultas answer, clarify y abstain.
  • Sin evidencia sobre cargas reales de soporte ni corpora empresariales.
  • No se produce probabilidad calibrada ni puntuación de confianza.
  • No se evaluó la generación de respuestas.
  • Se produjeron tres respuestas indebidas en consultas abstain.
  • Se difirieron cinco consultas que admitían respuesta.
  • Sin evidencia de generalización a otros corpora, dominios o idiomas.
  • El holdout está unblinded y no puede reutilizarse como evidencia no vista.
  • El estudio no afirma validación en producción ni corrección garantizada de respuestas.

Consideraciones de producción

  • Holdout de corpus real diseñado de forma independiente, con tráfico representativo y estimaciones de prevalencia.
  • Gobernanza del ciclo de vida y del estado de los documentos.
  • Monitorización de recuperación y diferimiento con medición de latencia y coste.
  • Control de acceso y manejo de datos sensibles.
  • Rutas de escalado humano para consultas diferidas o de baja confianza.
  • Evaluación de generación de respuestas más allá del consenso de recuperación.
  • Revisión de incidentes y procedimientos de rollback.
  • Nuevos datos confirmatorios para cualquier gate modificado antes del despliegue.

Relevancia para servicios

  • RAG Reliability Audit de sistemas existentes.
  • Diseño de políticas de capacidad de respuesta y abstención.
  • Análisis de respuesta indebida y de conflictos de evidencia.
  • Diseño de evaluación sintética y representativa.
  • Recuperación de conocimiento status-aware.
  • Diseño de protocolos de evaluación.
  • Informes técnicos de evidencia y decisión.

Siguientes pasos

Volver a proyectos