Francisco MinguezDatos e IA

Objeto de evidencia

Estudio reproducible de evaluación RAG

Estudio de RAG Reliability

Construí este estudio para evaluar cuándo un sistema RAG debería responder y cuándo debería diferir, mediante un benchmark sintético versionado, un protocolo de evaluación fijo y un holdout congelado de 36 consultas.

Entrada directa: esta página se sostiene sola. No implica un recorrido de Decision Room desde Home.

Forma, Procedencia y Estado son dimensiones separadas, no una sola insignia.

Forma
Investigación
Procedencia
SintéticoPúblico
Estado
Holdout consumido
Qué es
Evidencia de investigación / metodología: benchmark sintético versionado con protocolo fijo y paquete de evidencia SHA-256.
Pregunta / contexto
¿Cuándo debería un sistema RAG responder o diferir ante evidencia de recuperación conflictiva o débil?
Qué se hizo
Comparé recuperación léxica/densa/híbrida con un gate de consenso top-1 preregistrado y un holdout desvelado una sola vez.
Qué se aprendió
Reglas más estrictas de answer/defer se pueden evaluar de forma reproducible en un holdout sintético; después el holdout queda consumido.
Qué sostiene aquí
Credibilidad metodológica para investigación de fiabilidad RAG, distinta del Explorer y del framing comercial F1.
Qué no demuestra
Rendimiento RAG en producción, madurez comercial, resultados de cliente ni equivalencia con métricas del Explorer. El holdout está consumido, no es validación no vista.

Evaluado sobre un benchmark sintético versionado con un holdout congelado de 36 consultas. Los resultados se limitan a este benchmark y no demuestran rendimiento en producción.

Qué construí

Creé RAG Reliability para analizar fallos de recuperación y decisiones de respuesta o diferimiento. El estudio compara recuperación léxica y densa, fusión híbrida y reranking status-aware bajo un protocolo fijo con una partición development/holdout congelada.

Qué quería evaluar

Un documento que parece relevante no siempre justifica una respuesta. Quería evaluar una regla más estricta para los casos en los que la recuperación léxica y la densa no coinciden, compiten documentos actuales y obsoletos, una consulta requiere aclaración o la evidencia disponible no es suficiente para responder con seguridad.

Qué incluyó el estudio

  • Un baseline de recuperación léxica BM25.
  • Un baseline de recuperación densa MiniLM.
  • Fusión reciprocal-rank (RRF) con pesos iguales.
  • Reranking status-aware con prioridad a documentos actuales.
  • Análisis de consenso, riesgo selectivo y separabilidad de señales.
  • Un benchmark sintético versionado con partición development/holdout congelada.
  • Un gate de consenso top-1 y tres criterios de éxito registrados antes del holdout.
  • Una evaluación única unblinded del holdout.
  • Informes deterministas y un registro de artefactos SHA-256.

Qué mantuve fijo

  • Utilicé solo un benchmark sintético: sin tráfico de producción y sin corpus empresarial real.
  • El holdout permaneció fijo en 36 consultas, con una composición fija answer, clarify y abstain.
  • Congelé las reglas del gate y los tres criterios de éxito antes de cualquier evaluación del holdout.
  • Mantuve separados development y holdout hasta la evaluación única.
  • El holdout está unblinded, por lo que no puede reutilizarse como evidencia no vista.
  • No reajusto el gate en este benchmark después de observar el holdout.
  • La regeneración de integridad solo comprueba reproducibilidad; no crea nueva evidencia de evaluación.
  • Estos resultados no respaldan afirmaciones a nivel poblacional ni de despliegue en producción.

Cómo funciona el gate de respuesta o diferimiento

  1. 01

    Recuperación léxica

    BM25 aporta evidencia de términos exactos y solapamiento de tokens.

  2. 02

    Recuperación densa

    Los embeddings MiniLM fijados aportan evidencia semántica de recuperación.

  3. 03

    Fusión híbrida

    La reciprocal-rank fusion combina rankings léxicos y densos con pesos iguales.

  4. 04

    Reranking status-aware

    Se priorizan documentos actuales frente a evidencia obsoleta.

  5. 05

    Gate de consenso top-1

    El sistema responde solo cuando BM25, la recuperación densa y el ranking final con prioridad a documentos actuales coinciden en el mismo primer documento; en caso contrario, difiere.

Cómo realicé el estudio

  1. 01

    Establecer baselines

    Empecé con baselines de recuperación léxica BM25 y densa MiniLM sobre los corpora sintéticos.

  2. 02

    Añadir fusión y estado documental

    Combiné rankings léxicos y densos con reciprocal-rank fusion de pesos iguales y apliqué reranking status-aware con prioridad a documentos actuales.

  3. 03

    Analizar señales de fallo

    Examiné fallos de consenso, riesgo selectivo y separabilidad de señales para ver cuándo la evidencia de recuperación bastaba para responder.

  4. 04

    Congelar el benchmark

    Construí un benchmark sintético versionado con una partición development/holdout congelada antes de la evaluación final.

  5. 05

    Preregistrar el gate y los criterios

    Registré el gate de consenso top-1 y tres criterios de éxito antes de cualquier acceso al holdout.

  6. 06

    Evaluar una sola vez

    Ejecuté una evaluación única unblinded del holdout sin cambiar después el gate ni los umbrales.

  7. 07

    Preparar el paquete de evidencia

    Ensamblé informes JSON deterministas, un registro de integridad SHA-256 de 33 artefactos y un paquete de estudio versionado.

Qué produje

  • Corpora sintéticos versionados.
  • Una implementación tipada de recuperación y evaluación.
  • Informes JSON deterministas.
  • Un artefacto de preregistro.
  • Un informe de la evaluación única del holdout.
  • Un informe final del estudio.
  • Un registro de integridad de 33 artefactos en 12 etapas del estudio.
  • Comprobaciones automatizadas de integridad y reproducibilidad.
  • Un paquete de estudio versionado con verificación SHA-256.

Tecnologías

  • Python
  • uv
  • pytest
  • BM25
  • sentence-transformers
  • all-MiniLM-L6-v2
  • reciprocal-rank fusion
  • SHA-256 artifact verification

Qué mostró el benchmark

  • Resultado de holdout sintético preregistrado

    Criterios de éxito congelados

    PASS 3/3

    PASS 3/3 significa que se superaron los tres criterios preregistrados en el holdout de 36 consultas: 17/20, 17/22 y 3/14. Esos tres criterios son los únicos criterios de éxito congelados. Congelé el gate y los umbrales antes de ver el holdout y no los cambié después.

  • Métrica de holdout sintético

    Precisión de consultas respondidas

    17/20 = 0.850

    El umbral congelado exigía al menos 0.75.

  • Métrica de holdout sintético

    Cobertura de consultas que admiten respuesta

    17/22 = 0.773

    El umbral congelado exigía al menos 0.70.

  • Métrica de holdout sintético

    Tasa de respuesta indebida

    3/14 = 0.214

    El umbral congelado permitía como máximo 0.50 para consultas en las que se esperaba diferir.

  • Métrica descriptiva de holdout sintético

    Exactitud de decisión

    28/36 = 0.778

    28/36 = 0.778 es contexto descriptivo reportado junto con precisión, cobertura y errores de diferimiento. No fue uno de los tres criterios de éxito congelados.

  • Evidencia de reproducibilidad

    Paquete de evidencia

    33 artefactos registrados con SHA-256 en 12 etapas del estudio

    Registré 33 artefactos en 12 etapas del estudio con SHA-256. El registro documenta el contenido y la integridad del paquete; no es una métrica de rendimiento.

Qué no demuestran los resultados

  • Se trata de un único benchmark sintético con un holdout fijo y pequeño de 36 consultas.
  • La composición answer, clarify y abstain estaba fijada.
  • No evalué un corpus empresarial real ni tráfico real de soporte.
  • El sistema no produce una probabilidad calibrada ni una puntuación de confianza.
  • No evalué la generación de respuestas.
  • Tres consultas abstain fueron respondidas indebidamente.
  • Se difirieron cinco consultas que admitían respuesta.
  • No hay evidencia de generalización a otros corpora, dominios o idiomas.
  • El holdout está unblinded y no puede reutilizarse como evidencia no vista.
  • Estos resultados no muestran rendimiento en producción ni corrección garantizada de respuestas.

Qué necesitaría antes de utilizarlo con datos reales

  • Antes de utilizar este enfoque con datos reales, crearía un nuevo holdout representativo.
  • Estimaría la prevalencia y el coste de las respuestas indebidas y de los diferimientos innecesarios.
  • Definiría el ciclo de vida documental y la responsabilidad sobre el estado de los documentos.
  • Mediría la calidad de recuperación, el comportamiento de diferimiento, la latencia y el coste.
  • Definiría controles de acceso para material sensible.
  • Incorporaría escalado humano para casos diferidos o inciertos.
  • Evaluaría la generación de respuestas por separado del consenso de recuperación.
  • Si el gate cambiara, exigiría nuevos datos confirmatorios antes de confiar en él.

Dónde puede ayudar este método

  • RAG Reliability Audit de sistemas existentes.
  • Diseño de políticas de capacidad de respuesta y abstención.
  • Análisis de respuesta indebida y de conflictos de evidencia.
  • Diseño de evaluación sintética y representativa.
  • Recuperación de conocimiento status-aware.
  • Diseño de protocolos de evaluación.
  • Informes técnicos de evidencia y decisión.

Evidencia del proyecto

Estudio, demo y siguientes pasos

Ver RAG Reliability Audit

Demo interactiva complementaria

RAG Explorer es una demo interactiva separada que utiliza su propio corpus sintético. No utiliza el holdout del estudio ni reproduce sus resultados o métricas.

Abrir el Explorer

Cuéntame qué estás construyendo

Volver a proyectos