Preparo artefactos para preparación, elección de modelo/configuración y protección ante regresiones, más una demo interactiva subordinada si quieres explorar el comportamiento.
Estudio reproducible de evaluación RAG
Estudio de RAG Reliability
Evidencia de investigación: construí este estudio para evaluar cuándo un sistema RAG debería responder o diferir mediante un benchmark sintético versionado y un protocolo de evaluación fijo. No son resultados de cliente ni una oferta comercial empaquetada.
- Python
- uv
- pytest
- BM25
- sentence-transformers
- all-MiniLM-L6-v2
- reciprocal-rank fusion
- SHA-256 artifact verification
Leer caso de estudio
Benchmark sintético
LLM Model Selection Benchmark
Compara candidatos de modelo/configuración bajo una evaluación sintética congelada para decidir si alguna opción supera un umbral de calidad acordado. No es un producto específico de RAG.
Resultado sintético observado: NO ELIGIBLE RECOMMENDATION. Holdout: CONSUMED.
Solo benchmark sintético. Demo controlada, no un resultado de cliente ni una recomendación de producción.
Demo de gate sintético
GenAI Regression Gate
Muestra cómo un gate de release puede bloquear un cambio que introduce una regresión crítica de comportamiento: baseline PASS, una mutación de prompt, fallo crítico, candidato FAIL, release BLOCKED.
SYNTHETIC REGRESSION GATE DEMO (fixture-first).
Demo sintética fixture-first. No es prueba causal de GenAI en vivo ni un producto de selección de modelo.
Demo sintética interactiva
RAG Reliability Explorer
Una demo interactiva subordinada con ejemplos sintéticos propios. No reproduce el benchmark del estudio, no genera métricas de cliente y no es una oferta empaquetada.
Abrir la demo (se abre en una pestaña nueva)