Francisco MinguezDatos e IA

Servicios

Consultoría técnica para sistemas de IA y datos que necesitan evidencia.

Asumo encargos centrados cuando un equipo necesita evaluar fiabilidad, comparar modelos o configuraciones, proteger un despliegue o mejorar el sistema de base, con evidencia explícita antes del siguiente paso comercial.

Situaciones

Antes de salir, al elegir, o después de un cambio.

Cada situación pide un tipo distinto de trabajo con evidencia.

  1. 01

    Antes de salir: ¿es lo bastante fiable?

    Evaluación independiente y acotada de un sistema RAG existente sobre fiabilidad y riesgo de salida a producción, más remediación priorizada.

    RAG Reliability Audit

  2. 02

    Al elegir: ¿qué modelo o configuración tiene sentido?

    Comparación sintética congelada de candidatos. No es específico de RAG. Un resultado válido es NO ELIGIBLE RECOMMENDATION.

    LLM Model Selection Benchmark

  3. 03

    Después de un cambio: ¿lo hemos empeorado?

    Gate de release fixture-first: baseline PASS, luego mutación, luego FAIL crítico, luego release BLOCKED. No es un producto de selección de modelo.

    GenAI Regression Gate

Evaluación de preparación

Trabajar sobre tu sistema, paso a paso.

Una evaluación de preparación mira tu sistema con el acceso acordado. Las métricas públicas del Study y del Explorer nunca se tratan como resultados de tu cliente.

  1. 01

    Entender el riesgo

    Aclarar la decisión (piloto, salida a producción, traspaso) y qué preguntas de fiabilidad importan.

  2. 02

    Conectar y comprobar acceso

    Confirmar que se puede ejecutar el sistema (o un equivalente acordado), documentos o ejemplos representativos, y una persona técnica de referencia.

  3. 03

    Cerrar el alcance de la evaluación

    Dejamos cerrados alcance, dimensiones, supuestos, entregables y exclusiones. No hay certificación, cumplimiento ni garantía de producción.

  4. 04

    Evaluar

    Evaluación independiente y acotada sobre el sistema del cliente dentro del alcance cerrado.

  5. 05

    Decidir con evidencia

    Resumen ejecutivo de decisión, cuadro de dimensiones, modos de fallo críticos, remediación priorizada y una sesión de lectura.

  6. 06

    Proteger cambios posteriores cuando sea relevante

    Si prompts, recuperación o modelos van a seguir cambiando, puedo dejar un control de regresiones. No hace falta en cada Audit.

El punto es reducir la probabilidad de salir o ampliar con anécdotas: retrabajo, traspasos bloqueados, pérdida de confianza. Sin ROI inventado ni ahorros garantizados.

Formas de colaboración

  1. 01

    Evaluación técnica

    Reviso un sistema de datos, ML o RAG y entrego hallazgos y siguientes decisiones prácticas sin exigir una fase de implementación.

  2. 02

    Proyecto definido

    Me responsabilizo de un resultado técnico acotado con entregables y traspaso acordados.

  3. 03

    Refuerzo integrado

    Me incorporo a un equipo existente a tiempo parcial o durante un periodo acordado, directamente o a través de una consultora. Útil cuando necesitas capacidad; secundario frente a la evaluación y las ofertas de entrega especializadas.

La formación técnica y la transferencia de conocimiento pueden acompañar un encargo cuando ayudan a tu equipo a operar o ampliar el trabajo.

Detalle del encargo

Qué hago, qué recibes y cuándo no encaja.

El RAG Reliability Audit es la evaluación empaquetada para preguntas de preparación a producción sobre un sistema RAG existente. La modernización de pipelines y el ML aplicado siguen disponibles cuando esos problemas son la necesidad real.

Evaluación de preparación a producción

RAG Reliability Audit

Hago una evaluación independiente y acotada en el tiempo de un sistema RAG existente para aportarte apoyo a la decisión sobre fiabilidad y riesgo de salida a producción, más una remediación priorizada. No es una certificación ni una garantía de producción.

Puede ser útil cuando

  • Un sistema RAG parece convincente en demos, pero la salida a producción, la ampliación del piloto o el traspaso al cliente siguen apoyándose en anécdotas.
  • La calidad de recuperación, las respuestas fundamentadas y la abstención cuando la evidencia es débil no se evalúan con criterios explícitos.
  • El equipo observa fallos, pero no dispone de un conjunto representativo de evaluación ni de un orden práctico de remediación.

Qué puedo entregar

  • Resumen ejecutivo de decisión: evaluación de fiabilidad / riesgo de salida a producción para una conversación de apoyo go / no-go.
  • Cuadro de dimensiones sobre recuperación, calidad de respuesta, abstención, modos de fallo y preparación ante regresiones dentro del alcance acordado.
  • Modos de fallo críticos observados o claramente indicados, con supuestos y limitaciones explicitados.
  • Lista priorizada de remediación y una sesión de aclaración / lectura de hallazgos.

Qué necesito para empezar

  • Puedes ejecutar el sistema RAG que vamos a revisar, o un entorno equivalente acordado.
  • Puedes aportar documentos o ejemplos representativos y una pregunta de decisión clara (piloto, salida a producción o traspaso).
  • Hay una persona técnica de referencia que pueda aclarar acceso, alcance y preocupaciones de fallo.

Límites específicos

  • Necesitas una garantía de que el sistema está listo para producción, o calidad de respuesta garantizada sin evidencia representativa.
  • Necesitas una certificación de cumplimiento, un visto bueno legal o una auditoría de seguridad.

Estudio sintético relacionado

Construí el estudio público RAG Reliability Study v1 para evaluar un gate preregistrado de respuesta o diferimiento sobre un holdout sintético congelado. Es evidencia metodológica sobre un benchmark sintético: no es evidencia de cliente ni prueba de preparación para producción. El RAG Reliability Explorer es un runtime sintético de demostración, no un runtime de cliente. Un encargo evalúa tu sistema con el acceso acordado; las métricas del estudio y de la demo nunca son resultados de tu cliente.

Ver caso de estudio relacionado

Trabajo técnico relacionado

Útiles cuando el problema encaja. Se describen desde experiencia profesional, no como productos comerciales empaquetados por separado.

Modernización de pipelines de datos y calidad

Migro o mejoro flujos analíticos recurrentes para que sus transformaciones, controles de validación y responsabilidades operativas sean más fáciles de entender y mantener.

Puede ser útil cuando

  • Un proceso recurrente SQL, SAS o ETL es difícil de mantener o modificar con seguridad.
  • Los problemas de calidad de datos se detectan tarde o se gestionan manualmente.
  • Los resultados heredados y los resultados objetivo son difíciles de comparar y reconciliar.

Qué puedo entregar

  • Revisión del flujo actual, sus dependencias y reglas de negocio.
  • Un plan de migración y reconciliación por etapas.
  • Transformaciones reutilizables con controles automatizados de calidad y validación.
  • Documentación operativa y traspaso práctico.

Qué necesito para empezar

  • Ya existe un flujo concreto con salidas esperadas.
  • Se pueden comparar los resultados heredados y los resultados objetivo.
  • Tu equipo puede proporcionar los accesos y la responsabilidad técnica necesarios.

Límites específicos

  • Necesitas sustituir toda la plataforma antes de comprender el flujo actual.
  • Nadie puede explicar las reglas existentes o las salidas esperadas.

Experiencia profesional relacionada

Trabajé en la migración de un proceso analítico recurrente desde lógica heredada de SQL Server hacia un flujo modular en Databricks y PySpark con componentes reutilizables, controles de calidad de datos y validación.

Ver caso de estudio relacionado

ML aplicado y flujos de decisión

Convierto una decisión operativa existente en un flujo analítico evaluable: establezco una línea base, preparo los datos disponibles, analizo errores y entrego resultados que puedan utilizarse dentro del proceso.

Puede ser útil cuando

  • Un problema de predicción, priorización o análisis documental carece de una línea base clara.
  • La revisión manual de documentos o análisis es difícil de escalar.
  • Las salidas del modelo están desconectadas de la decisión que debe tomar el equipo.

Qué puedo entregar

  • Definición del problema y de la línea base.
  • Preparación de datos y análisis de diagnóstico.
  • Un flujo predictivo, de NLP o analítico con análisis de errores.
  • Resultados utilizables, documentación y transferencia de conocimiento.

Qué necesito para empezar

  • Se puede describir una decisión concreta o un proceso operativo.
  • Hay datos históricos o etiquetados representativos.
  • Podemos acordar una línea base y un criterio de evaluación útil.

Límites específicos

  • Necesitas un modelo antes de definir el problema de decisión.
  • Exiges un rendimiento predictivo o de negocio garantizado.

Experiencia profesional relacionada

Mi experiencia profesional incluye analítica aplicada, modelado predictivo, NLP, automatización de reporting y comunicación con interlocutores técnicos y de negocio. Los ejemplos y artefactos específicos de las organizaciones permanecen confidenciales.

Elección de modelo y protección ante regresiones

Evidencia sintética para dos decisiones cercanas.

Apoyan la elección de modelo o configuración y la protección del release. Son demos controladas, no resultados de cliente.

¿Usamos el modelo o la configuración adecuados?

LLM Model Selection Benchmark

Compara candidatos de modelo/configuración bajo una evaluación sintética congelada para ver si alguna opción supera un umbral de calidad acordado.

  • Evidencia de benchmark sintético.
  • Resultado observado: NO ELIGIBLE RECOMMENDATION (parada técnica válida).
  • Holdout: CONSUMED. Una validación futura no vista requiere un holdout nuevo.
  • Posicionamiento no específico de RAG.

Demo sintética controlada. No es un resultado de cliente ni una recomendación de modelo en producción.

Ver resumen de evidencia

¿Cómo evitamos que cambios futuros lo rompan?

GenAI Regression Gate

Demuestra un gate de release que bloquea un cambio que introduce una regresión crítica de comportamiento.

  • SYNTHETIC REGRESSION GATE DEMO (fixture-first).
  • Cadena causal: baseline PASS, luego mutación de prompt, luego regresión crítica, luego FAIL, luego release BLOCKED.
  • No es un producto de selección de modelo.

Demo sintética fixture-first. No es prueba causal de GenAI en vivo ni una garantía de producción.

Ver resumen de evidencia

Investigación de apoyo

Study y Explorer explican el método.

Ayudan a explicar método y comportamiento. No son ofertas empaquetadas.

Evidencia de investigación / metodología

RAG Reliability Study

Estudio sintético público sobre respuesta/diferimiento en un holdout congelado. Evidencia metodológica, no resultados de cliente ni prueba de preparación para producción.

Demo sintética interactiva

RAG Reliability Explorer

Runtime de demo separado con ejemplos sintéticos propios. No es un runtime de cliente ni una repetición de las métricas del estudio.

Qué ayuda antes de una primera conversación

  • Qué existe hoy: un flujo, sistema, conjunto de datos o prototipo.
  • Qué necesitas mejorar, entender o decidir.
  • Qué datos, documentos o ejemplos representativos están disponibles.
  • Cualquier restricción importante de plazo, seguridad o confidencialidad.

Qué confirmaremos antes de empezar

Antes de acordar el trabajo, confirmaremos la evidencia disponible, los límites de la entrega y qué puede considerarse de forma realista un resultado útil.

  • El alcance, los entregables y los criterios de aceptación.
  • Qué permiten evaluar los datos y accesos disponibles.
  • Qué trabajo de producción, seguridad o cumplimiento queda fuera del encargo.
  • Qué resultados pueden medirse sin tratarlos como garantías.

Soluciones empresariales gestionadas

¿Necesitas una solución empresarial gestionada en lugar de consultoría individual?

También fundé Miga Digital, un estudio de IA y automatización para pequeñas empresas en España. Si necesitas una solución que se implante, gestione y mejore como servicio, puedo ayudarte a determinar si Miga Digital es la vía más adecuada. Visitar Miga Digital

Cuéntame qué estás construyendo.

Describe el sistema o flujo, qué te genera duda y qué sería un mal resultado para ti. Te digo si el siguiente paso es evaluación, comparación de modelos, protección u otro trabajo.

Cuéntame qué estás construyendo