Ir al contenido principal
FromNine
Menú

IA y datos

Cimientos de datos y analítica en los que pueden apoyarse la IA y las decisiones

Construimos plataformas de datos en las que cada conjunto de datos tiene un responsable, un contrato y una calidad conocida, para que la analítica, la operación y la IA beban de las mismas cifras fiables.

Para organizaciones en España que quieren decidir con datos fiables y prepararlos para la IA, con la LOPDGDD y el Reglamento de Datos en cuenta.

Datos y analítica: capas de capacidadCuatro capas superpuestas en profundidad. De arriba abajo: la analítica y la IA que consumen los datos, los productos de datos con responsables y contratos, las capas del lakehouse que depuran y armonizan, y el gobierno del dato que lo abarca todo.01Uso en analítica e IA02Productos de datos y contratos03Capas del lakehouse04Gobierno y linaje
  1. 01Productos de datos con responsables designados, contratos y controles de calidad
  2. 02Un gobierno del dato que codifica la limitación de la finalidad y la conservación, no solo un catálogo
  3. 03Una única definición de cada KPI, suscrita por negocio y por TI

01 Problemas

Problemas de datos habituales

La mayoría de los proyectos de IA que decepcionan resultan ser proyectos de datos encubiertos.

  1. 01

    Tres informes, tres cifras distintas

    Finanzas, operaciones y el consejo calculan cada uno a su manera la facturación o el volumen de expedientes. Las reuniones empiezan cuadrando cifras en lugar de decidiendo.

  2. 02

    Nadie es responsable de los datos, así que nadie los corrige

    Los errores se descubren aguas abajo, se corrigen en una hoja de cálculo y vuelven al mes siguiente.

  3. 03

    El equipo de IA dedica la mayor parte de su tiempo a buscar datos

    Cada caso de uso empieza con semanas de solicitudes de acceso, extracciones y limpieza que el siguiente equipo volverá a repetir.

  4. 04

    Los archivos no sirven para la IA

    Documentos escaneados con un OCR deficiente, duplicados y sin metadatos. La recuperación sobre ellos devuelve ruido.

02 Qué entregamos

Qué entregamos

  1. 01 Cimientos de datos para la IA y la analítica

    Arquitecturas lakehouse con un modelado por capas, del dato en bruto al conformado y al de consumo, y productos de datos que publican qué contienen, cuán actualizados están y quién responde de ellos.

    Qué hacemos

    • Arquitectura de la plataforma y elección de los formatos de almacenamiento
    • Convenciones de modelado por capas
    • Diseño de productos de datos con contratos
    • Ingesta por lotes y mediante captura de cambios (CDC)

    Qué recibe

    • Plataforma lakehouse definida en código
    • Primeros productos de datos en producción
    • Plantilla de contrato de datos y proceso de revisión
  2. 02 Calidad, linaje y datos maestros

    Controles de calidad automatizados en cada capa, linaje desde la fuente hasta el informe, y datos maestros y de referencia para las entidades que importan: ciudadanos, clientes, productos y activos.

    Qué hacemos

    • Reglas de calidad con umbrales y alertas
    • Captura del linaje a nivel de columna
    • Reglas de emparejamiento y de supervivencia para los datos maestros
    • Gestión de los datos de referencia

    Qué recibe

    • Cuadro de mando de calidad por producto de datos
    • Linaje consultable
    • Registros maestros de referencia para las entidades prioritarias
  3. 03 Un gobierno del dato que se aplica

    Un catálogo, una clasificación y unas políticas de acceso que la plataforma aplica de forma automática. La limitación de la finalidad y la conservación que exige el RGPD quedan codificadas, y el intercambio de datos sigue las reglas del Reglamento de Gobernanza de Datos cuando es aplicable.

    Qué hacemos

    • Esquema de clasificación y etiquetado
    • Políticas de acceso basadas en atributos
    • Automatización de la conservación y la supresión
    • Acuerdos de intercambio de datos y controles técnicos

    Qué recibe

    • Catálogo alimentado desde la plataforma
    • Políticas de acceso como código
    • Calendario de conservación en funcionamiento
  4. 04 Contenido no estructurado preparado para la IA

    Mejora de la calidad del OCR, enriquecimiento de metadatos, deduplicación y depuración de archivos, para que la inteligencia documental y los sistemas de recuperación partan de un contenido que merezca la pena recuperar.

    Qué hacemos

    • Inventario de contenidos y muestreo de calidad
    • Mejoras del OCR y de la extracción de la maquetación
    • Detección de casi duplicados
    • Enriquecimiento de metadatos y clasificación

    Qué recibe

    • Repositorio de contenidos depurado y enriquecido
    • Informe de calidad de los contenidos
    • Reglas para los contenidos que se añadan a partir de ahora
  5. 05 Analítica y BI que la gente utiliza

    Una capa semántica con definiciones de KPI acordadas por negocio y TI, autoservicio gobernado y analítica integrada en productos SaaS y portales.

    Qué hacemos

    • Talleres de definición de KPI
    • Modelo semántico y capa de métricas
    • Salvaguardas para el autoservicio y conjuntos de datos certificados
    • Analítica integrada en productos orientados al cliente

    Qué recibe

    • Glosario de KPI con responsables
    • Modelo semántico certificado
    • Cuadros de mando que sustituyen a las hojas de cálculo
  6. 06 Streaming para uso operativo

    Captura de cambios y flujos de eventos allí donde las decisiones no pueden esperar a la carga nocturna: niveles de existencias, estado de los expedientes, señales de fraude.

    Qué hacemos

    • Requisitos de latencia por caso de uso
    • CDC desde las bases de datos operativas
    • Procesamiento de flujos y vistas materializadas
    • Diseño de la reproducción y la recarga histórica

    Qué recibe

    • Pipelines de streaming en producción
    • Vistas operativas con objetivos de actualización
    • Procedimiento de reproducción

03 Arquitectura

Una arquitectura de referencia ilustrativa

Los datos pasan de los sistemas operativos y los documentos, a través de la ingesta, a un lakehouse organizado en capas: en bruto tal como se reciben, después conformados y con la calidad verificada y, por último, productos de datos con un responsable y un contrato. Los consumidores nunca leen datos en bruto.

Desde los productos de datos, un recorrido alimenta la capa semántica y el BI; otros alimentan la recuperación y las variables para la IA, y las API de datos para otros sistemas. El gobierno del dato está por debajo de todo ello y lo aplica la plataforma, no un documento de políticas.

Ejemplo ilustrativo
  1. Fuentes e ingesta

    • Sistemas operativos
    • Documentos tras OCR y enriquecimiento
    • Lotes y captura de cambios
  2. Lakehouse

    • Capa en bruto
    • Capa conformada
    • Controles de calidad y linaje
    • Datos maestros y de referencia
    • Productos de datos con contratos
  3. Consumo

    • Capa semántica y BI
    • Recuperación y variables para la IA
    • API de datos e intercambio
  4. Gobierno

    • Gobierno: catálogo, clasificación, políticas de acceso, conservación
De las capas del lakehouse a productos de datos con responsable

Arquitectura ilustrativa, no corresponde a ningún sistema de cliente.

Leer el diagrama como texto

El recorrido principal va desde los sistemas operativos, a través de una ingesta por lotes y mediante captura de cambios, una capa en bruto, una capa conformada y los productos de datos, hasta una capa semántica con BI gobernado.

Los documentos no estructurados también entran por la ingesta tras el OCR y el enriquecimiento. Los controles de calidad y el linaje cubren las capas en bruto y conformada. Los datos maestros y de referencia alimentan los productos de datos. Estos también sirven a la recuperación y las variables para la IA, y a las API de datos para el intercambio.

Una franja de gobierno con catálogo, clasificación, políticas de acceso y conservación abarca toda la plataforma.

04 Consideraciones y límites

Consideraciones de ingeniería y límites

  • Primero los responsables, después las herramientas

    Cómo lo abordamos

    Cada producto de datos tiene un responsable de negocio, que decide qué significa, y un responsable técnico, que lo mantiene en funcionamiento. Ayudamos a definir ambos roles y el contrato entre productores y consumidores.

    Límites y dependencias

    Una plataforma no puede crear responsables. Si la organización no los designa, los problemas de calidad volverán, sean cuales sean las herramientas.

  • La limitación de la finalidad, en la práctica

    Cómo lo abordamos

    Los datos personales se etiquetan con las finalidades a las que pueden servir, y las políticas de acceso y de conservación siguen esas etiquetas de forma automática.

    Límites y dependencias

    Qué finalidades son lícitas lo deciden su delegado de protección de datos y sus asesores legales. Nosotros lo implantamos; no lo decidimos.

  • Los datos para la IA tienen su propio listón de calidad

    Cómo lo abordamos

    En los casos de uso de IA medimos lo que necesitan la recuperación y los modelos: cobertura, actualización, duplicados y calidad de la extracción de texto.

    Límites y dependencias

    Algunos archivos no merecen el esfuerzo de corregirlos. Una evaluación por muestreo se lo dirá, y a veces lo correcto es dejarlos fuera.

05 Cómo trabajamos

Cómo trabajamos

Construimos la plataforma en torno a los primeros productos de datos que importan, y no al revés.

  1. 01

    Elegir decisiones, no conjuntos de datos

    Partir de dos o tres decisiones o casos de uso de IA y de los datos que necesitan, con responsables designados.

    ResultadoBacklog de productos de datos con responsables

  2. 02

    Construir los cimientos a su alrededor

    Plataforma, ingesta, controles de calidad y gobierno, lo justo para dar un buen servicio a esos productos.

    ResultadoPrimeros productos de datos en producción

  3. 03

    Crecer producto a producto

    Cada nuevo producto reutiliza los cimientos; el catálogo y el glosario de KPI crecen con él.

    ResultadoHoja de ruta de productos e indicadores de adopción

06 Control humano

Dónde mantienen el control las personas

Las plataformas de datos automatizan los movimientos y las comprobaciones. Las personas deciden el significado, el acceso y la finalidad.

  • Los responsables aprueban las definiciones

    Un KPI o un producto de datos solo cambia de significado con la aprobación de su responsable de negocio, y el cambio queda versionado.

  • El acceso lo conceden los responsables de las políticas

    Los responsables de los datos deciden quién puede usar qué datos y con qué finalidad; la plataforma lo aplica y registra cada autorización.

  • Un incumplimiento de calidad detiene la cadena

    Cuando falla una comprobación del contrato, se avisa a los consumidores y el responsable decide si publicar, retener o corregir.

07 Tecnologías

Tecnologías con las que trabajamos

Plataformas
  • Databricks
  • Microsoft Fabric
  • Snowflake
  • Lakehouse abierto sobre Apache Iceberg o Delta Lake
Pipelines
  • dbt
  • Apache Spark
  • Kafka y Debezium
  • Orquestación nativa de la nube
Gobierno
  • Unity Catalog y Purview
  • Catálogos de código abierto
  • Frameworks de calidad de datos
  • Control de acceso basado en políticas
Analítica
  • Power BI
  • Capas semánticas y de métricas
  • Analítica integrada
  • Analítica de SAP (entornos existentes)

La mención de una tecnología refleja nuestra experiencia de ingeniería. No implica ninguna asociación con su fabricante ni su respaldo.

08 Ejemplo

Un ejemplo ilustrativo

Ejemplo ilustrativo

Indicadores comunes para una cadena de supermercados

01Situación
Una cadena de supermercados con plataformas logísticas en varias comunidades autónomas mide las roturas de stock de forma distinta en cada región, y el comité de dirección recibe cifras que no cuadran.
02Qué construiríamos
Una plataforma de datos con definiciones de indicadores acordadas, controles de calidad en cada carga y un linaje que muestra de qué sistema procede cada cifra.
03Dónde deciden las personas
Los responsables de cada región aprueban las definiciones; cualquier cambio de cálculo pasa por el comité de datos antes de publicarse.
04Qué mediríamos
Discrepancias entre fuentes resueltas, actualidad de los datos y decisiones semanales tomadas sobre el panel común.

09 Por sectores

En su sector

  • Datos de investigación y operativos gobernados, con una limitación estricta de la finalidad, seudonimización y registro de los accesos.

  • Datos maestros de productos y activos, y datos de calidad y producción, conectados para la planificación, la trazabilidad y la IA.

  • Fuentes auténticas, el principio de «solo una vez» e informes que responsables políticos y auditores pueden rastrear hasta el registro de origen.

España

Datos bajo reglas europeas y españolas

El RGPD y la LOPDGDD marcan cómo se tratan los datos personales en España, y la AEPD publica criterios concretos sobre anonimización y analítica. El Reglamento de Datos añade derechos de acceso a los datos que generan los productos conectados y obligaciones de portabilidad entre servicios cloud. En el sector público, el Esquema Nacional de Interoperabilidad fija cómo se comparten los datos entre administraciones.

Diseñamos plataformas en las que el linaje, la finalidad y los permisos de cada dato quedan documentados, para que la analítica y la IA se apoyen en información que su organización puede justificar.

Preguntas sobre datos y analítica

¿Necesitamos un data mesh?

Necesita sus partes útiles: productos de datos con responsables y contratos. La descentralización completa compensa en grandes organizaciones con equipos de dominio maduros. A muchas organizaciones les va mejor con un equipo central de plataforma y la responsabilidad de los productos en manos de cada dominio.

¿Están nuestros datos preparados para la IA?

Una evaluación breve, por muestreo, de las fuentes que necesita un caso de uso se lo dirá: cobertura, calidad, derechos de acceso y base jurídica. La respuesta suele ser «en parte», con una lista clara de qué corregir primero. Nuestros equipos de ingeniería de IA utilizan la misma evaluación.

Ya tenemos un data warehouse. ¿Hay que empezar de cero?

Rara vez. Un data warehouse que sirve informes fiables es un activo. Lo habitual es ampliarlo con capacidades lakehouse para los datos no estructurados y de gran volumen, y migrar solo cuando el coste o sus límites lo justifican.

¿Cómo gestionan el intercambio de datos con socios o con otras administraciones?

Mediante productos de datos expuestos a través de API gobernadas, con acuerdos, limitación de la finalidad y registro de actividad. Cuando son aplicables el Reglamento de Gobernanza de Datos o el Reglamento de Datos, diseñamos los controles técnicos; el encaje jurídico corresponde a sus asesores legales.

Díganos qué decisión no puede tomar con los datos de hoy

Partiremos de esa decisión para definir los datos necesarios, la calidad exigible y la primera entrega útil.