Aller au contenu principal
FromNine
Menu

IA et données

Des fondations de données et d’analytique sur lesquelles l’IA et les décisions peuvent s’appuyer

Nous construisons des plateformes de données où chaque jeu de données a un responsable, un contrat et une qualité connue, pour que l’analytique, les opérations et l’IA s’appuient sur les mêmes chiffres de confiance.

Pour les directions data et les DSI qui veulent une donnée fiable, gouvernée et documentée avant d’y brancher des usages d’IA.

Données et analytique : les couches de la solutionQuatre couches superposées en profondeur. De haut en bas : l’analytique et l’IA qui consomment les données, les produits de données avec leurs responsables et leurs contrats, les couches du lakehouse qui nettoient et harmonisent, et la gouvernance qui couvre l’ensemble.01Usages analytiques et IA02Produits de données et contrats03Couches du lakehouse04Gouvernance et lignage
  1. 01Des produits de données avec responsables désignés, contrats et contrôles de qualité
  2. 02Une gouvernance qui traduit la limitation des finalités et les durées de conservation en règles appliquées, pas seulement en catalogue
  3. 03Un seul jeu de définitions d’indicateurs, validé à la fois par le métier et par l’IT

01 Enjeux

Des problèmes de données bien connus

La plupart des projets d’IA décevants se révèlent être des projets de données qui s’ignorent.

  1. 01

    Trois rapports, trois chiffres différents

    La finance, les opérations et la direction calculent chacune le chiffre d’affaires ou le volume de dossiers à leur manière. Les réunions commencent par un rapprochement au lieu d’une décision.

  2. 02

    Personne n’est responsable des données, donc personne ne les corrige

    Les erreurs sont découvertes en aval, corrigées dans un tableur et reviennent le mois suivant.

  3. 03

    L’équipe IA passe l’essentiel de son temps à chercher des données

    Chaque cas d’usage commence par des semaines de demandes d’accès, d’extractions et de nettoyage que l’équipe suivante refera.

  4. 04

    Les archives sont inexploitables pour l’IA

    Documents numérisés avec un OCR médiocre, doublons et aucune métadonnée. La recherche documentaire n’y remonte que du bruit.

02 Prestations

Ce que nous livrons

  1. 01 Des fondations de données pour l’IA et l’analytique

    Des architectures lakehouse avec une modélisation en couches, des données brutes aux données harmonisées puis aux données de consommation, et des produits de données qui indiquent ce qu’ils contiennent, leur fraîcheur et qui en répond.

    Ce que nous faisons

    • Architecture de la plateforme et choix des formats de stockage
    • Conventions de modélisation en couches
    • Conception de produits de données avec contrats
    • Ingestion par lots et par capture des changements (CDC)

    Ce que vous recevez

    • Plateforme lakehouse décrite en code
    • Premiers produits de données en production
    • Modèle de contrat de données et processus de revue
  2. 02 Qualité, lignage et données de référence

    Des contrôles de qualité automatisés à chaque couche, un lignage de la source au rapport, et des données maîtres et de référence pour les entités qui comptent : citoyens, clients, produits et actifs.

    Ce que nous faisons

    • Règles de qualité avec seuils et alertes
    • Capture du lignage au niveau des colonnes
    • Règles de rapprochement et de consolidation des données maîtres
    • Gestion des données de référence

    Ce que vous recevez

    • Tableau de bord qualité par produit de données
    • Lignage interrogeable
    • Enregistrements de référence (golden records) pour les entités prioritaires
  3. 03 Une gouvernance effectivement appliquée

    Un catalogue, une classification et des politiques d’accès que la plateforme applique automatiquement. La limitation des finalités et la conservation prévues par le RGPD sont traduites en règles, et le partage de données respecte le règlement européen sur la gouvernance des données (Data Governance Act) lorsqu’il s’applique.

    Ce que nous faisons

    • Schéma de classification et étiquetage
    • Politiques d’accès fondées sur les attributs
    • Automatisation de la conservation et de la suppression
    • Accords de partage de données et contrôles techniques

    Ce que vous recevez

    • Catalogue alimenté depuis la plateforme
    • Politiques d’accès en code
    • Calendrier de conservation opérationnel
  4. 04 Des contenus non structurés prêts pour l’IA

    Amélioration de la qualité de l’OCR, enrichissement des métadonnées, dédoublonnage et nettoyage des archives, pour que l’intelligence documentaire et les systèmes de recherche partent de contenus qui méritent d’être retrouvés.

    Ce que nous faisons

    • Inventaire des contenus et échantillonnage de la qualité
    • Amélioration de l’OCR et de l’extraction de la mise en page
    • Détection des quasi-doublons
    • Enrichissement des métadonnées et classification

    Ce que vous recevez

    • Référentiel de contenus nettoyé et enrichi
    • Rapport de qualité des contenus
    • Règles applicables aux nouveaux contenus
  5. 05 Une analytique et une BI réellement utilisées

    Une couche sémantique avec des définitions d’indicateurs convenues entre métier et IT, un libre-service encadré et une analytique intégrée aux produits SaaS et aux portails.

    Ce que nous faisons

    • Ateliers de définition des indicateurs
    • Modèle sémantique et couche de métriques
    • Garde-fous du libre-service et jeux de données certifiés
    • Analytique intégrée aux produits destinés aux clients

    Ce que vous recevez

    • Glossaire des indicateurs avec responsables
    • Modèle sémantique certifié
    • Tableaux de bord qui remplacent les tableurs
  6. 06 Le streaming pour les usages opérationnels

    Capture des changements et flux d’événements lorsque les décisions ne peuvent pas attendre le chargement nocturne : niveaux de stock, statut des dossiers, signaux de fraude.

    Ce que nous faisons

    • Exigences de latence par cas d’usage
    • CDC depuis les bases opérationnelles
    • Traitement de flux et vues matérialisées
    • Conception du rejeu et du rattrapage

    Ce que vous recevez

    • Chaînes de streaming en production
    • Vues opérationnelles avec objectifs de fraîcheur
    • Procédure de rejeu

03 Architecture

Une architecture de référence illustrative

Les données passent des systèmes opérationnels et des documents, via l’ingestion, à un lakehouse organisé en couches : données brutes telles que reçues, puis données harmonisées et contrôlées, puis produits de données dotés d’un responsable et d’un contrat. Les consommateurs ne lisent jamais les données brutes.

Depuis les produits de données, un flux alimente la couche sémantique et la BI ; d’autres alimentent la recherche et les variables pour l’IA, ainsi que des API de données pour d’autres systèmes. La gouvernance couvre l’ensemble et c’est la plateforme qui l’applique, pas un document de politique.

Exemple illustratif
  1. Sources et ingestion

    • Systèmes opérationnels
    • Documents après OCR et enrichissement
    • Lots et capture des changements
  2. Lakehouse

    • Couche brute
    • Couche harmonisée
    • Contrôles de qualité et lignage
    • Données maîtres et de référence
    • Produits de données avec contrats
  3. Consommation

    • Couche sémantique et BI
    • Recherche et variables pour l’IA
    • API de données et partage
  4. Gouvernance

    • Gouvernance : catalogue, classification, politiques d’accès, conservation
Des couches du lakehouse aux produits de données dotés d’un responsable

Architecture illustrative, pas un système client.

Lire le schéma sous forme de texte

Le parcours principal part des systèmes opérationnels, passe par une ingestion par lots et par capture des changements, une couche brute, une couche harmonisée et des produits de données, jusqu’à une couche sémantique avec une BI gouvernée.

Les documents non structurés entrent aussi par l’ingestion, après OCR et enrichissement. Les contrôles de qualité et le lignage couvrent les couches brute et harmonisée. Les données maîtres et de référence alimentent les produits de données. Ceux-ci servent aussi la recherche et les variables pour l’IA, ainsi que des API de données pour le partage.

Une bande de gouvernance avec catalogue, classification, politiques d’accès et conservation couvre toute la plateforme.

04 Points d’attention et limites

Choix d’ingénierie et limites

  • La responsabilité avant l’outillage

    Notre méthode

    Chaque produit de données reçoit un responsable métier, qui décide de ce qu’il signifie, et un responsable technique, qui en assure le fonctionnement. Nous aidons à définir ces deux rôles et le contrat entre producteurs et consommateurs.

    Limites et dépendances

    Une plateforme ne crée pas la responsabilité. Si l’organisation ne désigne pas de responsables, les problèmes de qualité reviendront, quel que soit l’outillage.

  • La limitation des finalités, en pratique

    Notre méthode

    Les données personnelles sont étiquetées avec les finalités qu’elles peuvent servir, et les politiques d’accès comme la conservation suivent automatiquement ces étiquettes.

    Limites et dépendances

    Déterminer quelles finalités sont licites relève de votre délégué à la protection des données et de vos conseils. Nous le mettons en œuvre ; nous ne le décidons pas.

  • Les données pour l’IA ont leurs propres exigences de qualité

    Notre méthode

    Pour les cas d’usage d’IA, nous mesurons ce dont la recherche et les modèles ont besoin : couverture, fraîcheur, doublons et qualité de l’extraction de texte.

    Limites et dépendances

    Certaines archives ne valent pas la peine d’être corrigées. Une évaluation par échantillonnage vous le dira, et parfois la bonne réponse est de les laisser de côté.

05 Notre façon de travailler

Notre façon de travailler

Nous construisons la plateforme autour des premiers produits de données qui comptent, et non l’inverse.

  1. 01

    Partir des décisions, pas des jeux de données

    Commencer par deux ou trois décisions ou cas d’usage d’IA et les données dont ils ont besoin, avec des responsables désignés.

    LivrableBacklog de produits de données avec responsables

  2. 02

    Construire les fondations autour d’eux

    Plateforme, ingestion, contrôles de qualité et gouvernance, juste ce qu’il faut pour servir correctement ces produits.

    LivrablePremiers produits de données en production

  3. 03

    Étendre produit par produit

    Chaque nouveau produit réutilise les fondations ; le catalogue et le glossaire des indicateurs s’enrichissent au fil de l’eau.

    LivrableFeuille de route des produits et indicateurs d’adoption

06 Contrôle humain

Là où l’humain garde la main

Les plateformes de données automatisent les flux et les contrôles. Ce sont des personnes qui décident du sens, des accès et des finalités.

  • Les responsables approuvent les définitions

    Un indicateur ou un produit de données ne change de sens qu’avec l’accord de son responsable métier, et la modification est versionnée.

  • Les accès sont accordés par les responsables des politiques

    Les responsables des données décident qui peut utiliser quelles données et pour quelle finalité ; la plateforme l’applique et journalise chaque autorisation.

  • Un écart de qualité arrête la chaîne

    Lorsqu’un contrôle de contrat échoue, les consommateurs sont informés et le responsable décide de publier, de suspendre ou de corriger.

07 Technologies

Technologies que nous utilisons

Plateformes
  • Databricks
  • Microsoft Fabric
  • Snowflake
  • Lakehouse ouvert sur Apache Iceberg ou Delta Lake
Chaînes de traitement
  • dbt
  • Apache Spark
  • Kafka et Debezium
  • Orchestration native du cloud
Gouvernance
  • Unity Catalog et Purview
  • Catalogues open source
  • Cadres de qualité des données
  • Contrôle d’accès fondé sur des politiques
Analytique
  • Power BI
  • Couches sémantiques et de métriques
  • Analytique intégrée
  • Analytique SAP (environnements existants)

La mention d’une technologie décrit notre expérience d’ingénierie. Elle n’implique ni partenariat avec son éditeur ni recommandation de sa part.

08 Exemple

Un exemple illustratif

Exemple illustratif

Les factures électroniques comme source de pilotage

01Situation
Une ETI de distribution reçoit désormais ses factures fournisseurs au format structuré via sa plateforme agréée, mais ses tableaux de bord achats reposent toujours sur des extractions manuelles de l’ERP.
02Ce que nous construirions
Un produit de données « factures fournisseurs » alimenté par la plateforme agréée et l’ERP, avec contrat de données, contrôles de qualité et indicateurs partagés entre achats et finance.
03Là où l’humain décide
Le contrôle de gestion valide la définition des indicateurs ; toute rupture de qualité bloque la publication et alerte le responsable du produit.
04Ce que nous mesurerions
Délai de mise à disposition des indicateurs, écarts entre achats et comptabilité, part des factures rapprochées automatiquement.

09 Regard sectoriel

Dans votre secteur

  • Des données de recherche et des données opérationnelles gouvernées, avec une stricte limitation des finalités, la pseudonymisation et la journalisation des accès.

  • Données de référence produits et actifs, données qualité et données de production réunies pour la planification, la traçabilité et l’IA.

  • Sources authentiques, collecte unique des données et rapports que les décideurs publics et les auditeurs peuvent retracer jusqu’à l’enregistrement d’origine.

France

Gouverner la donnée sous le RGPD et le Data Act

En France, la gouvernance des données se joue sous le regard de la CNIL : finalités, durées de conservation, registre des traitements, analyses d’impact. Le règlement européen sur les données (Data Act) ouvre des droits d’accès aux données des produits connectés, et la réforme de la facturation électronique fait de chaque facture une donnée structurée exploitable.

Nous concevons des produits de données dont le contrat précise finalités, durées et lieux de traitement, pour que la plateforme applique la bonne règle sans multiplier les copies.

Questions sur les données et l’analytique

Avons-nous besoin d’un data mesh ?

Vous avez besoin de ce qu’il a d’utile : des produits de données avec des responsables et des contrats. Une décentralisation complète se justifie dans les grandes organisations dotées d’équipes métier matures. Beaucoup d’organisations s’en sortent mieux avec une équipe plateforme centrale et des domaines métier responsables des produits.

Nos données sont-elles prêtes pour l’IA ?

Une évaluation courte, par échantillonnage, des sources nécessaires à un cas d’usage vous le dira : couverture, qualité, droits d’accès et base légale. La réponse est généralement « en partie », avec une liste claire de ce qu’il faut corriger en premier. Nos équipes d’ingénierie IA utilisent la même évaluation.

Nous avons déjà un entrepôt de données. Faut-il repartir de zéro ?

Rarement. Un entrepôt de données qui alimente des rapports fiables est un actif. Nous l’étendons généralement avec des capacités lakehouse pour les données non structurées et à fort volume, et ne migrons que lorsque le coût ou les limites le justifient.

Comment gérez-vous le partage de données avec des partenaires ou d’autres administrations ?

Au moyen de produits de données exposés par des API gouvernées, avec accords, limitation des finalités et journalisation. Lorsque le Data Governance Act ou le Data Act s’appliquent, nous concevons les contrôles techniques ; le cadrage juridique reste du ressort de vos conseils.

Partons d’un indicateur qui fait débat

Choisissez un indicateur sur lequel vos directions ne s’accordent pas. Nous remontons jusqu’aux sources et montrons ce qu’une donnée gouvernée changerait, en associant votre DPO.