Zum Hauptinhalt springen
FromNine
Menü

KI & Daten

Datenfundamente, auf die sich KI und Entscheidungen verlassen können

Wir bauen Datenplattformen, auf denen jeder Datensatz eine verantwortliche Stelle, einen Datenvertrag und eine bekannte Qualität hat. So greifen Analytics, Betrieb und KI auf dieselben verlässlichen Zahlen zu.

Für Unternehmen und Verwaltungen in Deutschland, deren Daten in SAP, Fachverfahren und Insellösungen liegen und die eine verlässliche Grundlage für KI brauchen.

Daten & Analytics: LeistungsschichtenVier hintereinander gestaffelte Schichten. Von oben nach unten: Analytics und KI, die Daten nutzen, Datenprodukte mit Verantwortlichen und Datenverträgen, die Lakehouse-Schichten, die bereinigen und vereinheitlichen, und Governance über alles hinweg.01Nutzung durch Analytics und KI02Datenprodukte und Datenverträge03Lakehouse-Schichten04Governance und Lineage
  1. 01Datenprodukte mit benannten Verantwortlichen, Datenverträgen und Qualitätsprüfungen
  2. 02Governance, die Zweckbindung und Aufbewahrung technisch umsetzt, statt nur zu katalogisieren
  3. 03Eine einheitliche KPI-Definition, die Fachbereich und IT gemeinsam verabschieden

01 Herausforderungen

Typische Datenprobleme

Die meisten enttäuschenden KI-Projekte entpuppen sich als verkappte Datenprojekte.

  1. 01

    Drei Berichte, drei verschiedene Zahlen

    Finanzen, Betrieb und Geschäftsleitung berechnen Umsatz oder Fallaufkommen jeweils auf ihre Weise. Sitzungen beginnen mit Abgleichen statt mit Entscheiden.

  2. 02

    Niemand ist für die Daten zuständig, also behebt niemand die Fehler

    Fehler fallen erst nachgelagert auf, werden in einer Tabellenkalkulation korrigiert und tauchen im nächsten Monat wieder auf.

  3. 03

    Das KI-Team sucht vor allem nach Daten

    Jeder Anwendungsfall beginnt mit Wochen voller Zugriffsanträge, Extrakte und Bereinigungen, die das nächste Team wiederholen wird.

  4. 04

    Archive sind für KI unbrauchbar

    Gescannte Dokumente mit schwacher Texterkennung, Dubletten und ohne Metadaten. Ein Retrieval darüber liefert nur Rauschen.

02 Leistungsumfang

Unsere Leistungen

  1. 01 Datenfundamente für KI und Analytics

    Lakehouse-Architekturen mit geschichteter Modellierung, von Rohdaten über vereinheitlichte Daten bis zur Nutzung, und Datenprodukte, die offenlegen, was sie enthalten, wie aktuell sie sind und wer für sie einsteht.

    Was wir tun

    • Plattformarchitektur und Wahl der Speicherformate
    • Konventionen für die geschichtete Modellierung
    • Design von Datenprodukten mit Datenverträgen
    • Ingestion per Batch und Change Data Capture

    Was Sie erhalten

    • Lakehouse-Plattform als Code
    • Erste Datenprodukte im Produktivbetrieb
    • Vorlage für Datenverträge und Review-Prozess
  2. 02 Qualität, Lineage und Stammdaten

    Automatisierte Qualitätsprüfungen auf jeder Schicht, Lineage von der Quelle bis zum Bericht und Stamm- und Referenzdaten für die Objekte, auf die es ankommt: Bürgerinnen und Bürger, Kunden, Produkte und Anlagen.

    Was wir tun

    • Qualitätsregeln mit Schwellenwerten und Alarmen
    • Lineage auf Spaltenebene
    • Abgleichs- und Survivorship-Regeln für Stammdaten
    • Referenzdatenmanagement

    Was Sie erhalten

    • Qualitäts-Dashboard je Datenprodukt
    • Abfragbare Lineage
    • Golden Records für priorisierte Objekte
  3. 03 Governance, die durchgesetzt wird

    Ein Katalog, eine Klassifizierung und Zugriffsrichtlinien, die die Plattform automatisch anwendet. Zweckbindung und Aufbewahrung nach DSGVO sind technisch hinterlegt, und die gemeinsame Datennutzung folgt den Regeln des Data Governance Act, wo er gilt.

    Was wir tun

    • Klassifizierungsschema und Tagging
    • Attributbasierte Zugriffsrichtlinien
    • Automatisierte Aufbewahrung und Löschung
    • Vereinbarungen zur Datenweitergabe und technische Kontrollen

    Was Sie erhalten

    • Aus der Plattform befüllter Datenkatalog
    • Zugriffsrichtlinien als Code
    • Aufbewahrungsplan im Betrieb
  4. 04 Unstrukturierte Inhalte KI-fähig machen

    Bessere OCR-Qualität, Anreicherung mit Metadaten, Deduplizierung und Archivbereinigung, damit Dokumentenverarbeitung mit KI und Retrieval-Systeme auf Inhalten aufsetzen, die sich zu finden lohnen.

    Was wir tun

    • Inhaltsinventur und Qualitätsstichproben
    • Verbesserte OCR- und Layout-Extraktion
    • Erkennung von Beinahe-Dubletten
    • Anreicherung mit Metadaten und Klassifizierung

    Was Sie erhalten

    • Bereinigter, angereicherter Inhaltsspeicher
    • Bericht zur Inhaltsqualität
    • Regeln für künftig hinzukommende Inhalte
  5. 05 Analytics und BI, die genutzt werden

    Eine semantische Schicht mit KPI-Definitionen, die Fachbereich und IT gemeinsam verabschieden, gesteuerter Self-Service und Embedded Analytics in SaaS-Produkten und Portalen.

    Was wir tun

    • Workshops zur KPI-Definition
    • Semantisches Modell und Kennzahlenschicht
    • Leitplanken für Self-Service und zertifizierte Datasets
    • Embedded Analytics für kundennahe Produkte

    Was Sie erhalten

    • KPI-Glossar mit Verantwortlichen
    • Zertifiziertes semantisches Modell
    • Dashboards, die Tabellenkalkulationen ablösen
  6. 06 Streaming für den operativen Einsatz

    Change Data Capture und Event Streams, wo Entscheidungen nicht auf die nächtliche Beladung warten können: Lagerbestände, Fallstatus, Betrugssignale.

    Was wir tun

    • Latenzanforderungen je Anwendungsfall
    • CDC aus operativen Datenbanken
    • Stream Processing und materialisierte Sichten
    • Konzept für Replay und Nachladen

    Was Sie erhalten

    • Streaming-Pipelines im Produktivbetrieb
    • Operative Sichten mit Aktualitätszielen
    • Replay-Verfahren

03 Architektur

Eine beispielhafte Referenzarchitektur

Daten fließen aus operativen Systemen und Dokumenten über die Ingestion in ein Lakehouse mit Schichten: roh wie empfangen, dann vereinheitlicht und qualitätsgeprüft, dann Datenprodukte mit Verantwortlichen und Datenvertrag. Nutzende Systeme lesen nie Rohdaten.

Von den Datenprodukten aus speist ein Pfad die semantische Schicht und das BI, andere speisen KI-Retrieval und Features sowie Daten-APIs für andere Systeme. Governance liegt unter allem und wird von der Plattform angewendet, nicht von einem Richtliniendokument.

Beispiel zur Veranschaulichung
  1. Quellen und Ingestion

    • Operative Systeme
    • Dokumente nach OCR und Anreicherung
    • Batch und Change Data Capture
  2. Lakehouse

    • Rohdatenschicht
    • Vereinheitlichte Schicht
    • Qualitätsprüfungen und Lineage
    • Stamm- und Referenzdaten
    • Datenprodukte mit Datenverträgen
  3. Nutzung

    • Semantische Schicht und BI
    • KI-Retrieval und Features
    • Daten-APIs und Datenteilung
  4. Governance

    • Governance: Katalog, Klassifizierung, Zugriffsrichtlinien, Aufbewahrung
Lakehouse-Schichten bis zu verantworteten Datenprodukten

Beispielhafte Architektur, kein Kundensystem.

Diagramm als Text lesen

Der Hauptpfad führt von operativen Systemen über die Ingestion per Batch und Change Data Capture, eine Rohdatenschicht, eine vereinheitlichte Schicht und Datenprodukte zu einer semantischen Schicht mit gesteuertem BI.

Unstrukturierte Dokumente gelangen nach OCR und Anreicherung ebenfalls über die Ingestion hinein. Qualitätsprüfungen und Lineage decken die Rohdaten- und die vereinheitlichte Schicht ab. Stamm- und Referenzdaten speisen die Datenprodukte. Die Datenprodukte bedienen außerdem KI-Retrieval und Features sowie Daten-APIs für die gemeinsame Nutzung.

Ein Governance-Band mit Katalog, Klassifizierung, Zugriffsrichtlinien und Aufbewahrung umspannt die Plattform.

04 Abwägungen und Grenzen

Technische Abwägungen und Grenzen

  • Verantwortung vor Werkzeugen

    Wie wir vorgehen

    Jedes Datenprodukt erhält eine fachlich verantwortliche Person, die über seine Bedeutung entscheidet, und eine technisch verantwortliche, die es am Laufen hält. Wir helfen, beide Rollen und den Vertrag zwischen Erzeugern und Nutzern zu definieren.

    Grenzen und Abhängigkeiten

    Eine Plattform kann keine Verantwortung schaffen. Benennt die Organisation keine Verantwortlichen, kehren die Qualitätsprobleme zurück, gleich mit welchen Werkzeugen.

  • Zweckbindung in der Praxis

    Wie wir vorgehen

    Personenbezogene Daten werden mit den Zwecken markiert, denen sie dienen dürfen, und Zugriffsrichtlinien und Aufbewahrung folgen diesen Markierungen automatisch.

    Grenzen und Abhängigkeiten

    Welche Zwecke rechtmäßig sind, entscheiden Ihre Datenschutzbeauftragten und Ihre Rechtsberatung. Wir setzen es um, wir entscheiden es nicht.

  • Daten für KI haben eigene Qualitätsmaßstäbe

    Wie wir vorgehen

    Für KI-Anwendungsfälle messen wir, was Retrieval und Modelle brauchen: Abdeckung, Aktualität, Dubletten und die Qualität der Textextraktion.

    Grenzen und Abhängigkeiten

    Manche Archive lohnen die Aufbereitung nicht. Eine stichprobenbasierte Bewertung zeigt es, und manchmal ist es richtig, sie außen vor zu lassen.

05 Zusammenarbeit

So arbeiten wir

Wir bauen die Plattform um die ersten Datenprodukte herum, auf die es ankommt, nicht umgekehrt.

  1. 01

    Entscheidungen wählen, nicht Datensätze

    Ausgangspunkt sind zwei oder drei Entscheidungen oder KI-Anwendungsfälle und die Daten, die sie brauchen, mit benannten Verantwortlichen.

    ErgebnisBacklog der Datenprodukte mit Verantwortlichen

  2. 02

    Fundamente darum herum bauen

    Plattform, Ingestion, Qualitätsprüfungen und Governance, gerade so viel, dass diese Produkte sauber bedient werden.

    ErgebnisErste Datenprodukte im Produktivbetrieb

  3. 03

    Produkt für Produkt wachsen

    Jedes neue Produkt nutzt das Fundament mit, Katalog und KPI-Glossar wachsen mit.

    ErgebnisProdukt-Roadmap und Kennzahlen zur Nutzung

06 Menschliche Kontrolle

Wo Menschen die Kontrolle behalten

Datenplattformen automatisieren Bewegung und Prüfung. Menschen entscheiden über Bedeutung, Zugriff und Zweck.

  • Verantwortliche genehmigen Definitionen

    Eine KPI oder ein Datenprodukt ändert ihre Bedeutung nur mit Zustimmung der fachlich verantwortlichen Person, und die Änderung wird versioniert.

  • Zugriff vergeben die Verantwortlichen der Richtlinien

    Die Datenverantwortlichen entscheiden, wer welche Daten zu welchem Zweck nutzen darf. Die Plattform setzt das durch und protokolliert jede Freigabe.

  • Qualitätsverstöße stoppen das Band

    Schlägt eine Vertragsprüfung fehl, werden die Nutzenden informiert, und die verantwortliche Person entscheidet, ob veröffentlicht, zurückgehalten oder korrigiert wird.

07 Technologien

Technologien, mit denen wir arbeiten

Plattformen
  • Databricks
  • Microsoft Fabric
  • Snowflake
  • Offenes Lakehouse auf Apache Iceberg oder Delta Lake
Pipelines
  • dbt
  • Apache Spark
  • Kafka und Debezium
  • Cloud-native Orchestrierung
Governance
  • Unity Catalog und Purview
  • Open-Source-Kataloge
  • Frameworks für Datenqualität
  • Richtlinienbasierte Zugriffskontrolle
Analytics
  • Power BI
  • Semantische Schichten und Kennzahlenschichten
  • Embedded Analytics
  • SAP Analytics (Bestandssysteme)

Die Nennung einer Technologie beschreibt unsere Engineering-Erfahrung. Sie bedeutet keine Partnerschaft mit dem Hersteller und keine Empfehlung durch ihn.

08 Beispiel

Beispielhaftes Szenario

Beispiel zur Veranschaulichung

Einheitliche Kennzahlen für einen Hersteller mit mehreren Werken

01Ausgangslage
Ein mittelständischer Hersteller mit vier Werken berichtet Ausbringung, Ausschuss und Lieferfähigkeit aus SAP, zwei MES und Excel-Listen. In der Geschäftsführung werden Zahlen verglichen, die unterschiedlich definiert sind.
02Was wir bauen würden
Abgestimmte Datenprodukte je Werk, eine semantische Schicht mit verbindlichen Kennzahldefinitionen und Dashboards, die ihre Datenherkunft zeigen.
03Wo Menschen entscheiden
Das Werkscontrolling gibt die Zuordnung seiner Daten frei; das zentrale Controlling verantwortet Definitionen und Änderungen.
04Was wir messen würden
Aufwand für den Monatsbericht, Zahl der Korrekturen nach Veröffentlichung, Nutzung zertifizierter Dashboards.

09 Branchenblick

In Ihrer Branche

  • Gesteuerte Forschungs- und Betriebsdaten mit strikter Zweckbindung, Pseudonymisierung und Zugriffsprotokollierung.

  • Produkt- und Anlagenstammdaten, Qualitäts- und Produktionsdaten, zusammengeführt für Planung, Rückverfolgbarkeit und KI.

  • Authentische Quellen, Datennutzung nach dem Once-Only-Prinzip und Berichte, die Politik und Rechnungsprüfung bis zum einzelnen Datensatz zurückverfolgen können.

Deutschland

Daten nutzen, Regeln einhalten

Datenprojekte in Deutschland bewegen sich zwischen zwei Anforderungen: Die Fachbereiche wollen Daten schneller nutzen, Datenschutz, Revision und Mitbestimmung wollen nachvollziehen können, wofür. DSGVO und BDSG bestimmen Zweck, Speicherdauer und Zugriff, die EU-Datenverordnung gibt Nutzern Rechte an Daten aus vernetzten Produkten. In der Verwaltung prägen die Registermodernisierung und die XÖV-Standards, wie Daten zwischen Behörden fließen.

Wir entwerfen Datenprodukte, deren Verträge Zweck, Verarbeitungsort und Aufbewahrungsfrist festhalten, damit die Plattform die richtige Regel automatisch anwendet und Auswertungen prüfbar bleiben.

Fragen zu Daten und Analytics

Brauchen wir ein Data Mesh?

Sie brauchen dessen nützliche Teile: Datenprodukte mit Verantwortlichen und Datenverträgen. Vollständige Dezentralisierung lohnt sich in großen Organisationen mit reifen Fachteams. Viele Organisationen fahren besser mit einem zentralen Plattformteam und fachlicher Verantwortung für die Produkte.

Sind unsere Daten bereit für KI?

Das zeigt eine kurze, stichprobenbasierte Bewertung der Quellen, die ein Anwendungsfall braucht: Abdeckung, Qualität, Zugriffsrechte und Rechtsgrundlage. Die Antwort lautet meist „teilweise“, mit einer klaren Liste, was zuerst zu beheben ist. Unsere Teams für KI-Engineering nutzen dieselbe Bewertung.

Wir haben bereits ein Data Warehouse. Fangen wir von vorn an?

Selten. Ein Warehouse, das verlässliche Berichte liefert, ist ein Wert. Meist erweitern wir es um Lakehouse-Fähigkeiten für unstrukturierte und große Datenmengen und migrieren nur dort, wo Kosten oder Grenzen es rechtfertigen.

Wie gehen Sie mit dem Datenaustausch mit Partnern oder anderen Behörden um?

Über Datenprodukte, die über gesteuerte APIs bereitgestellt werden, mit Vereinbarungen, Zweckbindung und Protokollierung. Wo der Data Governance Act oder der Data Act gelten, gestalten wir die technischen Kontrollen. Die rechtliche Einordnung bleibt bei Ihrer Rechtsberatung.

Nennen Sie die Entscheidung, die Ihre heutigen Daten nicht tragen

Wir verfolgen, was sie braucht, bis zu den Quellsystemen zurück und zeigen, was ein erstes Datenprodukt kosten und leisten würde.