Zum Hauptinhalt springen
FromNine
Menü

KI & Daten

KI-Engineering für generative KI im Produktivbetrieb

Wir entwickeln Anwendungen mit generativer KI auf Basis Ihres eigenen Wissens und Ihrer Daten: mit einem Retrieval, das Berechtigungen respektiert, einer Evaluierung als Voraussetzung für jedes Release und mit Kosten, Qualität und Latenz, die Sie jederzeit im Blick haben.

Für Unternehmen und Verwaltungen in Deutschland, die generative KI aus dem Pilotprojekt in den geprüften Betrieb bringen wollen, mit Datenschutz und Mitbestimmung an Bord.

KI-Engineering & generative KI: LeistungsschichtenVier hintereinander gestaffelte Schichten. Von oben nach unten: Retrieval über Ihre Quellen, das Modell-Gateway, Evaluierung und Guardrails sowie die Anwendung, mit der Ihre Nutzenden arbeiten. Ein durchgehender Pfad führt von den Quellen bis zur Anwendung.01Retrieval über Ihre Quellen02Modell-Gateway und Routing03Evaluierung und Guardrails04Anwendung im Produktivbetrieb
  1. 01Antworten mit Quellenangabe und einer Absage, wenn die Belege fehlen
  2. 02Ein Golden Set und Regressionstests, vor dem Go-live mit Ihren Teams abgestimmt
  3. 03Modell-Routing und Budgets, die Kosten und Latenz je Anfrage sichtbar machen

01 Herausforderungen

Woran generative KI scheitert

Das Modell ist selten das eigentliche Problem. Die meisten Vorhaben geraten an allem ins Stocken, was darum herum gebaut werden muss.

  1. 01

    Der Pilot hat überzeugt, aber niemand kann sagen, ob er gut ist

    Die Qualität haben einige wenige Personen anhand einiger Fragen beurteilt. Ein Testset gibt es nicht, also wird jede Prompt-Änderung und jedes Modell-Upgrade zum Glücksspiel.

  2. 02

    Der Assistent zeigt Dokumente, die niemand sehen dürfte

    Inhalte wurden ohne ihre Zugriffsrechte indexiert. IT-Sicherheit und Betriebsrat stoppen den Rollout, und das zu Recht.

  3. 03

    Die Kosten wachsen schneller als die Nutzung

    Jede Anfrage geht an das größte Modell mit dem längsten Kontext. Niemand kennt die Kosten einer einzelnen Antwort, also kann sie auch niemand steuern.

  4. 04

    Die Antworten klingen richtig und sind es nicht

    Das Retrieval liefert Beinahe-Treffer, das Modell füllt die Lücken flüssig auf, und nach dem dritten selbstsicheren Fehler ist das Vertrauen der Nutzenden verspielt.

02 Leistungsumfang

Unsere Leistungen

  1. 01 Retrieval und Wissenssysteme im Unternehmen

    Retrieval, das je Quelle konzipiert wird: wie Inhalte geparst und in Abschnitte zerlegt werden, wie lexikalische Suche und Vektorsuche zusammenspielen und wie die Zugriffsrechte jede Textstelle begleiten. Die Grundlage für Wissensassistenten im Unternehmen.

    Was wir tun

    • Bestandsaufnahme der Quellen mit Verantwortlichen, Formaten und Berechtigungsmodellen
    • Chunking- und Metadatenstrategie je Dokumenttyp
    • Hybride lexikalische und Vektorsuche mit Re-Ranking
    • Berechtigungsbewusstes Retrieval, das die Zugriffsrechte der Quelle übernimmt

    Was Sie erhalten

    • Ingestion-Pipelines mit Änderungserkennung
    • Retrieval-Service mit Quellenangaben und Regeln für Absagen
    • Bericht zur Retrieval-Qualität je Quelle
  2. 02 Modellstrategie ohne Lock-in

    Ein Modell-Gateway zwischen Ihren Anwendungen und den Modellen: So routen Sie je Aufgabe, weichen bei Ausfall eines Anbieters aus und wechseln Modelle, wenn sich Preise und Fähigkeiten ändern.

    Was wir tun

    • Optionen von gehosteten Frontier-Modellen über Bereitstellungen in der EU bis zu selbst betriebenen Open-Weight-Modellen
    • Routing nach Aufgabe, Schutzbedarf und Kosten
    • Fallbacks, Timeouts, Caching und Rate Limits
    • Prüfung der Bedingungen zur Datenverarbeitung gemeinsam mit Ihrer Rechtsabteilung und IT-Sicherheit

    Was Sie erhalten

    • Modell-Gateway mit Routing-Regeln als Konfiguration
    • Dokumentierte Modellentscheidung je Anwendungsfall
    • Kosten- und Latenzbudget je Anfragetyp
  3. 03 Evaluierung als Ingenieursdisziplin

    Qualitätskriterien, abgestimmt mit den Verantwortlichen für den Prozess und überführt in Testsets, die bei jeder Änderung laufen. Modellbasierte Bewertungen kalibrieren wir zunächst gegen menschliche Prüfung, bevor wir uns auf sie verlassen.

    Was wir tun

    • Golden Sets je Anwendungsfall, erstellt mit Fachleuten aus dem Fachbereich
    • Getrennte Offline-Evaluierung von Retrieval und Generierung
    • Red-Teaming gegen Prompt Injection und Datenabfluss
    • Online-Evaluierung anhand von Rückmeldungen aus dem Betrieb und Stichprobenprüfungen

    Was Sie erhalten

    • Evaluierungssuite als Release-Gate in der CI
    • Qualitätskriterien mit Freigabe durch den Fachbereich
    • Red-Teaming-Befunde und Gegenmaßnahmen
  4. 04 LLMOps und Observability

    Tracing von der Frage über die gefundenen Textstellen und den Modellaufruf bis zur Antwort. Prompts und Modelle werden wie Code versioniert, Budgets im Betrieb durchgesetzt.

    Was wir tun

    • Tracing und strukturiertes Logging jeder Anfrage
    • Versionierung von Prompts, Modellen und Indizes
    • Semantisches und exaktes Caching, wo es sicher ist
    • Drift- und Qualitätsmonitoring mit Alerting

    Was Sie erhalten

    • Dashboards für Qualität, Kosten und Latenz
    • Incident-Playbook für KI-spezifische Störungen
    • Runbook für Modell- und Index-Updates
  5. 05 Governance by Design

    Wir entwickeln mit Blick auf die KI-Verordnung der EU (AI Act): von der Risikoeinstufung und Ihrer Rolle als Anbieter oder Betreiber bis zu Protokollierung, menschlicher Aufsicht und Dokumentation. Die rechtliche Bewertung bleibt bei Ihrer eigenen Rechtsberatung.

    Was wir tun

    • Einstufung des Anwendungsfalls und Pflichten je Rolle
    • Zuarbeit zur Datenschutz-Folgenabschätzung nach DSGVO
    • Konzept für Protokollierung und menschliche Aufsicht
    • Modell- und Systemdokumentation direkt beim Code

    Was Sie erhalten

    • Paket zur Systemdokumentation
    • Konzept für Protokollierung und Aufbewahrung
    • Aufsichtsverfahren je Anwendungsfall
  6. 06 Fine-Tuning und Dokumentverständnis, wenn die Evaluierung es verlangt

    Fine-Tuning, Distillation und multimodales Dokumentverständnis sind Werkzeuge für konkrete Lücken. Wir setzen sie ein, wenn die Evaluierungssuite zeigt, dass Retrieval und Prompting nicht ausreichen, und nicht früher.

    Was wir tun

    • Lückenanalyse auf Basis der Evaluierungsergebnisse
    • Plan für Datenaufbereitung und Annotation
    • Distillation auf kleinere Modelle für Kosten oder Latenz
    • Layoutbewusste Extraktion aus gescannten und komplexen Dokumenten

    Was Sie erhalten

    • Vergleichende Evaluierung vorher und nachher
    • Nachvollziehbare Herkunft der Trainingsdaten
    • Entscheidung über Beibehalten, Zurückrollen oder Ablösen

03 Architektur

Eine beispielhafte Referenzarchitektur

Die meisten Systeme mit generativer KI, die wir für Unternehmen bauen, folgen demselben Muster: Retrieval über Ihre Quellen, ein Modell-Gateway, Guardrails vor und nach dem Modell sowie darunter ein Kreislauf aus Evaluierung und Observability, der entscheidet, was live gehen darf.

Der Berechtigungsfilter sitzt im Retrieval, nicht in der Benutzeroberfläche. Darf eine Person ein Dokument im Quellsystem nicht öffnen, erreichen dessen Textstellen das Modell in ihrem Namen nie.

Ebenen der Darstellung

Quellen
Dokumentablagen, Wikis und Fachsysteme sowie der Identity Provider, der weiß, wer was sehen darf.
Retrieval
Ingestion, hybrider Index, Re-Ranking und Berechtigungsfilter.
Modelle
Ein Gateway, das zwischen gehosteten, in der EU gehosteten und selbst betriebenen Modellen routet, mit Fallbacks und Caching.
Anwendung
Antworten mit Quellenangabe, Absage bei fehlenden Belegen und Guardrails für Ein- und Ausgabe.
Betrieb und Verbesserung
Golden Sets, Regressions-Gates, Traces und Budgets. Traces aus dem Betrieb fließen in das nächste Testset.
Beispiel zur Veranschaulichung
  1. Quellen

    • Dokumentablagen und Wikis
    • Fachsysteme
    • Identity Provider
  2. Retrieval

    • Ingestion und Chunking
    • Hybrider Index
    • Berechtigungsfilter
    • Retrieval und Re-Ranking
  3. Modelle

    • Modell-Gateway
    • Gehostete, EU- und selbst betriebene Modelle
    • Guardrails für Ein- und Ausgabe
  4. Anwendung

    • Anwendung mit Quellenangaben
  5. Betrieb und Verbesserung

    • Golden Sets und Regressions-Gates
    • Traces, Kosten- und Latenzbudgets
Retrieval, Modell-Gateway und Evaluierungskreislauf

Beispielhafte Architektur, kein Kundensystem.

Diagramm als Text lesen

Der Hauptpfad führt von den Dokumentablagen über Ingestion, einen hybriden Index, Retrieval mit Re-Ranking und das Modell-Gateway bis zur Anwendung.

Auch Fachsysteme speisen die Ingestion. Der Identity Provider versorgt einen Berechtigungsfilter, der das Retrieval einschränkt. Guardrails prüfen Ein- und Ausgabe der Anwendung. Das Gateway routet zu gehosteten Frontier-Modellen, Bereitstellungen in der EU und selbst betriebenen Open-Weight-Modellen.

Darunter liegen eine Evaluierungssuite mit Golden Sets und Regressions-Gates sowie Observability mit Traces, Kosten- und Latenzbudgets. Traces aus dem Betrieb fließen in die Evaluierungssuite.

04 Abwägungen und Grenzen

Technische Abwägungen und Grenzen

  • Qualität wird gemessen, nicht versprochen

    Wie wir vorgehen

    Wir vereinbaren Qualitätskriterien mit Ihren Prozessverantwortlichen und testen die KI-Ausgaben vor und nach jedem Release dagegen.

    Retrieval und Generierung werden getrennt evaluiert, damit jeder Fehler auf seine Ursache verweist.

    Grenzen und Abhängigkeiten

    KI-Ausgaben können falsch sein. Deshalb sehen wir Prüfschritte für unsichere Fälle vor und eine Absage, wenn Belege fehlen.

    Ein Testset ist nur so gut wie die Fachleute, die es mit aufbauen. Wir brauchen ihre Zeit früh im Projekt.

  • Berechtigungen reisen mit dem Inhalt

    Wie wir vorgehen

    Zugriffsrechte werden bei der Ingestion erfasst und bei jeder Abfrage gegen Ihren Identity Provider durchgesetzt.

    Grenzen und Abhängigkeiten

    Wo Quellsysteme Rechte so verwalten, dass sie sich nicht zuverlässig auslesen lassen, bleiben diese Inhalte außen vor, bis das möglich ist.

    Zu weit freigegebene Inhalte bleiben zu weit freigegeben. Retrieval macht sie leichter auffindbar, daher steht manchmal zuerst eine Bereinigung an.

  • Kosten und Latenz sind Designvorgaben

    Wie wir vorgehen

    Jeder Anfragetyp erhält ein Budget. Routing, Caching und Kontextgröße werden darauf abgestimmt, und die Dashboards zeigen, wohin das Geld fließt.

    Grenzen und Abhängigkeiten

    Preise und Rate Limits der Anbieter ändern sich außerhalb Ihres Einflusses. Das Gateway ermöglicht eine Reaktion, eine Preiserhöhung macht es aber nicht ungeschehen.

  • Modelle ändern sich ohne Ihr Zutun

    Wie wir vorgehen

    Modelle werden auf eine Version fixiert, und jedes Upgrade durchläuft die vollständige Evaluierungssuite, bevor es bei den Nutzenden ankommt.

    Grenzen und Abhängigkeiten

    Gehostete Modelle werden mitunter kurzfristig abgekündigt. Wir planen je Anwendungsfall eine Alternative, und dieser Plan braucht die Freigabe der Verantwortlichen.

05 Zusammenarbeit

So arbeiten wir

Die Reihenfolge ist entscheidend: Wir legen fest, wie gemessen wird, bevor wir festlegen, was gebaut wird.

  1. 01

    Anwendungsfall schärfen

    Wer nutzt das System, welche Entscheidungen unterstützt es, auf welche Quellen darf es zugreifen und was kostet eine falsche Antwort.

    ErgebnisSteckbrief des Anwendungsfalls und Risikoeinstufung

  2. 02

    Golden Set aufbauen

    Echte Fragen und erwartete Antworten, gesammelt mit Ihren Fachleuten, einschließlich der Fragen, die das System ablehnen soll.

    ErgebnisVersioniertes Testset

  3. 03

    Zuerst das Retrieval

    Ingestion, Index und Berechtigungsfilter, optimiert, bis die Retrieval-Qualität die vereinbarte Schwelle erreicht.

    ErgebnisBericht zur Retrieval-Qualität

  4. 04

    Release hinter Gates

    Generierung, Guardrails und Gateway gehen erst live, wenn die Evaluierungssuite in der CI bestanden ist.

    ErgebnisRelease mit Evaluierungsnachweis

  5. 05

    Betreiben und verbessern

    Traces, Stichprobenprüfungen und Rückmeldungen der Nutzenden fließen in das nächste Testset und das nächste Release.

    ErgebnisMonatliches Review zu Qualität, Kosten und Latenz

06 Menschliche Kontrolle

Wo Menschen die Kontrolle behalten

Generative KI entwirft, sucht und schlägt vor. Menschen entscheiden, was sie sehen darf, was als gut gilt und was geschieht, wenn sie unsicher ist.

  • Verantwortliche geben die Qualität frei

    Die fachlich verantwortliche Person jedes Anwendungsfalls genehmigt Qualitätskriterien und Release-Nachweise, nicht das Projektteam allein.

  • Unsichere Antworten gehen an Menschen

    Unterhalb einer vereinbarten Konfidenzschwelle sagt das System ab oder leitet die Frage an ein benanntes Team weiter.

  • Zugriff wird an der Quelle geregelt

    Wer ein Dokument sehen darf, entscheiden das Quellsystem und Ihr Identity Provider, niemals die KI-Schicht.

  • Rückmeldungen verändern das System

    Nutzende können Antworten markieren. Menschen prüfen diese Markierungen, und bestätigte Fehler werden zu Testfällen.

07 Technologien

Technologien, mit denen wir arbeiten

Retrieval
  • OpenSearch und Elasticsearch
  • PostgreSQL mit pgvector
  • Azure AI Search
  • Cross-Encoder-Re-Ranker
Modelle
  • Gehostete Frontier-Modelle
  • Verwaltete Modelldienste in EU-Regionen
  • Open-Weight-Modelle auf vLLM
  • Embedding-Modelle je Sprache
Evaluierung und Betrieb
  • Tracing mit OpenTelemetry
  • CI-basierte Evaluierungssuiten
  • Prompt- und Modell-Registries
  • Langfuse oder vergleichbare Werkzeuge
Anwendung
  • Services in TypeScript und Python
  • Streaming-APIs
  • Bestehende Portale sowie Frontends von Salesforce, SAP und Odoo

Die Nennung einer Technologie beschreibt unsere Engineering-Erfahrung. Sie bedeutet keine Partnerschaft mit dem Hersteller und keine Empfehlung durch ihn.

08 Beispiel

Beispielhaftes Szenario

Beispiel zur Veranschaulichung

Ein Richtlinienassistent für einen Industriekonzern

01Ausgangslage
Ein Industriekonzern mit mehreren deutschen Standorten pflegt Richtlinien, Betriebsvereinbarungen und Arbeitsanweisungen in verschiedenen Systemen. Mitarbeitende stellen Personal- und Rechtsabteilung immer wieder dieselben Fragen.
02Was wir bauen würden
Retrieval über die freigegebenen Dokumente mit den Zugriffsrechten des jeweiligen Quellsystems, Antworten mit Verweis auf die maßgebliche Fundstelle und Hosting in einem Rechenzentrum in der EU.
03Wo Menschen entscheiden
Personal- und Rechtsabteilung geben das Testset frei; der Betriebsrat stimmt Einsatz und Protokollierung vorab zu. Standortspezifische Fragen verweist der Assistent an die zuständige Stelle.
04Was wir messen würden
Anteil der Antworten mit korrekter Fundstelle, Enthaltungsquote bei Fragen außerhalb des Bestands, Kosten je Antwort.

09 Branchenblick

In Ihrer Branche

  • Assistenten für Sachbearbeitung und Bürgerservice, die die Rechtsgrundlage zitieren, in den benötigten Amtssprachen arbeiten und protokollieren, was für wen abgerufen wurde.

  • Assistenten für Richtlinien und Arbeitsanweisungen mit strikten Berechtigungen, durchgängiger Nachvollziehbarkeit und einer Modellrisiko-Dokumentation, die Ihre zweite Verteidigungslinie prüfen kann.

  • Retrieval über Protokolle und Produktdokumentation mit klaren Grenzen: keine klinischen Entscheidungen, sensible Daten bleiben in freigegebenen Umgebungen.

Deutschland

Generative KI unter deutschen Bedingungen

Ein KI-Assistent geht in Deutschland erst in den Produktivbetrieb, wenn mehrere Stellen zugestimmt haben: die Datenschutzbeauftragten nach DSGVO und BDSG, oft der Betriebs- oder Personalrat, weil das System Arbeitsabläufe berührt, und die Informationssicherheit, die Hosting und Protokollierung bewertet. Dazu kommen die Transparenz- und Dokumentationspflichten der KI-Verordnung.

Wir bereiten diese Entscheidungen mit vor: Datenflüsse und Speicherorte legen wir je Anwendungsfall fest, Protokolle und Evaluierungsergebnisse dokumentieren wir so, dass sie in eine Betriebsvereinbarung oder ein Sicherheitskonzept einfließen können. Wo Daten die EU nicht verlassen dürfen, planen wir Modelle und Hosting entsprechend.

Fragen zum KI-Engineering

Welches Modell empfehlen Sie?

Das hängt von der Aufgabe, den betroffenen Daten und Ihren Anforderungen an das Hosting ab. Meist kombinieren wir Modelle: ein leistungsfähiges Modell für anspruchsvolle Denkschritte, kleinere oder selbst betriebene Modelle für Klassifikation und Extraktion und Bereitstellungen in der EU, wo Daten in der EU bleiben müssen.

Das Gateway hält diese Entscheidung umkehrbar, sodass sich die Antwort mit Modellen und Preisen ändern kann.

Wie genau wird das System sein?

Wir nennen keine Genauigkeit, bevor wir sie auf Ihren Daten gemessen haben. Wir vereinbaren Qualitätskriterien mit Ihnen, bauen ein Testset auf und berichten die Ergebnisse vor dem Go-live und nach jeder Änderung.

KI-Ausgaben können falsch sein. Deshalb legen wir im Design fest, was dann geschieht: Absage, Prüfschritte und der Weg zu einem Menschen.

Werden unsere Daten zum Training fremder Modelle verwendet?

Nicht in den Architekturen, die wir entwerfen. Wir wählen Modelldienste, deren Bedingungen ein Training mit Ihren Eingaben ausschließen, oder betreiben Modelle selbst in Ihrer Umgebung, und wir dokumentieren die Entscheidung je Anwendungsfall gemeinsam mit Ihrer IT-Sicherheit.

Gilt die KI-Verordnung der EU für unseren Anwendungsfall?

Wir helfen Ihnen einzuschätzen, welche Pflichten auf Basis des Anwendungsfalls und Ihrer Rolle als Anbieter oder Betreiber gelten können, und gestalten Protokollierung, Aufsicht und Dokumentation passend dazu. Die rechtliche Bewertung bleibt bei Ihrer eigenen Rechtsberatung.

Wie gehen Sie mit Sicherheit und sensiblen Daten um?

FromNine ist nach ISO/IEC 27001 zertifiziert. Zugriffsgrenzen, Datenresidenz und Aufbewahrung werden vereinbart, bevor wir bauen, und Red-Teaming gegen Prompt Injection und Datenabfluss ist Teil des Release-Prozesses, den wir aufsetzen.

Was ist ein sinnvoller erster Schritt?

Ein Anwendungsfall mit klarer fachlicher Verantwortung, einer begrenzten Zahl von Quellen und einem Testset, das mit Ihren Fachleuten entsteht. So erhalten Sie ein funktionierendes System und belastbare Erkenntnisse zu Qualität, Kosten und Latenz, genau das, was die nächste Investitionsentscheidung braucht.

Bringen Sie einen Anwendungsfall und seine schwierigsten Fragen mit

Wir zeigen Ihnen, wie wir den Nutzen messen würden, bevor wir über die Umsetzung sprechen, und welche Unterlagen Datenschutz und Mitbestimmung dafür brauchen.