Zum Hauptinhalt springen
FromNine
Menü

AI EngineeringDaten

Was Wissenssuche im Unternehmen vertrauenswürdig macht

Fragen aus den eigenen Dokumenten zu beantworten, lässt sich leicht vorführen und nur schwer verlässlich machen. Vertrauen entsteht aus fünf Eigenschaften, die Sie gestalten, testen und fortlaufend prüfen können: Berechtigungen, Herkunft, Aktualität, ehrliche Lücken und gemessene Qualität.

Von
FromNine Redaktion
Veröffentlicht
Lesezeit
6 Min. Lesezeit

Das Wichtigste

  1. Setzen Sie Zugriffsrechte beim Abruf durch, pro Person und auf Basis der Quellsysteme. Verlassen Sie sich nie darauf, dass das Modell eine Passage zurückhält, die es bereits erhalten hat.
  2. Jede Aussage einer Antwort sollte auf eine Passage verweisen, die ein Mensch in Sekunden öffnen und prüfen kann, mit sichtbarem Datum und Status.
  3. Messen Sie die Qualität von Abruf und Antworten vor dem Livegang an echten Fragen, und messen Sie danach weiter, denn Inhalte und Modelle verändern sich laufend.
Inhalt

Das Demo-Problem

Die meisten Wissensassistenten folgen demselben Muster, bekannt als Retrieval-Augmented Generation (öffnet externe Website) (RAG): Zuerst werden die Passagen gesucht, die zu einer Frage passen, dann schreibt ein Sprachmodell eine Antwort, die auf diesen Passagen beruht. Auf einem kuratierten Ordner mit fünfzig Dokumenten funktioniert das innerhalb einer Woche überzeugend.

Im Produktivbetrieb sieht es anders aus: zwanzig Jahre Netzlaufwerke, Wikis, Tickets, Verträge und Richtlinien, viele davon doppelt, veraltet oder vertraulich. In diesem Umfeld scheitert der Assistent auf zwei Arten. Er gibt eine falsche Antwort, und die Menschen hören auf, ihn zu nutzen. Oder, schlimmer: Er gibt eine falsche Antwort mit voller Überzeugung, und die Menschen handeln danach.

Vertrauenswürdige Wissenssuche hängt deshalb weniger vom Modell ab als von fünf Eigenschaften des Systems, das es umgibt. Jede davon lässt sich gestalten und, das ist entscheidend, testen.

Berechtigungen: nur abrufen, was die Person lesen darf

Die Regel ist einfach: Der Assistent darf niemandem eine Passage zeigen, die diese Person im Quellsystem nicht öffnen könnte. Entscheidend ist, wo die Regel durchgesetzt wird. Erreicht eine Passage das Modell, kann sie in der Antwort auftauchen. Berechtigungen müssen deshalb vor der Generierung greifen, beim Abruf, für die Person, die fragt.

OWASP zählt sowohl die Offenlegung sensibler Informationen (öffnet externe Website) als auch Schwachstellen bei Vektoren und Embeddings (öffnet externe Website), einschließlich Datenabflüssen über Berechtigungsgrenzen hinweg, zu den Hauptrisiken von Anwendungen mit Sprachmodellen. In der Praxis ergeben sich daraus vier Anforderungen.

  • Speichern Sie die Zugriffsrechte jedes Quelldokuments mit jedem Textabschnitt im Index, übernommen aus dem Quellsystem statt von Hand neu definiert.
  • Filtern Sie zum Zeitpunkt der Abfrage nach diesen Rechten, anhand der Identität der angemeldeten Person, und zwar vor Ranking und Generierung.
  • Synchronisieren Sie Rechteänderungen mindestens so schnell wie Inhaltsänderungen, und legen Sie fest, wie schnell ein entzogenes Recht wirksam werden muss.
  • Testen Sie mit echten Rollen. „Findet eine Praktikantin die Gehaltstabellen?“ gehört in die Testsuite, nicht in die Nachbereitung eines Vorfalls.

Herkunft: Quellenangaben, die ein Mensch prüfen kann

Jede Aussage einer Antwort sollte auf die Passage verweisen, aus der sie stammt: Dokumenttitel, Version oder Datum, verantwortliche Stelle und ein Link, der an der richtigen Stelle öffnet. Zeigen Sie die Passage selbst, nicht nur den Dokumentnamen, damit Lesende in Sekunden erkennen, ob die Quelle den Satz tatsächlich stützt.

Gestalten Sie das Antwortformat so, dass nicht belegter Text auffällt. Stützt keine abgerufene Passage einen Satz, sollte das System ihn weglassen oder kennzeichnen. Prüfen Sie das anschließend automatisch: Vergleichen Sie jede zitierte Passage mit der Aussage, die sie stützen soll, und lassen Sie Stichproben von Menschen prüfen. Quellenangaben, die zwar vorhanden sind, die Aussage aber nicht stützen, sind ein häufiger und unauffälliger Fehler.

Aktualität und Verbindlichkeit

Wissen in Organisationen hat Versionen. Die alte und die neue Reiserichtlinie passen beide zur Frage „Darf ich Business Class buchen?“, und sie geben unterschiedliche Antworten. Indexieren Sie die Metadaten, die sie unterscheiden: Gültigkeitsdatum, Status (Entwurf, freigegeben, ersetzt) und verantwortliche Stelle. Ranken Sie aktuelle, freigegebene Dokumente zuerst, schließen Sie ersetzte aus, sofern nicht ausdrücklich nach der Historie gefragt wird, und zeigen Sie das Datum in jeder Quellenangabe.

Legen Sie je Thema fest, welche Quelle maßgeblich ist. Die Personalrichtlinie kommt aus dem HR-Portal, nicht aus einer E-Mail, die die Vorjahresfassung zitiert. Bestimmen Sie je Quelle einen Rhythmus für die Neuindexierung, von nahezu Echtzeit für Vorgangsdaten bis täglich für ein Wiki, und überwachen Sie ihn: Ein veralteter Index liefert Antworten, die richtig aussehen und es nicht sind.

Ehrliche Lücken: „Dazu habe ich nichts gefunden“

Oft ist die wertvollste Antwort eine ehrliche Lücke. Sprachmodelle können flüssige Aussagen erzeugen, die durch nichts gestützt sind; NIST nennt das in seinem Profil für generative KI Konfabulation (öffnet externe Website). Die Verankerung in abgerufenen Passagen verringert das, beseitigt es aber nicht. OWASP behandelt die Folge, dass Menschen auf Grundlage falscher Ausgaben handeln, unter dem Stichwort Misinformation (öffnet externe Website) als eigenes Risiko.

Legen Sie eine Relevanzschwelle fest, unterhalb derer das System meldet, dass es keine verlässliche Quelle gefunden hat, und einen Hinweis gibt, wo man stattdessen nachfragen kann. Bei Fragen zu Richtlinien, Rechten oder Pflichten darf das Modell Lücken nicht mit Allgemeinwissen füllen. Verfolgen Sie dann die Quote unbeantworteter Fragen je Thema. In den ersten Monaten ist diese Liste oft das nützlichste Ergebnis des ganzen Projekts: Sie zeigt den Verantwortlichen für die Inhalte genau, wo Dokumentation fehlt.

Die Architektur hinter den fünf Eigenschaften

Nichts davon erfordert einen exotischen Technologie-Stack. Es erfordert, dass Berechtigungen, Metadaten und Prüfungen vollwertige Bestandteile der Pipeline sind und keine Funktionen, die nach der Demo nachgerüstet werden.

Abbildung 1

Beispielhafter Ablauf
Eine berechtigungsbewusste Retrieval-PipelineZugriffsrechte und Dokumentmetadaten begleiten jede Passage von der Aufnahme bis zur Antwort. Zwei Prüfpunkte entscheiden, was das Modell sehen und was die Person lesen darf.
Diagramm als Text lesen

Dokumente werden zusammen mit ihren Zugriffsrechten und Metadaten wie Datum, Status und verantwortlicher Stelle aus den Quellsystemen übernommen und indexiert.

Eine Frage geht mit der Identität der angemeldeten Person ein. Ein Rechtefilter entfernt jede Passage, die diese Person nicht lesen darf, bevor irgendetwas das Modell erreicht.

Das Modell entwirft eine Antwort mit Quellenangaben zu den verbleibenden Passagen. Eine Belegprüfung vergleicht jede Aussage mit der zitierten Passage. Die Person erhält entweder eine belegte Antwort oder den ehrlichen Hinweis, dass keine verlässliche Quelle gefunden wurde.

Personenbezogene Daten verdienen besondere Aufmerksamkeit. Auch ein Index von Dokumenten verarbeitet die personenbezogenen Daten, die darin enthalten sind; es gelten also die DSGVO-Grundsätze der Zweckbindung und Datenminimierung (öffnet externe Website) (Artikel 5). Lassen Sie Quellen weg, die der Anwendungsfall nicht braucht, sorgen Sie dafür, dass Löschungen im Quellsystem auch im Index ankommen, und beziehen Sie den Index ein, wenn Sie ein Auskunftsersuchen beantworten.

Gemessene Qualität, vor und nach dem Livegang

Vertrauenswürdigkeit lässt sich nicht beurteilen, indem man in einer Besprechung ein paar Fragen ausprobiert. Vereinbaren Sie Qualitätskriterien mit den Verantwortlichen für die Inhalte, und messen Sie jede Schicht getrennt, damit Sie wissen, wo ein Problem zu beheben ist.

Tabelle 1Was Sie bei einem Wissensassistenten im Unternehmen messen sollten
SchichtFrageMessmethode
AbrufKamen die richtigen Passagen zurück?Recall und Precision gegenüber einem annotierten Satz echter Fragen
BelegungWird jede Aussage durch ihre Quellenangabe gestützt?Automatisierter Abgleich von Aussage und Passage, ergänzt um menschliche Stichproben
AntwortIst die Antwort richtig, vollständig und nützlich?Fachliche Prüfung einer Stichprobe anhand vereinbarter Kriterien
ZugriffHat jemand etwas gesehen, das nicht für ihn bestimmt war?Eine Berechtigungs-Testsuite je Rolle, ausgeführt bei jeder Änderung an Index oder Konnektor
NutzungVerlassen sich Menschen darauf, und wo versagt es?Feedback, Quote unbeantworteter Fragen je Thema, Folgefragen, Eskalationen

Bauen Sie den Testsatz aus echten Fragen auf: Suchprotokolle, Helpdesk-Tickets, Fragen neuer Kolleginnen und Kollegen. Einige hundert Fragen mit Antworten, die die Verantwortlichen für die Inhalte abgestimmt haben, sind ein praktikabler Anfang. Führen Sie den vollständigen Satz bei jeder Änderung aus, ob neues Modell, neue Chunking-Strategie oder neue Quelle. Die Qualität driftet unbemerkt, wenn sich Inhalte ändern, und nur ein fester Testsatz macht diese Drift sichtbar.

Woran Nutzende Vertrauenswürdigkeit erkennen

Für die Menschen, die den Assistenten nutzen, läuft all das auf wenige beobachtbare Eigenschaften hinaus. Er antwortet nur aus Dokumenten, die sie lesen dürfen. Jede Aussage hat eine Quellenangabe, die sie öffnen können. Sie sehen, wie aktuell eine Quelle ist. Sie erfahren klar, wenn es keine verlässliche Antwort gibt. Und sie wissen, dass jemand die Qualität misst, weil sie eine falsche Antwort melden können und sehen, dass sie korrigiert wird.

KI-Ausgaben können trotzdem falsch sein, und manche Fragen verdienen einen Menschen statt einer Suche. Offen dafür zu gestalten, ist keine Schwäche des Systems. Genau das macht Menschen bereit, sich bei allem anderen darauf zu verlassen.

Quellen

  1. arXiv. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020) (abgerufen am )
  2. OWASP GenAI Security Project. LLM02:2025 Sensitive Information Disclosure (abgerufen am )
  3. OWASP GenAI Security Project. LLM08:2025 Vector and Embedding Weaknesses (abgerufen am )
  4. OWASP GenAI Security Project. LLM09:2025 Misinformation (abgerufen am )
  5. National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1) (abgerufen am )
  6. EUR-Lex. Verordnung (EU) 2016/679 (Datenschutz-Grundverordnung), Artikel 5 (abgerufen am )

Sie wollen Ihr eigenes Wissen durchsuchbar machen?

Wir bauen Wissensassistenten auf Ihren bestehenden Quellen, auch wenn Ihre Dokumente auf Deutsch, Französisch und Niederländisch vorliegen, mit Berechtigungen, Quellenangaben und einem Testsatz, den wir vom ersten Sprint an mit Ihren Fachbereichen abstimmen.