AI-engineeringData
Wat kennisontsluiting in organisaties betrouwbaar maakt
Vragen beantwoorden uit uw eigen documenten is gemakkelijk te demonstreren en moeilijk te vertrouwen. Vertrouwen komt van vijf eigenschappen die u kunt ontwerpen, testen en blijven testen: rechten, herkomst, actualiteit, eerlijkheid over hiaten en gemeten kwaliteit.
- Door
- Redactie FromNine
- Gepubliceerd
- Leestijd
- 6 min. leestijd
De kern
- Dwing toegangsrechten af bij het ophalen, per gebruiker, op basis van de bronsystemen. Reken er nooit op dat het model een passage achterhoudt die het al heeft gekregen.
- Elke bewering in een antwoord moet verwijzen naar een passage die iemand in enkele seconden kan openen en controleren, met zichtbare datum en status.
- Meet de kwaliteit van het ophalen en van de antwoorden met echte vragen vóór de ingebruikname, en blijf meten, want inhoud en modellen veranderen onder u door.
Inhoud
Het demoprobleem
De meeste kennisassistenten volgen hetzelfde patroon, bekend als retrieval-augmented generation (opent een externe website) (RAG): zoek de passages die bij een vraag passen en laat een taalmodel daarop een antwoord baseren. Op een zorgvuldig samengestelde map van vijftig documenten werkt dat binnen een week overtuigend.
De praktijk ziet er anders uit. Twintig jaar aan gedeelde schijven, wiki’s, tickets, contracten en beleidsdocumenten, vaak dubbel, verouderd of vertrouwelijk. In die omgeving faalt de assistent op twee manieren. Hij geeft een fout antwoord en mensen haken af. Of, erger, hij geeft vol overtuiging een fout antwoord en mensen handelen ernaar.
Betrouwbare kennisontsluiting draait daarom minder om het model en meer om vijf eigenschappen van het systeem eromheen. Elk daarvan kunt u ontwerpen en, belangrijker nog, testen.
Rechten: alleen ophalen wat de gebruiker mag lezen
De regel is eenvoudig: de assistent mag nooit een passage tonen die iemand in het bronsysteem niet zou kunnen openen. Waar u dat afdwingt, maakt het verschil. Als een passage het model bereikt, ga er dan van uit dat ze in het antwoord kan opduiken. Rechten moeten dus vóór het genereren worden toegepast, bij het ophalen, voor de gebruiker die de vraag stelt.
OWASP rekent zowel het lekken van gevoelige informatie (opent een externe website) als zwakke plekken in vectoren en embeddings (opent een externe website), waaronder lekken over de grenzen van toegangsrechten heen, tot de belangrijkste risico’s van toepassingen met taalmodellen. In de praktijk leidt dat tot vier eisen.
- Sla bij elk fragment in de index de toegangsrechten van het brondocument op, overgenomen uit het bronsysteem in plaats van handmatig opnieuw gedefinieerd.
- Filter bij elke zoekvraag op die rechten, met de identiteit van de ingelogde gebruiker, vóór het rangschikken en genereren.
- Synchroniseer wijzigingen in rechten minstens even snel als wijzigingen in inhoud, en spreek af hoe snel een ingetrokken recht moet doorwerken.
- Test met echte rollen. ‘Kan een stagiair de salarisschalen vinden?’ hoort in de testset, niet in een evaluatie na een incident.
Herkomst: bronvermeldingen die iemand kan controleren
Elke bewering in een antwoord moet verwijzen naar de passage waar ze vandaan komt: documenttitel, versie of datum, eigenaar, en een link die op de juiste plek opent. Toon de passage zelf, niet alleen de documentnaam, zodat de lezer in enkele seconden ziet of de bronvermelding de zin ondersteunt.
Ontwerp het antwoordformaat zo dat niet-onderbouwde tekst opvalt. Als geen enkele opgehaalde passage een zin ondersteunt, moet het systeem die zin weglaten of markeren. Controleer dat vervolgens automatisch: vergelijk elke geciteerde passage met de bewering die ze moet onderbouwen, en leg steekproeven voor aan mensen. Bronvermeldingen die bestaan maar de bewering niet onderbouwen, zijn een veelvoorkomende en stille fout.
Actualiteit en gezag
Kennis in een organisatie kent versies. Het oude en het nieuwe reisbeleid passen allebei bij de vraag ‘mag ik business class boeken?’, en ze geven verschillende antwoorden. Indexeer de metadata die ze onderscheidt: ingangsdatum, status (concept, goedgekeurd, vervangen) en eigenaar. Rangschik actuele, goedgekeurde documenten eerst, sluit vervangen documenten uit tenzij de gebruiker naar de geschiedenis vraagt, en toon de datum in elke bronvermelding.
Bepaal per onderwerp welke bron gezaghebbend is. Het hr-beleid komt uit het hr-portaal, niet uit een e-mail die de versie van vorig jaar citeert. Stel per bron een ritme voor herindexering in, van bijna realtime voor dossiergegevens tot dagelijks voor een wiki, en bewaak het: een verouderde index levert antwoorden op die juist lijken en het niet zijn.
Eerlijk over hiaten: ‘Dit heb ik niet gevonden’
Vaak is het waardevolste antwoord een eerlijk benoemd hiaat. Taalmodellen kunnen vlotte beweringen produceren die nergens door worden onderbouwd; NIST noemt dat confabulatie (opent een externe website) in zijn profiel voor generatieve AI. Antwoorden baseren op opgehaalde passages vermindert dat, maar sluit het niet uit. OWASP behandelt het gevolg, mensen die handelen op basis van onjuiste output, als een apart risico onder de noemer misinformatie (opent een externe website).
Stel een relevantiedrempel in waaronder het systeem meldt dat het geen betrouwbare bron vond, en verwijs door naar waar de gebruiker de vraag wel kan stellen. Laat het model bij vragen over beleid, rechten of plichten geen gaten opvullen met algemene kennis. Volg daarna per onderwerp het aandeel vragen zonder antwoord. In de eerste maanden is die lijst vaak de nuttigste output van het hele project: ze toont inhoudseigenaren precies waar documentatie ontbreekt.
De architectuur achter de vijf eigenschappen
Hiervoor is geen exotische stack nodig. Wel moeten rechten, metadata en controles volwaardige onderdelen van de pipeline zijn, en geen functies die na de demo worden toegevoegd.
Figuur 1
Illustratieve workflowLees het diagram als tekst
Documenten worden samen met hun toegangsrechten en metadata zoals datum, status en eigenaar uit de bronsystemen gehaald en geïndexeerd.
Een vraag komt binnen met de identiteit van de ingelogde gebruiker. Een rechtenfilter verwijdert elke passage die die gebruiker niet mag lezen, voordat er iets bij het model terechtkomt.
Het model stelt een antwoord op met bronvermeldingen naar de overgebleven passages. Een controle op onderbouwing vergelijkt elke bewering met de geciteerde passage. De gebruiker krijgt een antwoord met bronvermeldingen of de eerlijke melding dat er geen betrouwbare bron is gevonden.
Persoonsgegevens verdienen expliciete aandacht. Een index van documenten blijft een verwerking van de persoonsgegevens die erin staan, dus de AVG-beginselen van doelbinding en minimale gegevensverwerking (opent een externe website) (artikel 5) zijn van toepassing. Laat bronnen weg die de toepassing niet nodig heeft, zorg dat verwijderingen in een bronsysteem ook de index bereiken, en neem de index mee wanneer u een inzageverzoek beantwoordt.
Gemeten kwaliteit, voor en na de ingebruikname
Betrouwbaarheid beoordeelt u niet door in een vergadering een paar vragen uit te proberen. Spreek kwaliteitscriteria af met de mensen die eigenaar zijn van de inhoud, en meet elke laag afzonderlijk, zodat u weet waar u een probleem moet oplossen.
| Laag | Vraag | Hoe meten |
|---|---|---|
| Ophalen | Kwamen de juiste passages terug? | Recall en precisie tegenover een gelabelde set echte vragen |
| Onderbouwing | Wordt elke bewering door haar bronvermelding ondersteund? | Geautomatiseerde controles van bewering tegen passage, plus steekproeven door mensen |
| Antwoord | Is het antwoord juist, volledig en bruikbaar? | Beoordeling van een steekproef door experts, op basis van afgesproken criteria |
| Toegang | Heeft iemand iets gezien wat hij niet mocht zien? | Een testset voor rechten per rol, bij elke wijziging van index of connector |
| Gebruik | Vertrouwen mensen erop, en waar faalt het? | Feedback, aandeel vragen zonder antwoord per onderwerp, vervolgvragen, escalaties |
Stel de testset samen uit echte vragen: zoeklogs, helpdesktickets, vragen die nieuwe collega’s stellen. Een paar honderd vragen met antwoorden waarover de inhoudseigenaren het eens zijn, is een praktisch begin. Draai de volledige set bij elke wijziging, of het nu gaat om een nieuw model, een nieuwe manier om documenten in fragmenten op te delen of een nieuwe bron. Kwaliteit verschuift ongemerkt wanneer inhoud verandert, en alleen een vaste testset maakt die verschuiving zichtbaar.
Hoe betrouwbaarheid eruitziet voor een gebruiker
Voor de mensen die het systeem gebruiken, komt dit alles neer op een paar zichtbare eigenschappen. De assistent antwoordt alleen op basis van documenten die zij mogen lezen. Elke bewering heeft een bronvermelding die ze kunnen openen. Ze zien hoe actueel een bron is. Ze horen het ronduit wanneer er geen betrouwbaar antwoord is. En ze weten dat iemand de kwaliteit meet, omdat ze een fout antwoord kunnen melden en het verbeterd zien.
AI-output kan nog altijd fout zijn, en sommige vragen verdienen een mens in plaats van een zoekopdracht. Daar open voor ontwerpen is geen zwakte van het systeem. Het is juist wat mensen bereid maakt erop te vertrouwen voor al het andere.
Bronnen
- arXiv. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020) (geraadpleegd )
- OWASP GenAI Security Project. LLM02:2025 Sensitive Information Disclosure (geraadpleegd )
- OWASP GenAI Security Project. LLM08:2025 Vector and Embedding Weaknesses (geraadpleegd )
- OWASP GenAI Security Project. LLM09:2025 Misinformation (geraadpleegd )
- National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1) (geraadpleegd )
- EUR-Lex. Verordening (EU) 2016/679 (algemene verordening gegevensbescherming), artikel 5 (geraadpleegd )
Verder lezen
- DienstAI-engineering & GenAIRetrieval, modelstrategie, evaluatie en LLMOps voor generatieve AI die in productie standhoudt.
- OplossingKennisontsluitingAntwoorden uit uw eigen documenten, beperkt tot wat iemand mag zien, met een bron bij elke bewering.
- InzichtWaar AI-agents menselijke goedkeuring nodig hebbenAgents kunnen bijna alles voorbereiden. Een praktische manier om te bepalen welke acties ze zelfstandig mogen afronden en waarvoor iemand eerst ja moet zeggen.
- InzichtDe AI-verordening voor overheidsorganisaties: wat u vóór december 2027 voorbereidtVolgens de AI-verordening zoals gewijzigd in 2026 gelden de regels voor AI met een hoog risico vanaf december 2027, maar een groot deel van de AI-verordening geldt vandaag al. Een gedateerd voorbereidingsplan voor overheden.
Wilt u de kennis van uw organisatie doorzoekbaar maken?
Wij bouwen kennisassistenten op uw bestaande bronnen, met autorisaties, bronvermeldingen en een testset die wij vanaf de eerste sprint samen met uw inhoudseigenaren opstellen.