Vai al contenuto principale
FromNine
Menu

Ingegneria IADati

Che cosa rende affidabile la ricerca della conoscenza aziendale

Rispondere alle domande partendo dai propri documenti è facile da mostrare in una demo e difficile da rendere affidabile. La fiducia nasce da cinque proprietà che si possono progettare, testare e continuare a testare: permessi, provenienza, aggiornamento, lacune dichiarate e qualità misurata.

Di
Redazione FromNine
Pubblicato
Tempo di lettura
6 min di lettura

In sintesi

  1. Applichi i diritti di accesso nel momento del retrieval, per singolo utente, a partire dai sistemi di origine. Non conti mai sul fatto che il modello trattenga un passaggio che ha già ricevuto.
  2. Ogni affermazione di una risposta dovrebbe rimandare a un passaggio che una persona può aprire e verificare in pochi secondi, con data e stato ben visibili.
  3. Misuri la qualità del retrieval e delle risposte su domande reali prima dell’avvio, e continui a farlo, perché contenuti e modelli cambiano nel tempo.
Indice

Il problema della demo

La maggior parte degli assistenti per la conoscenza segue lo stesso schema, noto come retrieval-augmented generation (apre un sito esterno) (RAG): si cercano i passaggi pertinenti a una domanda, poi un modello linguistico scrive una risposta fondata su quei passaggi. Su una cartella selezionata di cinquanta documenti, il risultato convince nel giro di una settimana.

In produzione il quadro è diverso. Vent’anni di cartelle condivise, wiki, ticket, contratti e policy, molti duplicati, superati o riservati. In questo contesto l’assistente sbaglia in due modi. Dà una risposta errata e le persone smettono di usarlo. Oppure, peggio, dà una risposta errata con sicurezza e le persone agiscono di conseguenza.

Una ricerca affidabile nella conoscenza aziendale dipende quindi meno dal modello e più da cinque proprietà del sistema che lo circonda. Ciascuna si può progettare e, soprattutto, testare.

Permessi: recuperare solo ciò che l’utente può leggere

La regola è semplice: l’assistente non deve mai mostrare a qualcuno un passaggio che quella persona non potrebbe aprire nel sistema di origine. Ciò che conta è il punto in cui la regola viene applicata. Se un passaggio arriva al modello, si deve presumere che possa comparire nella risposta. I permessi vanno quindi applicati prima della generazione, nel momento del retrieval, per l’utente che pone la domanda.

OWASP colloca sia la sensitive information disclosure (apre un sito esterno) sia le vector and embedding weaknesses (apre un sito esterno), compresa la fuga di dati oltre i confini dei permessi, tra i rischi principali delle applicazioni basate su modelli linguistici. In pratica ne derivano quattro requisiti.

  • Memorizzare nell’indice, insieme a ogni frammento, i diritti di accesso del documento di origine, ripresi dal sistema di origine e non ridefiniti a mano.
  • Filtrare su quei diritti al momento della query, con l’identità dell’utente autenticato, prima del ranking e della generazione.
  • Sincronizzare le modifiche ai permessi almeno con la stessa rapidità delle modifiche ai contenuti, e concordare entro quanto tempo un diritto revocato debba diventare effettivo.
  • Testare con ruoli reali. «Un tirocinante riesce a trovare le tabelle retributive?» è una domanda che appartiene alla suite di test, non all’analisi dopo un incidente.

Provenienza: citazioni che una persona può verificare

Ogni affermazione di una risposta dovrebbe rimandare al passaggio da cui proviene: titolo del documento, versione o data, responsabile e un link che si apre nel punto giusto. Mostri il passaggio stesso, non solo il nome del documento, così chi legge vede in pochi secondi se la citazione sostiene davvero la frase.

Progetti il formato della risposta in modo che il testo non supportato salti all’occhio. Se nessun passaggio recuperato sostiene una frase, il sistema dovrebbe ometterla o segnalarla. Poi lo verifichi in modo automatico: confronti ogni passaggio citato con l’affermazione che dovrebbe sostenere e sottoponga un campione dei risultati a revisione umana. Le citazioni presenti ma che non sostengono l’affermazione sono un errore frequente e silenzioso.

Aggiornamento e autorevolezza

La conoscenza di un’organizzazione ha più versioni. La vecchia policy sulle trasferte e quella nuova rispondono entrambe alla domanda «posso prenotare in business class?», e danno risposte diverse. Indicizzi i metadati che le distinguono: data di efficacia, stato (bozza, approvato, superato) e responsabile. Metta in cima i documenti vigenti e approvati, escluda quelli superati salvo che l’utente chieda lo storico e mostri la data in ogni citazione.

Stabilisca per ogni argomento quale fonte fa testo. La policy del personale proviene dal portale HR, non da un’e-mail che ne cita la versione dell’anno scorso. Definisca una frequenza di reindicizzazione per ciascuna fonte, dal quasi tempo reale per i dati delle pratiche al giornaliero per un wiki, e la monitori: un indice non aggiornato produce risposte che sembrano giuste e non lo sono.

Lacune dichiarate: «Non ho trovato questa informazione»

Spesso la risposta più preziosa è una lacuna dichiarata con onestà. I modelli linguistici possono produrre affermazioni scorrevoli che non poggiano su nulla, ciò che il NIST chiama confabulation (apre un sito esterno) nel suo profilo per l’IA generativa. Ancorare le risposte ai passaggi recuperati riduce il fenomeno, ma non lo elimina. OWASP tratta l’effetto a valle, cioè le persone che agiscono sulla base di output falsi, come un rischio a sé stante, sotto la voce misinformation (apre un sito esterno).

Fissi una soglia di pertinenza al di sotto della quale il sistema dichiara di non aver trovato una fonte affidabile e suggerisce a chi rivolgersi. Per le domande su policy, diritti o obblighi, non lasci che il modello colmi le lacune con conoscenze generali. Poi tenga traccia del tasso di mancate risposte per argomento. Nei primi mesi quell’elenco è spesso il risultato più utile dell’intero progetto: mostra ai responsabili dei contenuti esattamente dove manca la documentazione.

L’architettura dietro le cinque proprietà

Nulla di tutto questo richiede uno stack esotico. Richiede che permessi, metadati e controlli siano parti integranti della pipeline, non funzionalità aggiunte dopo la demo.

Figura 1

Flusso di lavoro illustrativo
Una pipeline di retrieval che rispetta i permessiDiritti di accesso e metadati dei documenti accompagnano ogni passaggio, dall’acquisizione alla risposta. Due controlli decidono che cosa può vedere il modello e che cosa può leggere l’utente.
Leggere il diagramma in forma testuale

I documenti vengono acquisiti dai sistemi di origine insieme ai relativi diritti di accesso e ai metadati, come data, stato e responsabile, e indicizzati.

Arriva una domanda con l’identità dell’utente autenticato. Un filtro sui permessi elimina ogni passaggio che quell’utente non può leggere, prima che qualcosa raggiunga il modello.

Il modello redige una risposta con citazioni ai passaggi rimasti. Una verifica confronta ogni affermazione con il passaggio citato. L’utente riceve una risposta con citazioni oppure la dichiarazione esplicita che non è stata trovata alcuna fonte affidabile.

I dati personali meritano un’attenzione esplicita. Indicizzare documenti è comunque un trattamento dei dati personali che contengono, quindi si applicano i principi di limitazione della finalità e minimizzazione dei dati (apre un sito esterno) del GDPR (articolo 5). Escluda le fonti di cui il caso d’uso non ha bisogno, faccia in modo che le cancellazioni nei sistemi di origine arrivino anche all’indice e includa l’indice quando risponde a una richiesta di accesso.

Qualità misurata, prima e dopo l’avvio

L’affidabilità non si valuta provando qualche domanda durante una riunione. Concordi i criteri di qualità con chi è responsabile dei contenuti e misuri ogni livello separatamente, così da sapere dove intervenire quando qualcosa non va.

Tabella 1Che cosa misurare in un assistente per la conoscenza aziendale
LivelloDomandaCome misurare
RetrievalSono stati recuperati i passaggi giusti?Recall e precisione su un insieme etichettato di domande reali
Ancoraggio alle fontiOgni affermazione è sostenuta dalla sua citazione?Controlli automatici tra affermazione e passaggio, più revisione umana a campione
RispostaLa risposta è corretta, completa e utile?Revisione esperta di un campione secondo criteri concordati
AccessoQualcuno ha visto ciò che non avrebbe dovuto vedere?Una suite di test sui permessi per ogni ruolo, eseguita a ogni modifica dell’indice o di un connettore
UtilizzoLe persone ci fanno affidamento, e dove sbaglia?Feedback, tasso di mancate risposte per argomento, domande di follow-up, escalation

Costruisca l’insieme di test a partire da domande reali: log delle ricerche, ticket dell’helpdesk, domande che pongono i nuovi colleghi. Qualche centinaio di domande, con risposte concordate con i responsabili dei contenuti, è un buon punto di partenza. Esegua l’intero insieme a ogni modifica, che si tratti di un nuovo modello, di una nuova strategia di suddivisione in frammenti o di una nuova fonte. Quando i contenuti cambiano, la qualità deriva in silenzio, e solo un insieme di test fisso rende visibile quella deriva.

Che aspetto ha l’affidabilità per chi la usa

Per le persone che lo utilizzano, tutto questo si riduce ad alcuni comportamenti osservabili. L’assistente risponde solo a partire da documenti che sono autorizzate a leggere. Ogni affermazione ha una citazione che possono aprire. Possono vedere quanto è aggiornata una fonte. Vengono avvisate chiaramente quando non esiste una risposta affidabile. E sanno che qualcuno misura la qualità, perché possono segnalare una risposta sbagliata e vederla corretta.

Gli output dell’IA possono comunque essere sbagliati, e alcune domande meritano una persona più che una ricerca. Progettare apertamente per questo non è una debolezza del sistema. È ciò che porta le persone a fidarsene per tutto il resto.

Fonti

  1. arXiv. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020) (consultato il )
  2. OWASP GenAI Security Project. LLM02:2025 Sensitive Information Disclosure (consultato il )
  3. OWASP GenAI Security Project. LLM08:2025 Vector and Embedding Weaknesses (consultato il )
  4. OWASP GenAI Security Project. LLM09:2025 Misinformation (consultato il )
  5. National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1) (consultato il )
  6. EUR-Lex. Regolamento (UE) 2016/679 (regolamento generale sulla protezione dei dati), articolo 5 (consultato il )

Vuole rendere ricercabile la conoscenza della Sua organizzazione?

Realizziamo assistenti per la conoscenza sulle fonti che Lei già utilizza, con permessi, citazioni e un insieme di test concordato con i responsabili dei contenuti fin dal primo sprint.