Vai al contenuto principale

Fondamenti

Perché l’IA ha le allucinazioni?

Un modello linguistico afferma una risposta sbagliata con lo stesso tono sicuro di una giusta, perché non è mai stato addestrato a sapere cosa non sa. Perché nascono le allucinazioni, perché non si possono eliminare del tutto, e cosa le riduce davvero.

Tutte le guide · Ultima verifica:

È una risposta sbagliata sicura, non un errore che il modello può segnalare

Un modello non ha una modalità separata "non lo so" a cui ricorrere. Ogni risposta, giusta o sbagliata, viene dallo stesso processo di previsione del token successivo, quindi una citazione inventata o un metodo API che non esiste suonano con la stessa sicurezza fluida di una risposta corretta. È questo che distingue un’allucinazione da un normale bug software — nessuna eccezione viene sollevata, nessun segnale viene attivato, niente da intercettare. Il risultato appare ugualmente affidabile, sia esso giusto o sbagliato.

Perché succede: previsione, non consultazione

Un modello linguistico è addestrato a prevedere continuazioni plausibili di testo, apprese da pattern nei suoi dati di addestramento. Non memorizza i fatti in una forma recuperabile e verificabile come farebbe un database — memorizza la forma statistica del linguaggio, inclusi i fatti abbastanza comuni nell’addestramento da plasmare quella forma. Quando un prompt chiede qualcosa che il modello ha visto raramente, in modo incoerente, o mai, il modello non rinuncia a rispondere; produce comunque la continuazione più plausibile, perché è l’unica cosa che sa fare.

Questo spiega anche perché l’allucinazione peggiora su dettagli specifici, rari o recenti — un caso giudiziario che suona vero ma è inventato, un numero di versione plausibile ma sbagliato, una citazione che sembra il titolo di un vero articolo. Più un’affermazione è specifica, più è probabile che il modello stia colmando un vuoto con qualcosa di semplicemente plausibile invece che noto.

Il grounding riduce il divario, non lo chiude

Mettere un vero testo sorgente davanti al modello prima che risponda — il retrieval, vedi cos’è il RAG — riduce in modo misurabile l’allucinazione sulle domande che quelle fonti coprono davvero, perché il modello può riformulare ciò che ha appena letto invece di prevedere solo dai dati di addestramento. Ma è una tendenza forte, non una garanzia: se il retrieval non restituisce nulla di utile, o le fonti sono incomplete, il modello può comunque rispondere con fluidità dalla memoria invece di ammettere che le fonti non hanno aiutato.

Incrociare più modelli è un filtro, non una cura

Fare la stessa domanda a più modelli e confrontare le risposte cattura le allucinazioni specifiche dell’addestramento o delle particolarità di un modello — se solo uno su tre modelli inventa un dettaglio, quel disaccordo è un segnale. Non cattura un’allucinazione condivisa dalla maggior parte dei modelli, perché i dati di addestramento si sovrappongono tra i fornitori. Lo stesso limite vale per l’uso di un modello separato come giudice per valutare una risposta: un modello giudice può essere ingannato dallo stesso tipo di testo fluido, sicuro e sbagliato che dovrebbe controllare.

Cosa riduce davvero l’allucinazione, in pratica

Nessuna tecnica da sola elimina l’allucinazione, perché è una proprietà di come questi modelli generano testo, non un difetto specifico di un modello o di un fornitore. Ciò che aiuta in modo misurabile è restringere il compito del modello: ancorare le risposte a testo sorgente recuperato per le domande che quelle fonti coprono, mantenere le richieste specifiche invece che aperte, e trattare citazioni, numeri e dettagli specifici del modello stesso come affermazioni da verificare, non come fatti già controllati. Combinare le tecniche — grounding, incrocio tra modelli e verifica contro una fonte — riduce il margine di errore più di ciascuna presa singolarmente.

Perché abbassare la casualità non risolve il problema

È un’ipotesi comune che abbassare la temperatura (vedi temperatura e top-p) renda un modello più veritiero, perché il risultato sembra più cauto e deterministico. La temperatura controlla come il modello campiona tra i token successivi probabili — non cambia ciò che il modello sa e non aggiunge nessun controllo dei fatti. Un modello può avere allucinazioni a temperatura zero con la stessa sicurezza che a temperatura uno; un’impostazione più bassa lo fa solo allucinare la stessa risposta sbagliata con più costanza.

Domande frequenti

Le allucinazioni si possono correggere del tutto?
No, non con le attuali architetture dei modelli linguistici. Nascono da come questi modelli generano testo — prevedere continuazioni plausibili invece di controllare i fatti — quindi si possono ridurre con grounding, incrocio tra modelli e verifica, ma non eliminare come categoria.
Un modello più grande o più recente ha meno allucinazioni?
Spesso meno sulla conoscenza comune, perché una parte maggiore era ben rappresentata nell’addestramento. Questo non elimina il meccanismo di fondo — un modello più recente può comunque avere allucinazioni sicure su dettagli rari, specifici o recenti per cui non è stato addestrato bene.
Un’allucinazione è la stessa cosa di una bugia del modello?
No. Mentire presuppone conoscere la verità e affermare il contrario. Un modello non ha un canale separato per "la verità" con cui confrontare il suo output — genera la continuazione statisticamente più plausibile, che risulti accurata o no.
Dare al modello i propri documenti ferma le allucinazioni?
Le riduce molto sulle domande a cui quei documenti rispondono davvero, perché il modello può riformulare testo recuperato invece di prevedere solo dai dati di addestramento. Non impedisce al modello di rispondere con fluidità dalla memoria quando il retrieval non trova nulla di rilevante.

Provalo invece di leggerne

ClawAI non afferma di eliminare le allucinazioni — nessun prodotto può dirlo onestamente. Ciò che offre sono le mitigazioni che le riducono in modo misurabile: risposte con retrieval ancorate ai tuoi documenti (vedi cos’è il RAG), consenso multi-modello che mette in luce il disaccordo tra modelli (vedi cos’è il consenso IA), e un giudice IA che valuta le risposte secondo criteri definiti (vedi cos’è un giudice IA) — tre funzionalità reali e indipendenti, ciascuna un filtro parziale, non una garanzia.