← Torna al blog

Pubblicato il 19 settembre 2026

Allucinazioni degli LLM: perché l'AI inventa fatti e come non farsi ingannare

  • intelligenza-artificiale
  • llm

Nei due articoli precedenti di questa serie ho spiegato cosa distingue un LLM da intelligenza artificiale, machine learning e deep learning e come funziona concretamente, dalla tokenizzazione alla generazione token per token. Chiudo la serie con il tema che, secondo me, è il più importante da capire per chiunque usi questi strumenti tutti i giorni: perché a volte un LLM afferma con sicurezza cose false, e cosa possiamo fare noi, in pratica, per non caderci.

Il fenomeno ha un nome ormai entrato nel linguaggio comune: allucinazione. Non è un guasto occasionale né un "bug" da correggere con un aggiornamento software: è una conseguenza diretta, quasi inevitabile, di come questi modelli funzionano alla radice. Capire perché succede non serve solo a soddisfare la curiosità tecnica: serve a sapere quando fidarsi di più e quando controllare due volte.

Cosa intendiamo esattamente per "allucinazione"

Un'allucinazione, in questo contesto, è un'affermazione generata dal modello che suona plausibile, è scritta con lo stesso tono sicuro di qualunque altra risposta, ma è falsa o non supportata da nulla — un fatto inventato, una citazione che non esiste, un numero corretto attribuito alla fonte sbagliata, una legge o un articolo scientifico che semplicemente non esistono. La caratteristica che rende le allucinazioni particolarmente insidiose non è la falsità in sé (qualunque fonte, anche umana, può sbagliare), ma la totale assenza di segnali di incertezza: il modello non "esita", non usa un tono diverso, non lampeggia in rosso. Scrive la cosa inventata esattamente con la stessa fluidità e sicurezza con cui scriverebbe qualcosa di vero.

Prova tu

In che anno OpenAI ha pubblicato il paper 'Language Models are Few-Shot Learners', quello che ha presentato GPT-3?

Le due risposte qui sotto sono scritte con la stessa sicurezza. Scegli quella che ti sembra giusta.

La causa di fondo: un modello statistico, non un database di fatti

Per capire perché succede, bisogna tornare a quanto visto nell'articolo precedente: un LLM non consulta un archivio di fatti verificati quando genera una risposta. Genera testo stimando, token dopo token, quale sia la continuazione statisticamente più plausibile data la sequenza di testo che la precede, sulla base delle regolarità osservate durante l'addestramento su enormi quantità di testo. Non esiste, dentro il modello, un meccanismo che distingua in modo esplicito ed esplicito "questa frase è un fatto verificato" da "questa frase suona semplicemente plausibile". Le due cose, dal punto di vista del meccanismo di generazione, sono trattate allo stesso modo: sequenze di token con una certa probabilità.

Un paper di ricerca pubblicato da OpenAI nel settembre 2025, intitolato per l'appunto "Why Language Models Hallucinate", formalizza questa intuizione andando oltre la semplice descrizione: gli autori — Adam Tauman Kalai, Ofir Nachum ed Edwin Zhang di OpenAI, insieme a Santosh Vempala della Georgia Tech — sostengono che le allucinazioni "non hanno bisogno di essere misteriose": nascono, in fondo, come i normali errori che si presentano in qualunque compito di classificazione binaria (vero/falso), analizzando le cause statistiche del fenomeno nella moderna pipeline di addestramento (Kalai, Nachum, Vempala, Zhang, Why Language Models Hallucinate, OpenAI, 2025). Un punto centrale del paper è che generare risposte è strutturalmente più difficile che classificarle come vere o false: un modello potrebbe riuscire a riconoscere correttamente se un'affermazione è vera o falsa quando gliela si presenta già scritta, ma quando deve generarla da zero la probabilità di sbagliare aumenta, perché il compito di generazione eredita, ed espande, gli errori del compito di classificazione sottostante.

Ma il paper va oltre la sola spiegazione tecnica e punta il dito su un incentivo perverso nel modo in cui i modelli vengono addestrati e valutati: le procedure standard di addestramento e valutazione premiano il tentativo di indovinare più che l'ammissione di incertezza. Gli autori usano un paragone efficace: un modello linguistico messo davanti a una domanda difficile si comporta un po' come uno studente davanti a una domanda d'esame di cui non conosce la risposta — tentare una risposta plausibile, anche se inventata, ha statisticamente più probabilità di essere premiato (nei punteggi sui benchmark standard) di quanta ne abbia rispondere onestamente "non lo so". Finché i sistemi di valutazione continueranno a punire l'incertezza dichiarata più severamente di una risposta sbagliata ma sicura di sé, i modelli continueranno a essere spinti, matematicamente, verso il "tentar sempre di rispondere".

Un secondo meccanismo: cosa succede quando il modello riconosce un nome ma non i fatti

Una ricerca di interpretabilità di Anthropic, che ha analizzato concretamente i meccanismi interni del proprio modello Claude, offre un secondo pezzo del puzzle particolarmente concreto. Il risultato, per certi versi controintuitivo, è che il comportamento "di base" del modello non è rispondere, ma rifiutarsi di rispondere: i ricercatori hanno individuato "un circuito che è 'acceso' di default e che porta il modello ad affermare di non avere informazioni sufficienti per rispondere a una data domanda" (Anthropic, Tracing the thoughts of a large language model). In altre parole, il rifiuto prudente è la posizione di partenza del modello, non un'eccezione.

Quello che succede quando il modello risponde con sicurezza è che questo circuito di rifiuto viene inibito da un'altra caratteristica interna, legata al riconoscimento di "entità note": quando il modello riconosce un nome, un argomento o un concetto che gli è familiare, questa caratteristica sopprime il rifiuto di default e permette al modello di rispondere. Il problema — e qui arriva la parte interessante — è che questo meccanismo può "sbagliare bersaglio": può attivarsi anche quando il modello riconosce solo il nome di qualcosa o qualcuno, senza però avere informazioni affidabili sul resto. In quei casi, la soppressione del rifiuto avviene comunque, e il modello "procede a confabulare: genera una risposta plausibile — ma purtroppo non vera" (Anthropic, Tracing the thoughts of a large language model). È una spiegazione tecnica che aiuta a capire un pattern che chiunque abbia usato un LLM ha probabilmente notato: i modelli tendono ad "allucinare" con più sicurezza proprio su persone, aziende o riferimenti che riconoscono per nome ma di cui in realtà sanno poco.

Casi reali, documentati e verificabili

Le allucinazioni non sono un rischio teorico da laboratorio: hanno già prodotto conseguenze concrete, in tribunale e sui mercati finanziari. Ecco tre casi reali, tutti documentati da fonti verificabili.

Il caso Mata v. Avianca: citazioni legali inventate

Nel 2023, in una causa per lesioni personali intentata contro la compagnia aerea Avianca davanti alla Corte Distrettuale degli Stati Uniti per il Distretto Sud di New York, gli avvocati del ricorrente avevano usato ChatGPT per preparare un atto giudiziario a sostegno della propria posizione. L'atto citava sei precedenti giurisprudenziali a supporto della propria tesi. Il problema: nessuno di quei sei casi esisteva davvero; erano stati interamente inventati dal modello, comprese citazioni interne e nomi di giudici plausibili ma fittizi. Quando i legali della controparte non riuscirono a rintracciare le sentenze citate e lo segnalarono alla Corte, invece di ammettere subito l'errore uno degli avvocati presentò persino una dichiarazione giurata con presunti estratti delle sentenze — anch'essi generati da ChatGPT e altrettanto inventati. Il giudice ha tenuto un'udienza l'8 giugno 2023 e ha emesso un'ordinanza di sanzioni il 22 giugno 2023, imponendo una multa di 5.000 dollari, in solido, ai due avvocati coinvolti (Corte Distrettuale S.D.N.Y., Mata v. Avianca, Inc., Opinion and Order on Sanctions, 22 giugno 2023).

Il caso Air Canada: il chatbot che ha inventato una policy

Nel novembre 2022 un passeggero, Jake Moffatt, dopo aver perso la nonna, aveva chiesto tramite il chatbot del sito di Air Canada informazioni sulla tariffa ridotta per lutto. Il chatbot gli aveva risposto che poteva richiedere la tariffa scontata anche retroattivamente, entro 90 giorni dall'emissione del biglietto. Peccato che questa non fosse la policy reale della compagnia, che non prevedeva alcuna richiesta retroattiva. Quando Moffatt tornò e chiese il rimborso della differenza, Air Canada rifiutò, sostenendo — davanti al tribunale — che il chatbot fosse "un'entità legale separata", responsabile delle proprie affermazioni. Il Civil Resolution Tribunal della Columbia Britannica ha respinto questo argomento il 14 febbraio 2024, stabilendo che una compagnia resta responsabile di tutte le informazioni presenti sul proprio sito, che provengano da una pagina statica o da un chatbot, e ha condannato Air Canada a risarcire il passeggero (Civil Resolution Tribunal of British Columbia, Moffatt v. Air Canada, 2024 BCCRT 149).

Il caso Google Bard: un errore in un video promozionale

Non serve nemmeno un utente che ponga domande insidiose: a volte l'allucinazione emerge nella demo ufficiale di lancio di un prodotto. Nel febbraio 2023, in un video promozionale pubblicato da Google per presentare Bard (l'allora chatbot concorrente di ChatGPT), al modello veniva posta la domanda su quali nuove scoperte del telescopio spaziale James Webb si potessero raccontare a un bambino di nove anni. Bard rispose, tra le altre cose, che il telescopio aveva scattato "le primissime immagini di un pianeta al di fuori del nostro sistema solare". L'affermazione era falsa: la prima immagine di un esopianeta era stata scattata quasi vent'anni prima, nel 2004, dal Very Large Telescope dell'Osservatorio Europeo Australe. L'errore fu segnalato per primo da Reuters, e nel giro di un giorno le azioni di Alphabet (la società madre di Google) persero il 7,7%, bruciando circa 100 miliardi di dollari di capitalizzazione di mercato (CNN Business, Google shares lose $100 billion after company's AI chatbot makes an error during demo, 8 febbraio 2023).

Tre casi molto diversi tra loro — un procedimento legale, una controversia contrattuale, un video promozionale — ma con un filo conduttore identico: un'affermazione formulata con piena sicurezza, senza alcun segnale di dubbio, che si è rivelata falsa solo quando qualcuno ha controllato.

Quanto è diffuso il problema, oggi

Qui è importante essere onesti sui limiti di quello che si può affermare con certezza. Il 2025 AI Index Report dello Stanford Institute for Human-Centered Artificial Intelligence (HAI) — probabilmente il rapporto indipendente più autorevole sullo stato dell'arte dell'IA — dedica una sezione alla misurazione delle allucinazioni, notando che benchmark più datati come HaluEval e TruthfulQA non hanno raggiunto un'adozione ampia da parte della comunità di ricerca, e che al loro posto sono emersi strumenti di valutazione più recenti, come la classifica aggiornata dell'Hughes Hallucination Evaluation Model, FACTS e SimpleQA (Stanford HAI, 2025 AI Index Report — Responsible AI).

Non riporto qui percentuali specifiche di tasso di allucinazione perché le cifre che circolano online per il 2026 non sono, al momento in cui scrivo, verificabili con la stessa solidità delle fonti citate sopra, e variano moltissimo a seconda del compito misurato (un riassunto di un testo dato è tutt'altra cosa rispetto a una domanda aperta su un fatto specifico). Seguendo lo stesso principio con cui ho scritto questo articolo — meglio ammettere un limite che inventare un numero — mi limito a dire che il tema è ormai riconosciuto come prioritario dalla comunità di ricerca, che i benchmark per misurarlo si sono moltiplicati e affinati negli ultimi anni, e che i tassi di errore misurati variano molto in base al tipo di compito richiesto al modello.

Le allucinazioni non sono l'unico limite

Vale la pena spendere qualche riga anche su altri limiti degli LLM, meno discussi ma altrettanto concreti, perché "limiti degli LLM" non è un sinonimo di "allucinazioni": è una categoria più ampia.

Il taglio della conoscenza (knowledge cutoff). Un LLM viene addestrato su un corpus di testo raccolto fino a una certa data, dopodiché l'addestramento si ferma. Tutto ciò che è successo nel mondo dopo quella data è, semplicemente, assente dai suoi "pesi" interni — non è che il modello lo ignori per errore, è che quell'informazione non è mai stata parte del materiale su cui ha imparato. Alcuni sistemi compensano questo limite collegando il modello a strumenti di ricerca esterni in tempo reale, ma il modello di base, da solo, resta ancorato al momento in cui è stato addestrato.

La sensibilità alla formulazione della domanda. Lo stesso quesito, posto con parole leggermente diverse o in un ordine diverso, può produrre risposte diverse — a volte in modo sostanziale. È una conseguenza diretta del fatto che il modello genera token in base a pattern statistici appresi sul testo, e piccole variazioni nel prompt possono spostare quali pattern vengono "attivati" durante la generazione.

L'assenza di una vera verifica interna. A differenza di un motore di ricerca o di un database, un LLM non ha un modo nativo per controllare le proprie affermazioni contro una fonte esterna prima di scriverle: il controllo, se avviene, avviene tramite strumenti aggiuntivi (per esempio la possibilità di consultare il web durante la conversazione), non come proprietà intrinseca del modello linguistico di base.

I bias ereditati dai dati di addestramento. Un modello impara pattern statistici dal testo con cui viene addestrato; se quel testo riflette pregiudizi, squilibri o sovra-rappresentazioni di certi punti di vista rispetto ad altri, il modello tende ad assorbire e riprodurre anche quelli, non solo la grammatica e i fatti. È un'area di ricerca attiva — lo stesso capitolo "Responsible AI" del 2025 AI Index Report di Stanford HAI la tratta insieme alla misurazione delle allucinazioni, come parte più ampia della sicurezza e affidabilità dei modelli (Stanford HAI, 2025 AI Index Report — Responsible AI) — ed è un motivo in più per non trattare l'output di un LLM come una fonte neutra per definizione.

Buone pratiche concrete per non farsi ingannare

Da tutto questo derivano alcune abitudini pratiche, che nella mia esperienza fanno davvero la differenza nell'uso quotidiano di un LLM.

Un limite da conoscere, non un motivo per rinunciare

Capire perché gli LLM allucinano non significa concludere che siano inaffidabili in senso assoluto, né che vadano evitati. Significa piuttosto sapere cosa aspettarsi da uno strumento che, per come è costruito — un modello statistico che predice la parola più probabile, non un database di fatti verificati — funziona benissimo per riassumere, riformulare, fare brainstorming o spiegare concetti generali, e va invece sempre controllato quando la risposta richiede un fatto puntuale e verificabile.

Se avete letto tutta la serie, ora avete gli strumenti per farlo con consapevolezza: sapete dove si colloca un LLM rispetto ad altre forme di intelligenza artificiale, sapete come funziona concretamente sotto il cofano, e ora sapete anche perché, a volte, si sbaglia con la massima sicurezza. È esattamente questa consapevolezza — non la diffidenza totale, né la fiducia cieca — il modo più utile di usare questi strumenti oggi.