Citazioni false di ChatGPT: perché l’IA inventa i riferimenti e come evitarlo
ChatGPT e altri modelli di linguaggio producono spesso riferimenti che sembrano veri e non esistono. Perché succede, come riconoscerli e quale ordine di lavoro rende più sicura una revisione della letteratura.
Se si chiede a ChatGPT una revisione della letteratura, arrivano paragrafi scorrevoli e citazioni sicure: autori, anni, riviste, persino i DOI. Il problema è che una quota rilevante di quei riferimenti non esiste.
Non è un guasto occasionale. Gli studi che verificano bibliografie generate dai modelli trovano riferimenti inventati in modo ripetuto. Uno studio del 2023 pubblicato su Cureus ha trovato che circa il 47 % dei riferimenti generati da GPT-3.5 era inventato di sana pianta e che molti di quelli esistenti contenevano errori. I modelli successivi sono migliorati, il problema no. Anche GPT-4 inventa o attribuisce male una frazione non trascurabile di citazioni nei compiti accademici.
Per un dottorando o un ricercatore, una citazione inventata in un manoscritto inviato costa più del tempo risparmiato dall’IA.
Perché i modelli inventano le citazioni
Un modello di linguaggio non è una banca dati. Predice il pezzo di testo successivo che risulta plausibile. Tre proprietà rendono quasi inevitabile l’allucinazione delle citazioni in una chat nuda.
1. La citazione si genera, non si recupera
Quando ChatGPT scrive «(Smith et al., 2021)» non sta consultando nulla. Sta generando un testo statisticamente simile alle citazioni dei dati di addestramento. Nome, rivista e anno stanno insieme perché sembrano stare bene, non perché quell’articolo esista.
2. L’obiettivo dell’addestramento è sembrare vero, non esserlo
Un riferimento inventato come «Machine learning approaches for early sepsis detection: a systematic review. Journal of Clinical Medicine, 2022» è una stringa del tutto plausibile. Il modello ha fatto il suo lavoro anche se l’articolo non è mai esistito. La veridicità non era ciò che si ottimizzava.
3. La sicurezza non trasporta incertezza
Le citazioni inventate escono con la stessa scorrevolezza di quelle vere. Nel modello non c’è un segnale che separi «l’ho recuperato» da «l’ho inventato». Il peso resta tutto su chi legge.
Come riconoscere le citazioni false
Prima che una citazione scritta dall’IA entri nel manoscritto:
- Cerchi il titolo esatto su Google Scholar, PubMed o Semantic Scholar. Nessun risultato sul titolo completo è un segnale d’allarme.
- Risolva il DOI. Lo incolli su doi.org. Un DOI inventato non si risolve oppure punta a un altro articolo.
- Controlli se autore e rivista stanno insieme. Le allucinazioni spesso accoppiano autori reali a riviste su cui non hanno mai pubblicato.
- Verifichi l’affermazione, non solo l’esistenza. Citare un articolo vero per qualcosa che non ha mai detto è più difficile da vedere, e più dannoso, che citarne uno inesistente.
Il controllo a mano funziona. Non regge la quantità. Verificare 40 riferimenti uno per uno richiede ore e cancella il tempo risparmiato.
Un ordine più sicuro: prima il recupero, poi la scrittura
La correzione strutturale rovescia la sequenza. Non «generare il testo e sperare che le citazioni siano vere», ma «recuperare articoli veri e scrivere solo da quelli».
| Flusso | Origine della citazione | Rischio di allucinazione |
|---|---|---|
| Chatbot (ChatGPT e altri) | generata dai dati di addestramento | alto |
| Chatbot con ricerca sul web | recupero e generazione mescolati | medio |
| Strumento di revisione che recupera prima | articoli da basi accademiche | basso; il sostegno dell’affermazione va comunque controllato |
L’ordine è questo:
- Cerchi in basi reali. Parta dalla domanda e recuperi articoli da indici accademici.
- Scremi prima di scrivere. Guardi la rilevanza e scelga ciò che deve reggere la bozza.
- Generi solo da ciò che ha scelto. La bozza può citare solo quell’insieme. Un riferimento inventato è impossibile per costruzione.
- Verifichi il sostegno di ogni affermazione. Anche se la citazione esiste, controlli prima dell’esportazione che l’articolo dica quello.
È l’ordine della verifica delle citazioni in LitSynth: recuperare gli articoli, scegliere le evidenze, generare una bozza citata solo da quella selezione e segnare le affermazioni con sostegno debole prima dell’esportazione. Il percorso intero è nel flusso di revisione della letteratura.
Domande frequenti
ChatGPT inventa sempre le citazioni? No. Soprattutto sugli articoli molto citati, alcuni riferimenti sono veri. Il problema è che, senza controllarli uno per uno, non si sa quali.
Modelli più recenti, come GPT-4, rendono sicure le citazioni? Più sicuri, non sicuri. Il tasso di invenzione è sceso parecchio rispetto a GPT-3.5, ma le verifiche trovano ancora riferimenti inventati o attribuiti male. Per un invio accademico, «a volte inventa» non è accettabile.
Si può usare ChatGPT in una revisione della letteratura? Sì: per proporre termini di ricerca, riassumere articoli che si forniscono e riorganizzare le proprie bozze. La zona pericolosa è lasciargli produrre citazioni dal nulla. La generazione resta ancorata ad articoli recuperati da chi scrive.
Qual è il modo più rapido per verificare riferimenti generati dall’IA? La ricerca del titolo esatto su Google Scholar più la risoluzione del DOI intercetta la maggior parte delle invenzioni. Per verificare le affermazioni in quantità serve uno strumento con verifica delle citazioni.
Conclusione
Le citazioni false non sono un difetto che prima o poi si patcha. Sono una proprietà dei flussi che generano per primi. La correzione è architetturale: recuperare articoli veri, scrivere solo da ciò che si è scelto e verificare il sostegno delle affermazioni prima dell’esportazione. Una revisione della letteratura si può verificare solo se si può seguire fino alla fonte.