Erfundene Zitate bei ChatGPT: warum Sprachmodelle Literatur erfinden und wie man das vermeidet
ChatGPT und andere große Sprachmodelle erzeugen oft Literaturangaben, die echt aussehen und nicht existieren. Warum das passiert, wie man sie findet und welche Reihenfolge ein Literaturreview sicherer macht.
Wer ChatGPT ein Literaturreview schreiben lässt, bekommt flüssige Absätze und selbstsichere Zitate: Autorennamen, Jahre, Zeitschriften, sogar DOIs. Ein erheblicher Teil dieser Angaben existiert nicht.
Das ist kein seltener Aussetzer. Prüfungen von LLM-Bibliografien finden erfundene Angaben immer wieder. Eine 2023 in Cureus veröffentlichte Untersuchung fand, dass rund 47 Prozent der von GPT-3.5 erzeugten Literaturangaben frei erfunden waren; unter den existierenden waren viele fehlerhaft. Spätere Modelle wurden besser, das Problem ist nicht weg. Auch GPT-4 erfindet oder schreibt in akademischen Aufgaben einen nicht zu vernachlässigenden Anteil falsch zu.
Für Promovierende und Forschende wiegt ein erfundenes Zitat in einem eingereichten Manuskript schwerer als die Zeit, die das Modell gespart hat.
Warum Sprachmodelle Zitate erfinden
Ein LLM ist keine Datenbank. Es sagt den nächsten plausiblen Token voraus. Drei Eigenschaften machen Zitationshalluzinationen in einem bloßen Chat fast unvermeidlich.
1. Zitate werden erzeugt, nicht nachgeschlagen
Wenn ChatGPT „(Smith et al., 2021)“ schreibt, schlägt es nichts nach. Es erzeugt Text, der statistisch den Zitaten in den Trainingsdaten ähnelt. Namen, Zeitschrift und Jahr stehen beieinander, weil sie zusammen richtig aussehen, nicht weil es die Arbeit gibt.
2. Das Trainingsziel ist Plausibilität, nicht Wahrheit
Eine erfundene Angabe wie „Machine learning approaches for early sepsis detection: a systematic review. Journal of Clinical Medicine, 2022“ ist eine vollkommen plausible Zeichenkette. Das Modell hat seine Aufgabe erfüllt, auch wenn die Arbeit nie erschienen ist. Wahrhaftigkeit war nicht das Optimierungsziel.
3. Sicherheit transportiert keine Unsicherheit
Erfundene Zitate klingen genauso flüssig wie echte. Im Modell gibt es kein Signal, das „nachgeschlagen“ von „erfunden“ trennt. Diese Last liegt ganz bei der lesenden Person.
Erfundene Zitate finden
Bevor ein KI-Zitat ins Manuskript kommt:
- Den genauen Titel suchen. In Google Scholar, PubMed oder Semantic Scholar. Kein Treffer auf den exakten Titel ist ein Warnsignal.
- Die DOI auflösen. Auf doi.org einfügen. Erfundene DOIs lösen sich nicht auf oder zeigen auf eine andere Arbeit.
- Autor und Zeitschrift zusammen prüfen. Halluzinationen setzen oft echte Autorinnen und Autoren in Zeitschriften, in denen sie nie publiziert haben.
- Die Aussage prüfen, nicht nur die Existenz. Eine echte Arbeit für etwas zu zitieren, das sie nie gesagt hat, ist schwerer zu finden und gefährlicher als eine erfundene Arbeit.
Von Hand geht das. In Menge nicht. Vierzig Angaben einzeln zu prüfen dauert Stunden und frisst die gesparte Zeit auf.
Die sicherere Reihenfolge: erst suchen, dann schreiben
Die strukturelle Korrektur kehrt die Pipeline um. Nicht „Text erzeugen und hoffen, dass die Zitate echt sind“, sondern „echte Arbeiten holen und nur daraus schreiben“.
| Ablauf | Herkunft der Zitate | Halluzinationsrisiko |
|---|---|---|
| Chatbot (ChatGPT und andere) | aus Trainingsdaten erzeugt | hoch |
| Chatbot plus Websuche | Suche und Erzeugung gemischt | mittel |
| Review-Werkzeug, das zuerst sucht | Arbeiten aus akademischen Datenbanken | niedrig; die Stützung der Aussage muss trotzdem geprüft werden |
So sieht die Reihenfolge aus:
- Echte Datenbanken durchsuchen. Von der Forschungsfrage aus Arbeiten aus akademischen Indizes holen.
- Vor dem Schreiben sichten. Relevanz prüfen und auswählen, was den Entwurf tragen soll.
- Nur aus der Auswahl erzeugen. Der Entwurf darf nur dieses Set zitieren. Erfundene Angaben sind dann strukturell unmöglich.
- Die Stützung der Aussagen prüfen. Auch ein echtes Zitat muss vor dem Export wirklich die Aussage tragen.
Genau darum ist die Zitationsprüfung in LitSynth gebaut: Arbeiten holen, Evidenz auswählen, aus dieser Auswahl einen zitierten Entwurf erzeugen und schwach gestützte Aussagen vor dem Export markieren. Der gesamte Weg steht im Literaturreview-Ablauf.
Häufige Fragen
Erfindet ChatGPT immer die Zitate? Nein. Vor allem bei bekannten Arbeiten sind manche Angaben echt. Ohne Prüfung jeder einzelnen Angabe lässt sich nicht sagen, welche.
Sind neuere Modelle wie GPT-4 bei Zitaten sicher? Sicherer, nicht sicher. Die Erfindungsrate ist gegenüber GPT-3.5 deutlich gesunken. Prüfungen finden weiter erfundene oder falsch zugeordnete Angaben. Für eine Einreichung ist „manchmal erfunden“ nicht hinnehmbar.
Darf man ChatGPT für Literaturreviews überhaupt nutzen? Ja, für Suchbegriffe, für Zusammenfassungen von Arbeiten, die man selbst übergibt, und für das Umschreiben eigener Entwürfe. Gefährlich ist, Zitate aus dem Nichts erzeugen zu lassen. Die Erzeugung bleibt an Arbeiten gebunden, die man selbst geholt hat.
Wie prüft man KI-Literaturangaben am schnellsten? Exakte Titelsuche in Google Scholar plus DOI-Auflösung fängt die meisten Erfindungen. Für die Prüfung auf Aussagenebene in Menge braucht es ein Werkzeug mit eingebauter Zitationsprüfung.
Schluss
Erfundene Zitate sind kein Fehler, der irgendwann gepatcht wird. Sie gehören zu Abläufen, die zuerst erzeugen. Die Korrektur ist architektonisch: erst echte Arbeiten holen, nur aus der Auswahl schreiben und die Stützung der Aussagen vor dem Export prüfen. Ein Literaturreview ist erst prüfbar, wenn man es bis zur Quelle zurückverfolgen kann.