ChatGPT の偽引用:AI はなぜ参考文献を作り、どう避けるか
ChatGPT などの大規模言語モデルは、実在するように見えるが存在しない参考文献をよく出す。なぜ起きるか、どう見つけるか、文献レビューでより安全な作業順は何か。
ChatGPT に文献レビューを書かせると、流暢な段落と自信のある引用が出ます。著者、年、誌名、DOI まで。問題は、そのうちかなりの割合が存在しないことです。
偶発的な不具合ではありません。LLM が作った参考文献を監査した研究は、繰り返し捏造を見つけています。2023 年に Cureus で報告された研究では、GPT-3.5 が生成した参考文献の約 47% が完全な捏造で、実在したものにも誤りが多く含まれていました。後のモデルは改善しましたが、問題は消えていません。GPT-4 も学術タスクで、捏造や取り違えを無視できない割合で残します。
大学院生や研究者にとって、投稿原稿に偽の引用が一本ある損失は、AI が節約した時間より大きい。
言語モデルが引用を作る理由
LLM はデータベースではありません。もっともらしい次の語を予測する仕組みです。素のチャットでは、引用の幻覚がほぼ構造的に起きます。
1. 引用は検索ではなく生成である
ChatGPT が “(Smith et al., 2021)” と書くとき、何も引いていません。訓練データに出てくる引用の形に統計的に似た文字列を作っているだけです。著者名、誌名、年が並ぶのは、一緒に置くとそれらしく見えるからで、その論文があるからではありません。
2. 訓練の目標は「本当」ではなく「本当らしい」
たとえば “Machine learning approaches for early sepsis detection: a systematic review. Journal of Clinical Medicine, 2022” は、完全にもっともらしい文字列です。論文が存在しなくても、モデルは仕事を終えています。最適化の対象は真実性ではありませんでした。
3. 自信は不確実さを運ばない
捏造した引用も、実在する引用と同じ流暢さで出ます。「検索した」と「作った」を分ける信号はモデルの中にありません。見分ける負担は全部、読む側に残ります。
偽の引用を見つける
AI が書いた引用を原稿に入れる前に、次を通します。
- 題名を完全一致で探す。 Google Scholar、PubMed、Semantic Scholar。完全な題名でヒットしないのは危険信号です。
- DOI を解決する。 doi.org に貼る。捏造された DOI は解決できないか、別の論文を指します。
- 著者と誌の組み合わせを見る。 幻覚は、実在する著者を、その人が書いたことのない誌と組むことが多い。
- 存在だけでなく、主張を照合する。 実在する論文を、その論文が言っていないことに引用する方が、存在しない論文より見つけにくく、害も大きい。
手作業は効きます。量には耐えません。40 本を一件ずつ確かめると数時間になり、AI が節約した時間は消えます。
より安全な順:生成が先ではなく、検索が先
構造的な直しは、順番を逆にすることです。「文章を作って、引用が本物であることを願う」ではなく、「実在する論文を集めて、そこからだけ書く」。
| 作業 | 引用の出どころ | 幻覚のリスク |
|---|---|---|
| チャットボット(ChatGPT など) | 訓練データからの生成 | 高い |
| チャットボット+ウェブ検索 | 検索と生成が混ざる | 中くらい |
| 検索を先にするレビューツール | 学術データベースから取った論文 | 低い。ただし主張の支持は別途確認する |
検索を先にする流れはこうです。
- 実在するデータベースを検索する。 研究の問いから、学術索引の論文を取る。
- 書く前にスクリーニングする。 関連性を見て、下書きを支えるものを選ぶ。
- 選んだ論文からだけ生成する。 下書きが引用できるのはその集合だけなので、存在しない文献は構造上作れない。
- 主張の支持を監査する。 引用が実在しても、書き出す前に、その論文がその主張を支えているかを見る。
LitSynth の引用監査 はこの順です。論文を取り、証拠を選び、選んだ論文から引用付きの下書きを作り、支持の弱い主張を書き出し前に印します。全体の順は 文献レビューの作業 にあります。
よくある質問
ChatGPT の引用はいつも偽ですか。 いいえ。有名な論文では実在するものも出ます。問題は、一件ずつ見ない限りどれが本物か分からないことです。
GPT-4 のような新しいモデルなら引用は安全ですか。 より安全ではあっても、安全ではありません。GPT-3.5 より捏造率はかなり下がりました。監査では今も、捏造や取り違えが見つかります。投稿にとって「ときどき捏造」は許容できません。
文献レビューに ChatGPT を使ってよいですか。 検索語の案、自分で渡した論文の要約、自分の下書きの組み替えには使えます。危険なのは、何もないところから引用を出させることです。生成は、自分で取った論文に結び付けてください。
AI が作った参考文献を一番速く確かめる方法は。 Google Scholar での完全題名検索と、DOI の解決で、捏造の多くは落ちます。主張の単位で量を見るなら、引用監査を内蔵したツールを使います。
結論
偽引用は、そのうち直る不具合ではありません。生成を先にする作業の性質です。直しは構造です。先に実在する論文を取り、選んだものからだけ書き、書き出す前に主張の支持を監査する。文献レビューは、出典まで辿れて初めて監査できます。