AI 在引用資料時出錯,可不是單純的手滑打錯字。背後的真正原因在於:大型語言模型的本質是「生成聽起來很像一回事的文字」,而不是「查核事實證據的真實性」。
當 AI 寫下一條參考資料時,它做的事情跟我們人類想像的完全不同。你看到的是知名學者的大名、權威期刊、出版年份、DOI 論文編號,以及一段自信滿滿的結論。然而對 AI 來說,它只是在延續自己在幾百萬篇學術論文中學到的文字規律罷了。
這就是為什麼 AI 捏造出來的假引用,會讓人覺得如此逼真、毫無破綻。
在查證真偽前,假資料往往早就偽裝得「天衣無縫」
虛構的文獻通常具備真實論文的一切外在特徵:耳熟能詳的學者姓名、看起來合情合理的期刊名稱、恰到好處的出版年份、整齊劃一的格式排版,有時甚至還附帶一串長得很像真的 DOI 編號。問題是,這些精美的外表絲毫不能證明這份文獻真的存在,只能證明 AI 真的很擅長「模仿一份看起來存在的文件」。
這種現象早已不再只是理論推測。學者 Zhao 等人在一項大型研究中,審查了 250 萬篇論文中的 1.11 億條參考文獻,估計光是在 2025 年一年之內,學術界就出現了高達 146,932 條由 AI 憑空捏造的幽靈引用。學者 Walters 與 Wilder 也發現,在 ChatGPT 生成的文獻回顧短文裡,GPT-3.5 給出的引用有 55% 是假的,而更先進的 GPT-4 也有 18% 純屬虛構。
答案聽起來完全正確,引用看起來挑不出毛病,但兩者之間的連結可能根本是一場空。
翻車型態 1:這個來源從頭到尾根本不存在
整條引用可能完全是 AI 腦補出來的。現實中根本沒有這篇論文、DOI 網址點進去是一片空白,或是該期期刊從未刊登過這篇文章。
AI 可能會信誓旦旦地寫出「Johnson 等人,2021 年」,配上一個很像樣的權威期刊名稱、看似專業的論文標題與 DOI 連結。一切看起來都很學術、很嚴謹,但實際上全世界根本沒有這篇研究。
翻車型態 2:論文是真的,但 AI 說的結論是假的
這篇論文在現實中確實存在,但 AI 卻把完全不相干的結論硬扣在它頭上。這種錯誤往往更難被識破,因為多數人只會做第一步確認:點開連結,看見真的是一篇權威論文,就放心地相信了。但如果你真的讀完論文,會發現學者根本沒有說過 AI 宣稱的那句話。
這就是「來源是否存在」與「來源能否支持主張」的巨大差異。即便引用的是貨真價實的知名論文,只要它根本無法佐證文章裡的那句話,這條引用依然是不合格的誤導。
翻車型態 3:數據看起來很精確,卻查不到半點出處
AI 很喜歡隨手拋出看似精準的統計數據,卻沒有附上任何可追溯的來源。數字往往最具說服力,因為它給人一種科學、可衡量的錯覺。但「看起來精確」絕不等於「有真憑實據」。
像「自 2022 年以來增長了 300%」這種說法,在簡報或報告裡很容易被人迅速採納,因為它聽起來太具體了。但如果背後沒有附帶任何權威資料庫、研究論文或官方調查報告,在拿出真憑實據之前,這類數字都必須先打上大大的問號。
翻車型態 4:明明還在爭論,AI 卻硬說「專家已有共識」
AI 常常會把尚無定論的研究領域,直接包裝成一片和諧的定論。明明學術界意見分歧、爭論不休,AI 卻張口就來:「各項研究顯示」、「專家一致同意」或「有強烈證據指出」。
這種情況在醫療健康、法律法規、個人理財與公共政策等領域尤其危險。一段看似胸有成竹的總結,往往掩蓋了關鍵的分歧意見、研究本身的侷限性,或是根本缺乏實質證據的事實。
第一步快篩:你該問自己的 4 個基本問題
絕不要因為看到一條引用附了網址連結,就以為它已經經過查證。光有一串 DOI 不夠,掛上知名機構的招牌也遠遠不夠。
在花大把時間精讀之前,第一階段的快篩其實很單純:
- 這個參考來源在現實中真的存在嗎?
- 論文作者、期刊與年份等資訊,跟 AI 寫的吻合嗎?
- 這個來源的權威程度,足以支撐這個重大結論嗎?
- 文獻裡的真正內容,真的有支持 AI 說的那句話嗎?
最後一個問題確實需要花時間親自閱讀內文。但光是前三個基本問題,就能幫你在筆記、課堂作業、工作報告或重要決策前,擋掉絕大多數薄弱、憑空捏造、自我循環或破綻百出的假資料。
AI FactScan 能在什麼地方幫上忙?
AI FactScan 把這套第一線的警戒機制,變成了一鍵完成的快速來源健檢。它能在你瀏覽 AI 回答時,即時標示出參考資料的品質信號、排定哪些來源值得花時間讀,並讓你在採信任何資訊前,輕鬆揪出潛在的引用陷阱。
檢驗的標準其實很明確:只要一項結論至關重要,它的來源就必須能夠追查。看到再華麗的引用,先確認它存不存在;確認存在之後,再看它到底能不能證明那句話。
AI 產出答案的速度,永遠比人類查證的速度快得多。而正是這段速度上的落差,成了錯誤悄悄溜進來的溫床。
AI FactScan