AI FactScan AI FactScan
← Blog

KPMG 發布的 AI 報告列了 45 條引用,結果只有 5 條是真的

KPMG 這篇被迫下架的報告,成了 AI 幻覺文獻最經典的研究案例:這些參考資料在未經任何人真正查核前,外表看起來竟然無比專業。

2026 年 6 月,國際知名會計師事務所 KPMG(安侯建業)悄悄從官方網站撤下了一份重磅報告。

這份報告名為 Redefining Excellence in the Age of Agentic AI(代理型 AI 時代重新定義卓越),最初於 2025 年 10 月發布。報告深入探討了企業如何運用 AI 邁向卓越,並煞有介事地引用了瑞士信貸/瑞銀集團(UBS)、英國國民健保署(NHS)、瑞士聯邦鐵路(Swiss Federal Railways)以及倫敦交通局(Transport for London)等大型機構的實際導入案例。

但問題來了:這些企業案例全遭到了當事機構的強烈否認。瑞銀集團表示報告中的描述完全失真且具誤導性;據《Financial Times》報導,英國 NHS、瑞士聯邦鐵路與倫敦交通局也都出面澄清,表示報告中提到的案例根本子虛烏有。外媒《TechRadar》更引述 AI 偵測團隊 GPTZero 的調查指出,在整份報告列出的 45 條參考文獻中,竟然只有 5 條真正指向真實存在的來源!其餘多達 40 條要麼根本查無此文,要麼斷章取義,要麼就是徹頭徹尾憑空捏造的「幽靈文獻」。

KPMG 隨後發表聲明稱:「我們要求所有員工必須嚴格遵守負責任 AI 使用準則,包括必須由人工親自審核內容,並對所有獨立來源進行查證。」

話音剛落,這份報告就被徹底下架了。

KPMG 到底是什麼樣的機構?

這絕不是什麼默默無聞的小作坊。

KPMG 是全球聲名赫赫的「四大會計師事務所」之一,業務遍及 140 多個國家,全球員工高達數十萬人。他們賴以立足的核心本業正是「審計與確信」——專門負責查核財務數字的精確度,確保企業報告值得公眾信任。

然而,正是這樣一家以「專業查帳與驗證」為金字招牌的頂級機構,卻發布了一份充斥虛假企業案例的 AI 報告,透過全球宣傳管道大肆推廣,在官網上掛了好幾個月,直到東窗事發才被揪出來。

如果連這種把「核查」當飯吃的專業機構都會被 AI 生成的假文獻瞞天過海,你憑什麼確信自己昨天剛用 AI 寫完的報告,裡面的參考文獻全都是真的?

為什麼 AI 寧可胡說八道,也不肯說「我不知道」?

KPMG 的這起事件並不能單純歸咎於審查疏忽。疏忽只是表面症狀,背後更值得探究的是 AI 本身的運作機制。

當你問 AI「瑞銀集團是如何導入 AI 的?」,AI 模型首要的任務是產出一段「聽起來合情合理」的回答。表面上,「真實的回答」與「看似合理的回答」長得非常相像,但在演算法的底層,這兩者根本是完全不同的目標。

大型語言模型非常擅長走「順暢路徑」:輸出語句通順、架構嚴謹且細節滿滿的文字;但當它們碰上不確定或知識空白的邊界時,卻極度不擅長立刻停下腳步。

這在某種程度上是模型訓練與微調過程帶來的副作用。在人類回饋強化學習中,模型如果表現得樂於助人、回答詳盡且語氣自信,往往會獲得更高的評分。雖然在特定情境下謹慎的免責聲明或直接拒絕回答也會受到鼓勵,但在一般的學術或商業寫作中,一段包裝華麗的回答,比起乾巴巴地承認「我不清楚」,往往讓人感覺更有價值。

這就導致了一種常見的現象:就算手邊的佐證資料極其單薄,AI 依然會竭盡所能為你捏造出一個「完整回答的形狀」。

當你要求它提供參考來源時,它就會順水推舟,將作者姓名、報告標題、機構名稱、日期以及長得很像網址的字串拼湊在一起。每個元件拆開來看都無比逼真,組合在一起就是一條看似完美無缺的參考文獻。

從人類的角度來看,AI 並不是在蓄意說謊,它根本不知道自己在寫小說。它只是在延續某種語言模式:企管顧問報告通常會引用大型企業案例;企業 AI 案例往往會提到銀行、醫院、鐵路與運輸機構;參考文獻則一定包含標題、年份與網址。產出來的成果看起來天衣無縫,直到有人真正動手去查證原始文獻。

AI FactScan 能為你揪出哪些破綻?

AI FactScan 是一款瀏覽器擴充功能,讓你在與 AI 對話的當下就能直接進行檢測。

選取 AI 的回答並啟動掃描,它會立即執行三件事:

  • 提取所有引用的連結:包括那些外表長得像參考資料、點進去卻是一片空白或無效的死連結。
  • 給予 A 到 F 的來源品質評級:結合來源公信力訊號、DOI 解析器驗證與已知資料庫特徵進行客觀評分。
  • 標記 AI 自我循環引用:抓出無效的解析器連結,以及肉眼容易忽略的薄弱來源模式。

像 KPMG 這樣的慘痛案例,如果當初在草稿階段使用了 AI FactScan,就能在第一時間浮現出大量無效、存疑的文獻警訊。這就是立刻停下腳步、點開原始文獻核實的最佳時機,避免讓充滿幻覺的草稿演變成正式對外發布的災難。

AI FactScan 無法替代的事情

AI FactScan 能告訴你連結是否存在、DOI 編號是否有效,以及該來源是否具備足夠的權威性訊號。

但有一個關鍵環節,是任何輕量級工具都無法完全取代的:這篇文獻到底有沒有講出 AI 所聲稱的那些結論?

AI 完全有可能引用了一篇真實存在的高水準論文,卻把一個論文根本沒提過的結論硬扣在它頭上;或者引用了一份合法的政府報告,卻嚴重誇大了報告裡的數據。這個最後的把關環節,依然需要人類親自點開原文看一眼。

如何對可疑的 AI 引用進行「壓力測試」?

在你採信或引用 AI 給出的文獻之前,可以向 AI 追問以下這些極難靠機率「完美造假」的細節:

  • 要求具體細節:「這項研究的樣本數是多少?採用了哪種研究方法?出現在哪一頁或哪一個章節?」
  • 進行矛盾測試:先詢問這項研究的核心結論,接著追問「這項研究有何限制或爭議?」。憑空捏造的文獻通常在連續追問下會自相矛盾、漏洞百出。
  • 索取關鍵原文引句:要求 AI「請從這份文獻中直接摘錄出支持這項主張的原始英文句子」,然後拿這句話去搜尋引擎比對,或直接對照原文。

這些方法並不能保證 AI 絕對誠實,但能讓那些沒有佐證的胡言亂語變得極難維持下去。

血淋淋的教訓

KPMG 的問題並不是缺乏管理規章——他們早就明文規定員工必須由人工審核 AI 的產出。真正的問題在於:只要一串參考來源看起來足夠專業逼真,它就能暢行無阻地穿透層層工作流程,期間沒有任何人在文獻查核上真正踩剎車。

這正是 AI FactScan 的核心價值所在:在工作流程的最前端為參考資料進行快速把關,在有問題的文獻混入正式報告之前,第一時間將它們揪出來。