AI FactScan AI FactScan
← Blog

AI 附的參考來源真的可靠嗎?我們實測了 Copilot 的回答

微軟 Copilot 在回答一個學術問題時附上了 6 個參考資料。然而在第一輪基本來源檢查中,就有 4 個直接陣亡:2 個是空白的搜尋頁,另外 2 筆 DOI 論文編號在全世界的資料庫裡根本查無此文。

AI 生成的內容正在以驚人的速度占領整個網路。權威機構皮尤研究中心(Pew Research Center)分析了透過 Common Crawl 收集的近 50 萬個英文網頁。在 2026 年 7 月的樣本中,有 10% 的網頁顯示出明顯由 AI 撰寫或編輯的痕跡;而在 ChatGPT 問世後才發布的新網頁中,AI 產出的比例更超過了三分之一。

雖然單一檢測模型偶爾會誤判個別文件,但這項大規模調查清楚反映了一股不可逆的宏觀趨勢:近幾年新上線的網頁中,AI 文字正在極速氾濫。

與此同時,AI 的回答也全面接管了我們的日常搜尋。皮尤的另一項調查指出,高達 60% 的美國成年人都會閱讀搜尋結果頂部的 AI 摘要。對許多人來說,點開任何網站之前,AI 寫好的答案就已經搶先呈現在眼前。

當這個回答在文末煞有介事地附上一排參考資料時,這些連結到底能為回答增加多少可信度?

我們向 Copilot 提出了一個直球問題

我們給了微軟 Copilot 一個非常合理的學術研究題目:

如何「確定」一則貼文是不是 AI 或機器人寫的?請附上相關學術研究佐證。

Copilot 很快就交出了一份答案,文末附上了 6 個參考來源。滿滿的網址連結與看起來無比專業的學術論文格式,讓整篇回答顯得深具說服力。

接著,我們完整選取了這段回答,並使用 AI FactScan 進行即時來源掃描。

30 秒完整實測過程:從提問、AI FactScan 掃描到來源查核。在 YouTube 上觀看影片。

6回答中附上的參考引用總數
4拿到 F 不合格評級的來源數
2 + 2包含 2 個空白搜尋頁與 2 筆幽靈 DOI 編號

到底有哪些來源在查核中直接翻車?

首先,有兩個引用連結點進去後,只是 Bing 搜尋引擎的搜尋結果頁,而且畫面上完全沒有任何實質有用的內容。它們連到的是一串可能相關的網址清單,而不是真正支持該項主張的具體文章、研究論文或調查報告。

更離譜的是另外兩個引用:它們附帶的 DOI 連結點開後,直接顯示 DOI NOT FOUND(查無此數位物件識別碼)。DOI 是學術界為論文、數據集等研究成果設立的「永久身分證字號」,即使出版社更換網址,DOI 也應該能始終引導讀者找到正文。當一個 DOI 顯示「查無此文」,代表它要麼被抄錯、要麼已經失效,更常見的情況是:它根本是 AI 憑空捏造出來的「幽靈文獻」。

這並不代表 AI 寫下的每一句話都是錯的。但它赤裸裸地證明:這篇回答裡高達三分之二(6 個中的 4 個)的參考資料,根本還沒輪到我們花時間閱讀證據,就在最基本的「來源是否存在」這一關徹底破功了。

免費安裝 AI FactScan Chrome 擴充功能,親自體驗來源快篩。

參考資料的數量,往往是最容易騙人的障眼法

一排排整齊的引用角標,很容易讓整篇回答散發出一種「有憑有據、可信度高」的假象。但單純的「數量」從來不代表背後的真相。最有效率的第一步快篩,永遠是先確認:這個來源到底存不存在?它是什麼類型的網站?以及 AI 是不是拿同一篇文章重複貼了好幾次來充門面。

等這些基本關卡都過關了,才是真正點開文章、核對關鍵段落的「實質查證」階段。

利用來源掃描,回過頭來向 AI 提出質疑

AI FactScan 能在幾秒鐘內為你繪製出一張清晰的證據地圖。哪些論文根本不存在、哪些網站品質堪憂、哪些內容被重複灌水,全都一目了然,讓你一眼看穿哪些論點需要先被放大檢驗。

接著,你就可以拿著這些鐵證回頭質疑 AI。要求它:「請換掉那篇查無此文的假論文」、「請提供支持這句話的第一手原始研究」,或者「請只使用我已經確認屬實的來源重新回答」。

來源評級只是一個起點;正是這一步步的回應與追問,才真正體現了批判性思維的價值。

所以,我們到底該給予這份回答多少信任?

我們這次問的問題是「如何確定貼文是不是 AI 寫的」。在現實世界中,這本來就是一個極度複雜的難題——光憑文字風格極難定論,現有的 AI 偵測器準確率也充滿爭議。面對如此嚴肅的議題,AI 在引用科學研究時本來就應該更加嚴謹。

然而,一段文筆流暢的文字,往往會表現得比背後證據所允許的更加言之鑿鑿。在轉述任何結論之前,請務必先看清楚它留下的線索軌跡;讓你的信心水準,永遠保持在證據真正支持的範圍之內。

請將這次實測視為針對單一 Copilot 回答的案例分析。在不同對話、不同提示詞或不同時間點下,AI 給出的來源與結果都可能有所改變。