想像一下:你問 AI 一個有明確解答的問題,它原本準備回答會議時間是 5 月 12 日。但為了讓這段文字日後能被系統驗證,研究中的生成系統加上了文字浮水印。
畫面上沒有任何印章,字體也沒有變色,但最後呈現在你眼前的答案,卻變成了會議時間是 5 月 21 日。
這就像商店為了防偽,在商品包裝上貼了隱形條碼,結果標籤機卻在貼上的瞬間,順手把商品的有效期限給改掉了。你拿到了一份更容易追蹤的包裝,內容物卻讓你再也不敢放心使用。
這是論文中的生成路徑示意,不是真實使用者案例。研究實驗發現:測試的六種代表性 AI 文字浮水印,都降低了 AI 回答的事實準確度,而且數字與時間特別容易受到影響。
KGW 浮水印怎麼加進文字裡?
可以把大型語言模型想成一間 AI 餅乾工廠。它做的不是一次烤好一整盒餅乾,而是每次挑一種原料,也就是下一個詞,再一步步完成整段文字。
KGW 是一種文字浮水印方法。工廠不必改造機器,也不必在成品上印 Logo;它只要在挑選下一種原料時,使用一把祕密鑰匙稍微改變選擇。
它有點像餅乾工廠偏好使用一批只有自己知道的原料。吃的人嘗不出標記,拿著配方的檢查員卻能從整盒餅乾的用料比例看出端倪。這是統計判斷,不是看到某一個綠色詞就能斷定文章由 AI 生成。
問題也出在這裡。如果正確日期剛好沒有得到加分,另一個看似合理但錯誤的日期卻在綠色名單中,浮水印就可能改變模型最後選出的答案。
論文中的生成路徑示意:浮水印先微調了一個詞,後續答案便可能沿著完全不同的路徑展開。
一個詞被推了一下,後面的事實也可能跟著偏離
問題在於:AI 生成是連鎖反應,剛剛選出的詞,會立刻變成下一個詞的上下文。
論文研究團隊發現,浮水印破壞事實準確度主要有兩個機制:
當下的詞元擾動:浮水印演算法為了給特定詞加分,可能讓正確的 12 日失去原有優勢,改由另一個語意流暢、內容卻錯誤的 21 日勝出。
前文造成的注意力偏移:當浮水印在前半句把 meeting 推成 session,這個微小變動就會進入 AI 的前文。隨著句子越寫越長,模型對參考資料中關鍵證據的注意力可能逐漸降低。
第一步只是輕推一下,後面的事實偏差卻可能逐步累積。
六種代表性浮水印都出現準確度下降
在論文 Invisible Ink, Visible Lies: How Production Watermarking Causes LLMs to Hallucinate 中,研究人員進行了一項嚴謹的對照實驗:
他們將同一份維基百科資料與問題交給 LLaMA 3.1、Mistral 與 Qwen 等 AI 模型,在提供完全相同參考資料(RAG 技術)的條件下,比較無浮水印與有浮水印的回答。
結果顯示:測試的六種代表性浮水印方法,全部都出現事實準確度下降。
這些錯誤不容易察覺。句子依然語法通順、邏輯流暢,但關鍵的數字、日期或專有名詞,可能已經被換成錯誤內容。
研究團隊也提出了補救介入方案(FPTI 與 FPAI),透過在事實關鍵詞上暫停浮水印干擾,並補償模型對參考資料的注意力。在偵測真陽性率為 90%、假陽性率為 1% 的設定下,兩者合用後,浮水印造成的事實錯誤比只使用浮水印時減少約 90%,但仍有殘餘差距。這表示浮水印仍有改善空間,但 AI 開發者必須將事實準確度納入評估指標。
當 AI 浮水印帶來隱形幻覺,查證就不能只靠 AI
這項研究提醒我們:
能辨認出一段文字可能由 AI 生成,不等於證明內容正確。
對一般使用者而言,當你看到一段文筆流暢、語氣堅定的 AI 輸出時,根本無法從畫面上判斷裡面的錯誤究竟來自模型本身的幻覺、提示詞寫不好,還是浮水印在背後影響了生成。
只要答案會影響報告、採購、醫療、法律、金錢或行程,我們就不能把流暢的語氣當成證據。最安全的方式,依然是找出它引用的原始來源,親自點開網頁,確認日期、數字與人名是否真的吻合。
浮水印或許能幫平台辨認 AI 文字,卻無法替使用者驗證事實。當防偽標記也可能增加幻覺風險時,回到原始來源核對就更加重要。
AI FactScan 會整理答案附上的資料連結,讓你直接確認 AI 的說法是否有來源支持。
這篇研究還不能替所有 AI 下結論
需要注意的是,這項研究是在特定的開源模型、受控的檢索增強生成(RAG)環境與有限的事實類型中完成的。它沒有證明所有商業 AI 目前使用的浮水印都會造成相同結果,也不代表每段帶有浮水印的文字都一定出錯。
研究團隊並非主張放棄浮水印。他們指出:評估這類技術時,除了偵測能力,也必須測試它是否改變答案的事實準確度。
AI FactScan