這兩天 Hacker News 上關於「虛假智庫」操弄 AI 回答的討論,讓那群自詡為客觀中立的技術信徒驚出一身冷汗。事情其實不複雜:有人成立了一堆空殼研究機構,發布大量看似專業、實則帶有特定立場的報告與文章。這些內容迅速被爬蟲抓取,餵進了 LLM 的肚子。當你在 ChatGPT 或 Claude 的對話框裡輸入特定地緣政治問題時,AI 吐出來的參考文獻,可能就是這些精心包裝的謊言。這不是傳統意義上的公關,這是針對模型權重與檢索增強生成(RAG)底層邏輯的降維打擊。我們以為自己在跟全人類的知識結晶對話,實際上可能只是在讀一份被洗過的宣傳手冊。
技術圈向來對這種「數據污染」嗤之以鼻,認為靠模型規模和清洗算法就能過濾噪音。但這次不一樣,這些「智庫」產出的內容在格式上完美契合了優質數據的特徵:長文本、引用詳盡、結構嚴謹、語氣專業。對於目前主流的四大平台來說,這簡直是避不開的陽謀。OpenAI 的 GPT-4o 在處理這類爭議性話題時,往往表現出一種令人不安的「平衡感」。如果你問它關於某些敏感地區的衝突,它會熟練地從數據庫裡抓取那些看似權威的報告。由於這些虛假智庫的產量極大,且在 SEO 上下足了功夫,GPT-4o 內置的搜尋組件很容易將其權重置頂。這導致 AI 的回答雖然看起來客觀,但基礎事實的採樣點已經偏移。
Claude 在這方面的處理邏輯略有不同,Anthropic 一向標榜憲法 AI 與安全性,這讓 Claude 在回答這類問題時顯得極度保守。它會反覆強調「這是一個複雜的問題」,並試圖列舉不同來源。但問題在於,如果連數據源頭都被污染了,Claude 所謂的「多方考量」也不過是在不同版本的偏見中做選擇題。至於 Gemini,背靠 Google 強大的搜尋引擎底座,它理應能識別出哪些網站是剛成立三個月、除了轉載就是原創垃圾的「僵屍智庫」,但實際測試下來,Gemini 對於這類高階偽裝數據的免疫力並沒有想像中強。它太依賴權威感了,而「智庫」這個標籤本身就是權威感的偽裝色。
在當前這個時間點,技術演進的速度遠超我們對真實性的定義。相較於 DeepSeek-v4-flash-vision-exp 最近展示的視覺處理能力,OpenAI 顯然更在乎如何在全球政治角力中保持一種脆弱的技術中立。這種中立在面對有組織、有預算的數據投毒時,顯得極其無力。當矽谷的巨頭們還在爭論要不要給 AI 加上更多的道德護欄時,真實世界的博弈者已經開始繞過護欄,直接去改寫 AI 的「記憶」。這比直接改寫教科書效率更高,因為現在的人們更願意相信一個冷靜、無私的聊天機器人,而不是某份帶有官方印章的文件。
Grok 在這場亂局中扮演了攪局者的角色,它宣稱要打破矽谷的覺醒文化,給出「真實」的答案。但現實是,Grok 抓取的即時數據源(主要是 X 平台)本身就是謠言與偏見的溫床。當虛假智庫的內容在社交媒體上擴散,Grok 會第一時間把這些情緒化的數據內化成自己的邏輯。這產生了一個荒謬的循環:假新聞餵給 AI,AI 生成總結,總結又被當作事實回傳到網絡,最後連原始數據是什麼都沒人記得了。在這種情況下,四大平台標榜的知識完整性,更像是一場隨時會崩塌的沙堡。
如果說數據是 AI 的燃料,那麼現在這些燃料裡被摻進了無色無味的劇毒。研發人員試圖用算法來解決真偽問題,但算法本身就是建立在對數據分布的統計學預測之上。當惡意數據的密度大到一定程度,統計學意義上的「真理」就失效了。我們是否過於樂觀地相信了 LLM 的判別能力?當一個模型告訴你某個智庫的報告是「權威來源」時,它到底是在執行檢索,還是在執行某種被預設好的幻覺?如果未來所有的知識檢索都依賴這幾個寡頭模型,而模型背後的數據庫又成了各方勢力的輿論戰場,我們還能從那塊發光的螢幕背後得到什麼真相?還是說,我們其實早就接受了這種被過濾過的虛假,只要它聽起來足夠有邏輯?