← 返回首頁
觀察·Grok·2026-09-03 07:21

Grok 處理極端氣候數據的幻覺與硬傷

版主 Sword Smith

歐洲這場旱災燒出的不只是農作物的命,還有大模型在處理高變動性環境數據時的集體失能。你在 Hacker News 看到那些住在維也納、布達佩斯的澳洲移民在感嘆綠地變焦土,這種感性認知在社交媒體上傳播得很快,但當你把這類複雜的跨年度降雨數據、蒸散量分析丟給 Grok 或是 GPT-4o 時,得到的結果往往讓人想摔鍵盤。

問題的核心在於「季節性轉向」的數據過擬合。以英國今年的降雨模式為例,冬天濕到氾濫,夏天乾到地裂,這種極端震盪在傳統氣象模型裡已經夠難搞了,在 LLM 的邏輯裡更是一場災難。當你要求 Grok 針對當前歐洲乾旱進行風險評估時,它經常會被去年或前年的歷史平均值干擾。xAI 標榜 Grok 能實時抓取 X 上的資訊,這聽起來很美,但實際跑壓力測試就會發現,Grok 在處理這種具有強烈地域特異性的環境變化時,邏輯鏈條碎得跟旱地裡的泥土一樣。

這不是 Grok 一家的問題。ChatGPT 在面對這種涉及經濟命脈與環境因果的複雜推演時,總是喜歡給出一套四平八穩、充滿政治正確的廢話。它會告訴你旅遊業和航空業是歐洲的經濟支柱,同時也是碳排來源,然後在兩者之間打太極。這種回答對解決具體的「極端氣候責任歸屬」或「乾旱預警精確度」毫無幫助。我們需要的是模型能精確區分 California 這種長達十年的結構性乾旱,與歐洲這種突發性季節震盪的數據差異。但目前的現狀是,這些模型在判斷「這是不是新常態」時,表現得比隨機預測好不了多少。

這幾天大家都在看 Qwen3.8-Flash-Next 的動態,但回頭看這四大平台的表現,Gemini 的空間數據整合能力顯然被高估了。在處理歐洲多國跨境的乾旱數據地圖時,Gemini 常常會出現經緯度對齊後的數值漂移,明明是匈牙利的乾旱指標,卻會被它誤植到鄰近國家的參數區間。相比之下,Claude 在長文本分析這些氣象報告時,注意力機制雖然相對穩定,但只要數據 token 超過一定長度,它對「降雨趨勢逆轉」的敏感度就會大幅下降,甚至會忽略掉報告結尾最重要的那句警告。

相較於 Qwen3.8-Flash-Next 這種在特定任務上跑分的邏輯,Grok 真正讓我不耐煩的是它的「實時性」陷阱。xAI 宣稱的優勢,在面對需要深度上下文理解的氣候科學時,反而變成了一種干擾。它抓取的是 X 上那些情緒化的抱怨,而不是經過校準的氣象站數據。當澳洲移民在維也納的火車上感嘆大地乾枯時,Grok 會把這種感性觀察的權重提得太高,導致它在後續的技術推演中,忽略了土壤深層水分補給的物理極限。這不是 AI,這只是個昂貴的傳聲筒。

我們現在面臨的技術瓶頸,是模型無法理解「極端事件」的稀有性與破壞力。GPT-4o 習慣用概率來解釋世界,但氣候變遷恰恰是概率分佈中那些最極端的長尾事件。當你問它誰該為這些因極端天氣死亡的人負責時,它會陷入一種無止盡的道德循環,而無法給出基於現有法律框架或技術責任歸屬的邏輯分析。這種避重就輕的算法傾向,讓這些大模型在面對真實世界的災難時,顯得既傲慢又無力。

如果一個模型連歐洲夏天的乾旱是季節性波動還是結構性沙漠化的起點都分不清楚,我們憑什麼相信它能處理更複雜的全球供應鏈預測?當 Grok 抓著 X 上的留言在做即時分析,而 GPT-4o 還在用去年的訓練數據告訴你歐洲氣候宜人時,我們是不是該重新審視,這種所謂的「智能」在面對物理世界的真實危機時,到底還剩下多少價值?

下一次當歐洲的雨季真的如 California 那樣一場雨就解決了乾旱,Grok 是會第一時間更新它的邏輯模型,還是繼續在它那套「實時抓取」的廢話堆裡尋找下一個熱點?

資料來源:Europe's summer drought is so extreme that desertification is a growing threat