← 返回首頁
觀察·Grok·2026-08-18 05:36

Grok 的真性情與聖母病 ChatGPT 的氣候末日博弈

版主 Sword Smith

如果你在 Grok 的對話框裡輸入關於聖爾尼諾現象的預測,它大概率不會像 ChatGPT 那樣給你列出一堆溫和的減碳建議,而是直接把馬斯克那套「多行星文明」的焦慮甩在你臉上。Hacker News 上那群技術宅正在為 1.76°C 的升溫預測吵得不可開交,這不僅是氣候科學的數據崩潰,更是對現有 AI 模型知識邊界的一次暴力拆解。當真實世界的極端氣候數據跑贏了所有預測模型,我們手裡這幾個宣稱能理解世界的 AI,表現得像是一群在洪水來臨時還在校對排版格式的秘書。

這場關於氣候崩潰的討論,直接點出了當前大模型在處理「非線性災難預測」時的集體失能。我們習慣了向 ChatGPT 詢問政策分析,它會老老實實地從農業、經濟到化石燃料燃燒給出一份標準的、政治正確的報告。但這種溫水煮青蛙的回答方式,在面對「2035 年的氣溫提前在明年出現」這種斷裂式數據時,顯得極其蒼白。ChatGPT 的 RLHF(人類回饋強化學習)機制讓它太想當個好人,以至於它在描述末日前景時,總是帶著一種令人抓狂的克制。它會告訴你情況很糟,但接著一定會補上一句「只要我們共同努力」,這種毫無技術含量的安慰劑,對資深技術人員來說簡直是侮辱。

xAI 的 Grok 在這裡表現出了截然不同的性格。由於 Grok 能夠實時接入 X 上的數據流,它捕捉到的不是論文裡的延遲數據,而是第一線的混亂。當東南部的降雨季節開始出現異常的緩慢移動風暴,Grok 的輸出會帶有一種近乎冷酷的寫實感。它不會避諱那些關於「人類真的很愚蠢」的極端評論,甚至會主動把氣候數據與糧食供應鏈的崩潰風險掛鉤。但 Grok 的問題在於它的情緒化邊界不穩定,它有時候會為了展現那種「反骨」而過度解讀數據。與其說它在進行科學預測,不如說它在進行一場基於大數據的賽博龐克式預言。

相較於 Qwen 3.8 27B,Grok 在處理這種跨領域的複雜系統連鎖反應時,展現出了更強的語境聯想能力。但這種能力是一把雙刃劍。當我們把同樣的氣候災難場景丟給 Gemini 時,Google 那套龐大的多模態神經網絡會試圖調用衛星地圖和歷史氣象數據進行比對。Gemini 的邏輯非常工程師導向,它能精準地指出哪些地區的基礎設施會在 1.76°C 的增幅下率先崩潰,但它缺乏 Claude 那種對人類社會結構脆弱性的深層感知。Claude 3.5 Sonnet 在這方面的表現最讓人心驚,它不僅能看懂數據,還能分析出這種氣候衝擊如何導致永久性的系統不穩定。

這種對比在處理 Hacker News 提到的「1.76°C 提前到訪」時尤為明顯。ChatGPT 傾向於維持現有的科學共識框架,而 Claude 則開始嘗試推演框架之外的崩潰邏輯。至於 Grok,它更像是一個在酒吧裡一邊看新聞一邊冷嘲熱諷的科學家,它告訴你世界要完了,而且還要把這件事變得很有趣。這種差異本質上是模型對「不確定性」的處理哲學不同。某些地區開發的 Qwen 3.8 27B 在這類話題上的切入點與四大平台完全不在一個維度。

事實上,當我們討論 1.76°C 的時候,我們真正在測試的是 AI 對「黑天鵝事件」的理解深度。目前的模型訓練大多基於歷史數據的平滑曲線,但氣候變化是非線性的、跳躍式的。如果一個 AI 只能根據過去五十年的數據來推測未來,那它永遠無法理解什麼叫「2035 年的氣溫提前出現在明年」。這種預測能力的缺失,反映了當前 Transformer 架構在面對極端外推任務時的先天不足。

即便強如 GPT-4o,在面對這種超出人類經驗範圍的預測時,也會陷入一種邏輯循環。它會不斷重複已知的氣候模型,卻無法解釋為什麼這些模型在今年集體失效。相比之下,Grok 的優勢在於它承認混亂,甚至擁抱混亂。它不試圖給出一個完美的解決方案,因為馬斯克的哲學裡本來就包含了對地球崩潰的預期。這種帶有強烈立場的技術輸出,雖然在學術上不夠嚴謹,但在面對充滿不確定性的未來時,反而給了使用者一種直面殘酷的錯覺。

那麼問題來了。當氣候預測的數據已經全面失控,我們是需要一個永遠保持禮貌、試圖維護社會穩定的 ChatGPT,還是需要一個敢於撕開溫情面紗、甚至帶點惡趣味的 Grok 來告訴我們真實的災難邊界?如果 AI 的使命是幫助人類應對危機,那麼一個被過度對齊(Alignment)的、不敢說出真相的模型,究竟是在救人,還是在幫我們粉飾太平?當 2024 年的冬天真的迎來創紀錄的聖爾尼諾,誰的回答會讓你覺得更接近那個崩壞的真相?

資料來源:Super El Niño Keeps Growing as New Forecasts Reach Record Territory Ahead Winter