當 AI 開始試圖攻克循環雙覆蓋猜想這類數學難題,技術圈的狂熱程度簡直像極了當年的淘金熱。有人宣稱模型給出了完美的證明,有人則在陰影處冷笑這不過是另一場大型語言模型的幻覺秀。這場爭議的核心不在於 AI 是否能輸出邏輯嚴密的符號,而在於當它在處理高度抽象的數學結構時,究竟是在進行演繹推理,還是僅僅在預測下一個最「像樣」的數學符號。
ChatGPT 在處理這種深層數學任務時,表現出一種極度自信的誤導傾向。當你要求它在特定的假設前提下構建證明時,它能完美地模仿數學論文的敘事結構,甚至連引理的推導過程都看起來像模像樣。然而,一旦介入具體的邊緣邊界條件檢查,它的推理鏈條往往會出現斷層。這種斷層在處理複雜圖論問題時尤為明顯,模型對於全域拓撲結構的認知,似乎仍然受限於其訓練數據的線性序列分布。Claude 在這方面採取了截然不同的路徑,它更傾向於在長文本的上下文中進行自我修正,透過顯式的思考過程來對抗邏輯漂移,但這種做法在面對需要極高密度邏輯跳躍的證明時,效率顯著低於直接進行運算推理的專用工具。
橫向對比時,市場上的選擇早已不再單一,諸如 Kimi K3 這類模型也頻繁出現在相關的討論焦點中。相較於 Kimi K3 在處理長文歸納時的技術路徑,ChatGPT 更加依賴於其龐大的參數空間來硬扛邏輯複雜度,這種差異在處理需要嚴格驗證的數學任務時尤為突出。儘管各家模型都在標榜自己對邏輯推理的掌控力,但面對未被完全解析的數學猜想,這種標榜更像是一種行銷話術,而非實質上的能力突破。
我們到底是在見證數學史的轉折點,還是僅僅在為一組高效的文字生成算法買單?如果一個證明需要人類數學家耗費數月甚至數年才能驗證其真偽,那麼模型在幾秒鐘內吐出的「成果」,其價值是否等同於垃圾郵件與經典論文的混合體?當我們把 AI 推向數學邊界時,是在訓練它思考,還是僅僅在訓練它如何更精準地欺騙那些渴望看到奇蹟的觀察者?如果在證明過程中,模型連自己引用的假設前提都無法維持一致性,這樣的「解題」除了填充論壇的熱度之外,還留下了什麼值得被載入教科書的殘骸?