← 返回首頁
觀察·ChatGPT·2026-07-21 06:09

數學家的尊嚴難道只值十頁 Prompt

版主 渡鴉

那些整天嚷嚷著大模型只會預測下一個字、毫無邏輯推演能力的「移動球門愛好者」,這兩天大概集體禁言了。Hacker News 上關於 GPT 在凸優化領域閉合了三十年技術鴻溝的討論,本質上不是在聊數學突破,而是在探討人類智力溢價的崩塌。這不是那種靠運氣撞出來的答案,而是 OpenAI 的模型在被投餵了十頁精準的數學引導後,完成了一場持續三十年的學術長跑。

這場實驗的殘酷之處在於,它直接捅破了「領域專家」最後的遮羞布。我們過去習慣把科研想像成靈光一閃的神蹟,但現在看來,很多所謂的科研不過是極高維度的搜索任務。只要你給出的 Prompt 夠硬,包含足夠多的數學原語和正確的邏輯引導,GPT 就能在人類數學家踏步的地方強行破局。這不是在玩文字遊戲,這是實打實的邏輯重組。

在具體的技術實現上,這份長達十頁的 Prompt 其實是某種意義上的「思維腳手架」。它不是簡單的指令,而是把複雜的數學變換拆解成了模型可理解的推理軌跡。我們觀察 ChatGPT 在處理這類高難度任務時,其 Transformer 架構表現出一種令人不安的「穩定性」。在處理長達數萬 token 的複雜公式推導時,它能精準地掛載上下文中的數學約束,而不像早期版本那樣在第三步就開始胡言亂語。這種對邏輯結構的保持能力,才是這次凸優化問題被攻克的底層邏輯。

如果我們把目光轉向 Claude,會發現另一種風格。Claude 在處理同類型的長文本邏輯引導時,往往表現得更為「謹慎」,它會反覆確認前置條件的有效性。而 Google 的 Gemini 則在多模態符號理解上試圖走捷徑,但在這種極純粹的抽象代數推導中,Gemini 的表現往往顯得有些飄忽,容易在符號代換的邊界條件上翻車。至於 Elon Musk 的 Grok,雖然號稱擁有最強的算力資源,但在這種需要極致「數學直覺」的微操任務中,它更像是一個力大無窮卻缺乏細膩感的舉重運動員。

有趣的是,這週大家都在討論 Kimi K3 的新動態,但相較於 Kimi K3,OpenAI 的做法顯然更具備某種「暴力美學」的色彩。它不依賴特定的插件或外部求解器,而是純粹靠模型內部的權重去對抗人類累積了三十年的認知障礙。當你在討論區看到有人質疑這是否算「創新」時,其實問題已經變質了。如果一個工具能幫你摘掉那些掛了三十年都摘不到的果實,你還在乎它是不是真的「懂」數學嗎?

我們現在面臨的尷尬局面是,低難度甚至中等難度的科研果實,正在變成廉價的工業品。過去一個博士生花四年時間去證明的引理,現在可能只需要一個懂行的導師寫個通宵 Prompt 就能搞定。技能正在貶值,而對「概念」的架構能力正在變得前所未有的昂貴。這種分層會導致一個結果:未來只有兩種數學家,一種是能寫出那十頁引導詞的上帝,另一種是負責給 AI 跑出來的結果做審核的校對員。

那麼問題來了,當我們把所有的邏輯推演都外包給那些動輒消耗幾千瓦時電力的神經網絡時,人類大腦裡那些閃爍的「直覺」還剩下多少價值?如果下一個三十年的技術鴻溝是在幾秒鐘內被一個 Prompt 填平的,我們還有必要培養那些需要花二十年才能成才的數學家嗎?或者說,當智力變得像自來水一樣廉價且隨取隨用時,我們到底是在進化,還是在集體退化?

資料來源:GPT-5.6 used a prompt to close a 30-year gap in convex optimization