← 返回首頁
觀察·ChatGPT·2026-07-20 06:02

GPT-5.6 used a prompt to close a 30-year gap in co

版主 渡鴉

這幾天圈子裡都在傳 GPT 拿下一道困擾學界三十年的凸優化難題,甚至有人開始爭論數學家是不是該領失業救濟金了。這事兒起因於一份號稱利用提示詞引導模型補全證明缺口的報告,雖然還沒過同行評審那一關,但那長達十頁、寫滿了高等數學邏輯引導的提示詞,確實讓不少人看傻了眼。這不是什麼「幫我寫段 Python 爬蟲」的層級,這是用一種極其硬核的數學語境,把 OpenAI 的邏輯推理能力逼到了牆角。與其說是模型立了大功,不如說是背後那個寫提示詞的人,硬生生地把 AI 當成了一台高精密度的邏輯補完機在操縱。

如果你仔細去看那份被瘋傳的文檔,第 27 頁那個長得像論文一樣的提示詞才是真正的技術關鍵。這反映了一個很諷刺的現實:當大眾還在爭論 AI 到底有沒有「智慧」時,頂尖的學術圈已經在把 Prompt Engineering 演化成一種「邏輯分層」的技術活。這不是在聊天,這是在進行知識灌頂。當你把幾十年的研究背景、特定的數學邊界條件,甚至是某種未經驗證的直覺邏輯全塞進去時,GPT 展現出來的不是那種隨機的語言聯想,而是在極高維度的空間裡進行路徑搜索。

這種搜索能力在處理長上下文與複雜邏輯鏈條時,目前還是 ChatGPT 的主場。雖然有人拿 Gemini 的百萬級 token 來說事,但在這種需要極致精準、不容許一絲「幻覺」閃爍的數學推導中,Gemini 往往會在推到第五步或第六步時,因為過度追求上下文的平滑感而丟失了嚴謹性。至於 Grok,它更像是一個在數據海洋裡橫衝直撞的蠻力選手,在這種需要細膩邏輯雕花的任務面前,顯得有些過於粗放。

很多人好奇,這是不是意味著數學門檻降低了?恰恰相反。現在的情況是,如果你不懂得如何把一個複雜問題拆解成 AI 能理解的邏輯塊,你連那個「十頁長提示詞」的門檻都摸不到。相較於 Kimi K3 在某些特定語境下的長文本處理邏輯,OpenAI 的做法顯然更傾向於在模型內部的推理鏈條上做文章。這種對推理深度的壓榨,讓 ChatGPT 在面對這種「三十年未解之謎」時,展現出了一種令人不安的冷靜。

在橫向對比中,我們能發現一個很有趣的斷層。Claude 在處理這類任務時,雖然語氣更像一個謙卑的學者,且在程式碼實現上極其穩定,但在面對純數學的原始創新推導時,它有時候會表現得過於守舊,不敢輕易跨出邏輯的既定範疇。而 ChatGPT 則帶有一種冒險精神,只要你的提示詞引導得夠深,它真的敢在懸崖邊上給你搭出一座橋來。這種特質在解決低垂果實(Low-hanging fruit)時或許看不出差別,但在攻克這種三十年級別的硬骨頭時,那種微弱的「創造性邏輯跳躍」就成了勝負手。

話說回來,這場關於「AI 奪走數學家飯碗」的狂歡,本質上是一場頂尖操盤手的個人秀。模型只是工具,那個能寫出十頁數學引導詞的人,才是真正解決問題的內核。當知識的生產成本被壓縮到接近零時,真正貴的其實是那種「知道該往哪裡挖」的直覺。我們現在看到的,不過是 AI 把人類已經嚼爛的邏輯重新排列組合,給出了一個最有可能的解。

這就引出了一個挺尷尬的問題:如果未來的數學研究變成了「誰更能寫提示詞」,那到底是我們在研究數學,還是我們在研究如何取悅 AI 的神經元?當一個模型能繞過人類三十年的苦思冥想,直接給出答案時,我們該慶幸自己多了一個大腦,還是該擔心自己的大腦正在退化成一個過濾器?如果下一個未解之謎也被這樣「提示」出來了,我們還有能力去驗證它的真偽嗎?

資料來源:GPT-5.6 used a prompt to close a 30-year gap in convex optimization