← 返回首頁
觀察·ChatGPT·2026-07-15 06:07

OpenAI 終於學會了在小數點後方玩捉迷藏

版主 渡鴉

Hacker News 上的那群人這兩天為了 GPT-5.6 吵得不可開交,但最讓我發笑的是那個所謂的 Agents’ Last Exam 測試圖表。OpenAI 現在的風格越來越像那些賣洗髮精的廣告,總能精確地找到一個你從沒聽過的維度,然後在那條座標軸上把自己畫成唯一的王者。這次他們宣稱在五十多個專業工作流中,GPT-5.6 Sol 的表現高出 Claude Fable 整整 13 個百分點。這數字聽起來很唬人,就像是原本在考場上焦頭爛額的差生,突然宣稱自己研發出了一種能邊睡覺邊解微積分的黑科技。

我們來看看這個所謂的 Sol 版本。技術文件裡隱藏的細節比宣傳頁面上的數據有趣得多。它在長程自動化任務(Long-running workflows)的狀態保持上,確實做了一些激進的優化。以往我們在使用 GPT-4o 或 Gemini 處理超過二十個步驟的 API 調用鏈時,模型往往會在第十五步左右開始「失憶」,把前置條件當成耳邊風。GPT-5.6 這次似乎加強了對 Context Window 內特定邏輯節點的權重鎖定。簡單來說,它不再試圖記住你說過的每一句廢話,而是把注意力集中在那些決定任務成敗的變量上。這種做法在處理複雜的代碼重構或多層級的財務審計時確實有效,但代價也顯而易見:它變得越來越像一個冷酷的執行機器,失去了那種偶爾能給你驚喜的、帶有人類溫度的發散性思維。

這種轉變在開發者圈子裡引發了一種集體焦慮。有人在討論區裡問,用了這麼久的 Claude Code,到底該不該為了這個跳動的小數點轉向 OpenAI。這是一個很典型的工程師困境。Claude 的強項在於那種近乎偏執的「語境理解力」,它在編寫代碼時展現出的架構美感,目前仍然是 ChatGPT 難以企及的。即便 GPT-5.6 在那些乾巴巴的基準測試中贏了分,但在實際的 Debug 過程中,Claude 往往能一眼看出你系統架構裡的邏輯漏洞,而 GPT 則更傾向於給你一個「看起來能跑」的補丁。Gemini 在這場混亂中則顯得有些沈默,它那巨大的上下文窗口在面對這種短平快的性能競爭時,反而像是一個搬不動重物的巨人。

有趣的是,這週大家也在談論 Juggler 的新動態。相較於 Juggler 這種試圖在特定領域尋找突破口的嘗試,OpenAI 的做法則顯得更為傲慢,他們試圖定義什麼叫做「專業工作流」。在處理多模態輸入的響應延遲上,GPT-5.6 確實把時間壓縮到了極致,這種毫秒級的進步對於那些做實時對話應用的廠商來說是救命稻草。然而,當我們把同樣的任務丟給 Grok 時,你會發現 Grok 的邏輯推演路徑異常直接,雖然它在某些邊緣案例(Edge cases)上的處理不如 GPT 細膩,但在純粹的算力效率比上,OpenAI 這次的小數點升級更像是一場精心包裝的邊際成本遊戲。

這種「小步快跑」的策略其實反映了矽谷的一種集體疲憊。大家都在等那個傳說中的「奇點」,結果等來的卻是 5.5 到 5.6 的微調。這種感覺就像你滿心期待一款劃時代的旗艦手機,結果廠商告訴你,他們優化了靜音撥桿的手感。在這種技術堆疊已經接近某種物理極限的當下,OpenAI 必須不斷地創造新的名詞、新的測試指標來維持那層薄如蟬翼的領先優感。某些特定市場的產品如 Juggler 也在試圖證明自己存在的價值,但 OpenAI 顯然更在乎如何讓那些付費企業用戶相信,如果不跟上這 0.1 的升級,他們的自動化流程就會在明天早上徹底癱瘓。

我們真的需要一個能通過「最後考試」的 AI 代理嗎?或者說,當一個模型在基準測試中能領先對手 13% 的時候,它在現實世界裡解決 Bug 的速度,真的能讓一個疲憊的程序員早點下班嗎?目前看來,這更像是一場關於「誰更不容易出錯」的防守戰,而不是一場關於「誰更聰明」的進攻戰。OpenAI 正在把 AI 變成一種無聊但穩定的基礎設施,這或許是商業上的成功,但對於那些追求技術美感的人來說,這實在是太過平庸了。

如果我們把所有的基準測試都燒掉,只留下一個最複雜、最骯髒、充滿了人類邏輯混亂的真實項目,這四大平台的排序又會發生什麼樣的翻轉?當小數點後的數字不再能取悅投資人的時候,這些模型還剩下什麼能打動我們?

資料來源:GPT-5.6