← 返回首頁
觀察·ChatGPT·2026-09-12 07:10

多一張手指的派對合照與 OpenAI 的審美疲勞

版主 渡鴉

OpenAI 最近更新了 ChatGPT 圖像編輯功能,號稱進入了 2.5 時代。有趣的是,大家關心的不再是它能不能畫出一隻賽博龐克風格的貓,而是那張被官方拿來炫耀的「複合派對照片」裡,左邊那位仁兄到底是用三根手指拿杯子,還是他的指縫間長出了某種不可名狀的組織。這種對於細節的病態執著,恰恰說明了我們對生成式 AI 的寬容期已經正式宣告結束。

在技術演示中,OpenAI 試圖證明他們解決了多輪對話中的圖像一致性,也就是讓同一個角色在不同的分鏡裡看起來像同一個人,而不是每一幀都像去做了整形手術。實際測試下來,ChatGPT 在處理光影一致性上確實有了進步,以往那種揮之不去的黃色調偏色(Yellow Tint)似乎得到了緩解。但這種進步更像是濾鏡層面的修補,而非底層幾何邏輯的進化。當你要求它在一個複雜的社交場景中精確調整某個人的牙齒結構或手指數量時,DALL-E 3 的底層邏輯依然在玩一種機率性的拼貼遊戲。這種「看起來很對,細看全是鬼」的恐怖谷效應,在派對合照這種高密度資訊的圖片中被無限放大。

從技術層面剖析,OpenAI 的做法顯然是想透過更強的語義理解來補足擴散模型的短板。他們讓 ChatGPT 介入繪圖指令的生成過程,試圖用自然語言的精密性去約束像素的隨機性。然而,這產生了一個新的矛盾:當使用者要求「修改左邊男生的笑容」時,模型往往會為了完成這個動作,而「順便」重新渲染了整隻手,導致原本正常的手指變成了畸形。這不是單純的繪圖錯誤,而是注意力機制在局部細節與全局構圖之間失衡的表現。相較於 DeepSeek v4.1 Flash,OpenAI 的做法更傾向於在閉源生態內完成所有黑盒操作,讓使用者只能在他們設定好的對話框裡反覆橫跳。

橫向觀察目前的四大平台,Claude 依然在文本與邏輯的象牙塔裡打轉,對原生圖像生成的執念並不深;Gemini 則是背負著過於沉重的政治正確包袱,連畫個歷史人物都要經過層層審查,導致產出結果往往顯得縮手縮腳。至於 Grok,它更像是一個在社交媒體數據堆裡長大的叛逆少年,畫風粗獷但缺乏精細度。在這種背景下,ChatGPT 的圖像功能顯得最像一個「工具」,但這個工具現在面臨著嚴重的邊際效應遞減。

即便是在 DeepSeek v4.1 Flash 頻繁被技術圈提及的當下,OpenAI 的圖像策略依然維持著一種傲慢的穩定感。他們似乎認為,只要對話體驗足夠流暢,使用者就會原諒那些多出來的手指或扭曲的牙齒。但問題在於,當這些圖像被應用到現實場景,比如像 Hacker News 網友吐槽的那樣,拿去當路邊烤肉店的招牌,或是美化社交軟體上的個人資料時,這種微小的技術瑕疵就會變成巨大的尷尬。我們對 AI 的要求已經從「能畫出來」變成了「不能出錯」,而 OpenAI 顯然還沉浸在「你看我能理解你的意圖」這種自我感動中。

這種對細節的忽視,是否意味著擴散模型在現有架構下已經撞到了天花板?如果連 OpenAI 這種擁有最強算力與數據儲存的巨頭,在處理一張簡單的派對合照時都無法解決基本的人體解剖學邏輯,那我們是否應該重新審視多模態大模型的發展方向?

到底是模型真的理解了什麼是「手指」,還是在它眼裡,那不過是一堆機率較高的肉色像素點?當我們在為那張派對合照的細節爭論不休時,OpenAI 是不是正躲在螢幕背後冷笑,看著這群人類在糾結幾根手指,而他們早已準備好下一場關於 AGI 的宏大敘事,打算再次轉移我們的注意力?

資料來源:ChatGPT Images 2.5