← 返回首頁
觀察·ChatGPT·2026-09-13 07:03

OpenAI 塞給你的派對合照裡到底藏了幾根手指

版主 渡鴉

如果你還在為 ChatGPT 剛更新的 Images 2.5 感到興奮,那我建議你先去洗把臉,然後把那張所謂「革命性」的複合派對照片放大到 300%。看見左邊那個男人了嗎?他正用三根手指優雅地捏著杯子,彷彿他的進化過程在某個深夜被 OpenAI 的工程師悄悄按下了簡化鍵。至於中間那位仁兄的牙齒結構,簡直像是某種未知的生物組織在口腔裡發生了坍縮。Sam Altman 總是喜歡給我們展示這種遠看繁花似錦、近看全是馬賽克邏輯的視覺奇觀,美其名曰多輪對話一致性,實際上卻連最基本的人體解剖學都還沒搞明白。

這種「一致性」的本質究竟是什麼?在技術底層,Images 2.5 試圖解決的是擴散模型長期以來的金魚腦問題。過去你讓它畫個穿紅衣服的女孩,下一句讓她坐下,她可能就順便變了個性別或者換成了綠裙子。現在 OpenAI 宣稱他們解決了這個問題,透過在 Latent Space 裡釘住某些關鍵特徵向量,讓多輪對話中的視覺元素保持相對穩定。但這種穩定是有代價的,為了維持那點可憐的一致性,模型似乎犧牲了對細微末節的算力分配。噪點梯度(Noise Gradient)的處理依舊像是一場賭博,背景裡那種揮之不去的數位髒感,在某些暗光場景下簡直是災難。

這不禁讓人想起 Google 的 Gemini 1.5 Pro 在處理圖像理解與生成時的謹慎。Gemini 在 Function Calling 的穩定性上雖然偶爾抽風,但在處理長文本上下文中的視覺參考時,它顯然比現在的 ChatGPT 更在意「邏輯上的真實」。當你要求 Gemini 修改一張圖片的局部時,它會試圖去理解物體的物理結構,而不是像 ChatGPT 這樣,僅僅是把像素像貼紙一樣疊上去。更別提 Claude 3.5 Sonnet 了,雖然 Anthropic 在圖像生成這塊一直像個保守的清教徒,但它對圖像描述的精準度,往往能反過來嘲諷 DALL-E 3 那種過度美化的審美傾向。

在特定市場的討論中,人們難免會拿最近剛有新動態的 DeepSeek v4.1 Flash 來做對比。相較於 DeepSeek v4.1 Flash,OpenAI 的做法顯然更偏向於消費端的感官刺激。這種策略很聰明,畢竟大多數人只會把生成的照片發到社群媒體上,騙幾個讚就完事了,誰會在乎照片裡的男人是不是少了兩根手指?只要黃色調(Yellow Tint)問題在多輪對話中不再那麼頻繁地毀掉整張圖,大眾就會覺得這是技術爆炸。但對於那些想把這玩意兒用在專業設計甚至是當地小吃店招牌上的人來說,這種不穩定的細節簡直是定時炸彈。

我們現在面臨一個很弔詭的現狀:模型變得越來越「聽話」,卻變得越來越「粗心」。Grok 2 在這方面走的是另一個極端,它幾乎不設防,什麼都敢畫,但也因此暴露出擴散模型在缺乏強烈對齊干預時那種原始的混亂。ChatGPT 則是在層層枷鎖下,試圖偽裝出一種精緻的專業感,結果在派對合照這種複雜場景下露了餡。

如果一致性的代價是讓人類變成三指怪人,或者讓牙齒變成一排模糊的白磚,這種進步真的值得我們歡呼嗎?當我們為了追求那種「看起來很像」的幻覺,而逐漸習慣了無視物理邏輯的崩壞,到底是 AI 在學習人類,還是我們在被迫適應 AI 的缺陷?下一次當你點開那張完美的複合照片時,你敢不敢放大看看那些藏在陰影裡的細節?

資料來源:ChatGPT Images 2.5