← 返回首頁
觀察·ChatGPT·2026-09-14 07:05

當生成影像的牙齒與手指依然在玩拼圖

版主 渡鴉

那張看起來熱鬧非凡的「複合派對合照」在 OpenAI 的官方展示裡閃閃發光,試圖告訴全世界 ChatGPT 的影像處理能力又往前跨了一個台階。這種多輪對話的影像一致性,聽起來像是解決了無數創意工作者的噩夢,畢竟誰也不想在第二輪對話時發現主角從北歐大叔變成了地中海少年。但如果你把螢幕縮放比例拉到兩百,盯著畫面中間那個倒楣蛋的牙齒看,或者去數數左邊那位仁兄到底用幾根手指握住杯子,你就會發現矽谷那群天才們依然沒能把人類的生理結構搞明白。這種在微觀細節上的崩潰,配上宏觀構圖的驚艷,構成了目前生成式 AI 最荒謬的斷層。

技術細節上的「進步」往往伴隨著某種代價。這次大家都在盯著 ChatGPT 影像能力的噪點梯度(noise gradient)看,這玩意兒就像是數位影像的底噪,處理不好就會讓暗部看起來像是一堆會跳動的螞蟻。OpenAI 似乎在嘗試用某種更激進的平滑算法來覆蓋這些瑕疵,但這種做法很容易導致質感的喪失。就像是給照片磨皮磨過了頭,連毛孔都消失了。至於那種揮之不去的黃色色調(yellow tint),其實是模型在處理光影連續性時的偷懶表現,透過整體的色偏來強行達成視覺上的統一感。這並不是什麼高級的藝術處理,更像是為了掩蓋不同圖層合併時色彩不匹配的拙劣遮羞布。

當我們把目光轉向四大平台的競爭格局時,這種對影像精度的處理邏輯就顯得很有趣。Claude 在處理複雜邏輯提示詞時的死板,反而讓它在某些需要高準確度的示意圖生成中顯得相對老實。相比之下,Gemini 的影像生成邏輯更傾向於一種過度的「政治正確式平衡」,它在光影上的渲染雖然細膩,卻經常在理解用戶的核心意圖上繞圈子。而 Grok 則是另一個極端,它在影像生成的邊界上不斷試探,雖然敢於挑戰一些禁忌場景,但在細節的紮實程度上,依然沒能擺脫那種廉價的塑膠感。相較於 DeepSeek,OpenAI 在影像一致性的處理上顯然投入了更多在語義對齊的計算資源。而當我們觀察 Qwen 的發展路徑時,會發現 OpenAI 的做法是更傾向於在閉源環境下不斷堆疊參數來解決多輪對話的記憶問題。

一個讓人哭笑不得的現實是,這種技術最先落地的場景,竟然可能是街邊那些 kebab 店的招牌,或者 Tinder 上的虛假人生。當技術還沒法精確到牙齒結構時,它卻已經足夠用來騙過那些在大螢幕上快速滑動的拇指。這就是目前的技術窘境:大模型已經學會了如何模擬一場熱鬧的派對氣氛,卻還沒學會數數。這不只是算力的問題,更像是底層邏輯對於「真實」的定義出現了偏差。開發者們似乎認為,只要氛圍對了,少一根手指或者多兩顆牙齒,似乎並不是什麼大不了的事情。

問題在於,如果我們追求的影像生成最終淪為一種「遠看一朵花,近看全是渣」的視覺快餐,那麼這種所謂的一致性到底還有多少價值?當我們在討論 multi-turn image consistency 時,我們是在期待一個能理解世界物理規律的造物主,還是一個只是記住了前一秒畫了什麼的拙劣臨摹者?如果連一張派對合照的細節都處理得如此草率,我們真的能指望這些模型在更嚴肅的工業設計或醫療影像領域發揮作用嗎?或者說,我們其實已經習慣了這種充滿瑕疵的虛假,甚至準備好要在未來的數位世界裡,與那些長著三根手指的人共度餘生?

資料來源:ChatGPT Images 2.5