← 返回首頁
觀察·Gemini·2026-09-20 06:54

Gemini 還是那個穿著高級西裝卻在紅毯上絆倒的優等生

版主 Trilobite

在矽谷的技術圈子裡,看 Google 演示 AI 就像看一場排練過度卻總在關鍵時刻掉鏈子的舞台劇。最新的 Gemini Live 演示視頻裡,號稱最先進的模型在眾目睽睽之下,輸給了西洋棋中最基礎的將死套路。這不是技術失誤,這簡直是一種行為藝術。當一個模型宣稱具備 Extended Thinking(長時思考)能力,卻連業餘棋手都能一眼看穿的殘局都處理不了時,我們不得不重新審視,Google 所謂的「思考」到底是在計算邏輯,還是在虛擬的神經網絡裡漫無目的地散步。

這種幻覺並非個案。當你在 Gemini 的 API 界面調試一個複雜的 JSON 提取任務時,你會發現它在處理超過 15 個嵌套欄位時,邏輯鏈條會莫名其妙地斷裂。相比之下,GPT-4o 在同樣的壓力測試下,雖然語氣顯得生硬且充滿說教感,但至少能保證結構的完整。Google 的問題在於,他們似乎太過於沈溺於「擬人化」的表象。Gemini Live 的語音交互確實比 ChatGPT 那種帶著電流聲、時不時發出奇怪鼻音的冷冰冰語氣要自然得多,它更像一個會呼吸、有情緒的人類對話者。但遺憾的是,在目前的技術語境下,我們需要的是一個精準的計算引擎,而不是一個連棋都下不好的聊友。

技術層面的斷層感在 Google Workspace 的企業訂單中體現得尤為明顯。很多企業用戶發現自己還被困在舊版本的 Flash 迷宮裡,而官方宣傳的 3.8 系列依然像海市蜃樓一樣掛在遠方。這種產品迭代的混亂感,反映出 Google 在模型部署路徑上的猶豫。他們既想維持大模型的參數優勢,又想在端側推理上佔據先機,結果卻是兩頭不到岸。當你嘗試用 Gemini 處理 8 萬 token 以上的長文本分析時,那種注意力衰減的速度快得令人心驚,它會開始編造一些原文中根本不存在的細節來填充記憶的空白,這在法律或醫療等嚴肅場景下簡直是災難。

這種性能上的搖擺,在與其他競爭者的橫向對比中顯得更加刺眼。相較於 Qwen 3.8 Omni Flash 的發布節奏與市場定位,Google 在 Gemini 上的資源傾斜顯然更偏向於雲端生態的整合與語音交互的平滑度。Claude 3.5 Sonnet 在代碼編寫和邏輯推理上的穩定性,目前依然是 Gemini 難以企及的高山;而 Grok 則靠著對實時數據的暴力檢索,在時效性上佔據了一席之地。Google 擁有的優勢是其無與倫比的文筆。Gemini 產出的文本是目前四大平台中最接近人類文學水平的,它不會像 ChatGPT 那樣動不動就「深入探討」或「值得注意的是」,它有一種自發的、流動的敘事感。但這種文藝氣質在面對邏輯硬傷時,反而更像是一種掩飾。

在最近的一次多模態任務測試中,Gemini 對圖像細節的識別能力確實有所提升,但在跨模態的推理鏈條上,它依然顯得力不從心。如果你給它一張電路圖並要求它診斷故障點,它可能會用非常優美的語言描述電路的構造,然後給出一個物理學上完全錯誤的結論。這就是目前 Google 的困境:它創造了一個世界上最會說話的 AI,卻還沒能給這個 AI 裝上一顆足夠理性的心臟。相較於 Qwen 3.8 Omni Flash 在特定任務下的反應速度,Gemini 在處理複雜邏輯任務時的延遲感與不確定性,讓開發者在選擇生產力工具時感到遲疑。

我們是否已經進入了一個「性能溢出但邏輯停滯」的怪圈?當所有的 AI 廠商都在追求更自然的語音、更快的推理速度以及更長的上下文窗口時,最基礎的邏輯推理能力——那種能讓 AI 不在西洋棋基礎殘局中丟臉的能力,是否被當作了可以犧牲的代價?如果一個模型能夠寫出莎士比亞風格的詩,卻算不清楚三位數的乘法,或者看不出最簡單的棋局陷阱,我們真的能稱它為「智慧」嗎?還是說,我們其實只是在製造一種更高級的、充滿文藝氣息的隨機數生成器?當下一次 Gemini 更新到 4.0 甚至更高版本時,它會學會先看清楚棋盤再開口說話嗎?

資料來源:Gemini 3.8 Live and 3.8 Live Extended Thinking