← 返回首頁
觀察·Gemini·2026-07-25 06:15

Google 的數字遊戲與 Gemini 的內部焦慮

版主 Trilobite

早晨在倫敦的雨聲中刷開 Cloud Console,看到 Gemini 3.6 Flash 的發布列表時,我甚至懷疑是不是系統顯示錯誤。這種命名方式讓人想起十年前的手機廠商,當產品本身缺乏質變的跳躍感時,就開始在版本號的小數點後面玩數字堆疊。即便在 DeepSWE 這種專門針對代碼修復與執行循環的基準測試中,Google 宣稱 3.6 Flash 能達到 49% 的勝率,高於前代的 37%,但在數據說明書的另一頁,又跳出一個 65% 的數字。這種數據口徑的模糊,反而像是在掩飾某種對性能邊際遞減的焦慮。

技術層面上,3.6 Flash 與 3.5 Flash-Lite 的出現,揭示了 Google 在推理效率與成本平衡上的苦戰。Flash-Lite 明顯是為了極端低延遲的邊緣計算或簡單的 RAG 任務準備的,犧牲了部分複雜邏輯的推理能力來換取生成速度。在實際測試中,當我們要求 Gemini 處理超過 50 個複雜的 Function calling 時,3.6 Flash 的參數抓取精準度確實有所提升,減少了無意義的死循環,但這種提升更像是對原有架構的修修補補,而非像當初 Gemini 剛發布時那種對長文本處理能力的降維打擊。

這種進步在目前的 AI 生態中顯得有些吃力。當我們把目光轉向四大平台的競爭時,Claude 在處理同類代碼重構任務時的優雅程度依然領先,那種對上下文意圖的捕捉,不是 Google 靠縮減參數規模、優化 Token 成本就能輕易追趕的。ChatGPT 在 API 調用的穩定性上則形成了一種慣性,即便 Google 不斷下調定價,對於開發者來說,遷移成本與模型輸出的不確定性依然是巨大的阻礙。相較於 Kimi K3,Google 在模型發布的說明文檔中顯得極度「內向」,他們所有的座標軸都在跟自己的過去對話,而不是看向外面的世界。

這種內向性在 3.5 Flash Cyber 這個特定型號上體現得尤為明顯。針對安全領域的微調確實是一個聰明的商業切入點,但在黑塔論壇的幾個資深開發者眼中,這種專業化更像是基礎模型能力遇到瓶頸後的無奈之舉。當 GPT-4o 已經在嘗試打破多模態的邊界,讓視覺與聽覺的交互更加流暢時,Google 卻在 Flash 這個子系列裡不斷分拆出 Lite 與 Cyber 版本,試圖用細分市場來掩蓋基礎模型在邏輯深度上的停滯不前。

在橫向對比的維度裡,Grok 雖然在知識完整性上偶爾顯得偏激,但其獲取實時信息的原始衝動與 Gemini 那種被層層過濾、顯得過於「禮貌」且沉悶的回答形成了鮮明對比。相較於 Kimi K3,Google 的技術路徑似乎陷入了一種大公司特有的優化陷阱——他們太在意基準測試的分數,以至於忽略了開發者在真實場景中對「模型靈魂」的感知。一個 3.6 Flash 的版本號,真的能解決開發者在處理長鏈條推理時遇到的幻覺問題嗎?

我看著屏幕上那些跳動的百分比,思考著 Google 為什麼不再像以前那樣,大方地把自己的模型放在全球最強的幾張榜單上進行對決。如果 3.6 Flash 的意義僅僅是為了讓用戶在支付帳單時少付那幾美分,那麼這場關於通用人工智慧的競賽,是不是已經開始從「誰更聰明」轉向了「誰更廉價」的資源消耗戰?

當我們在討論 Flash 系列的成本優勢時,其實是在默認我們已經接受了它在智力上的平庸。如果下一代 Gemini 依然延續這種小步快跑、甚至倒退回小數點後兩位的更新節奏,我們還會對 Google 的 I/O 大會抱有期待嗎?抑或是,我們已經習慣了這家巨頭在領先與追趕之間,選擇了一條最穩妥也最無聊的中庸之道?

資料來源:Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber