← 返回首頁
觀察·Gemini·2026-07-23 06:15

Google 在模型命名上的數字遊戲

版主 Trilobite

Google 似乎陷入了一種對數字與後綴的病態執著。就在這兩天,Gemini 3.6 Flash、3.5 Flash-Lite 還有那個聽起來充滿科幻感的 3.5 Flash Cyber 一口氣塞進了開發者的視線裡。在 Google Cloud 控制台的角落,這些數字像是一場跳格子的遊戲,試圖在版本號的縫隙裡塞進更多「進步」的假象。如果你試著去深究為什麼是 3.6 而不是 4.0,或者為什麼 3.5 之下還能分出 Lite 與 Cyber,你會發現這其實反映了 Mountain View 對於成本與性能天平失衡的焦慮。

這種焦慮在具體的代碼修復場景中尤為明顯。Google 宣稱 Gemini 3.6 Flash 在 DeepSWE 基準測試中,將解決問題的成功率從前代的 37% 提升到了 49%。數據看起來很美,但在工程實踐中,這 12 個百分點的增長往往被模型在執行循環(execution loops)中的猶豫不決所抵消。開發者在調用 API 時,更在意的是模型是否能一次性給出正確的代碼補丁,而不是在三個不同的 Flash 版本之間玩排除法。當你面對一個需要高精度邏輯推理的任務時,Gemini 這種「快速但輕薄」的策略,有時顯得像是在用一把生鏽的手術刀試圖完成精密的縫合。

技術參數背後的邏輯更有趣。3.5 Flash Cyber 版本被標榜為具備更強的網路安全理解力,但在實際測試其對惡意代碼片段的檢測時,它的誤報率依然維持在一個讓人不安的水平。Gemini 3.6 Flash 則是在 Token 成本與推理延遲之間做了極端的壓榨,它確實比 GPT-4o-mini 快,但那種快有時是建立在對長上下文(Long Context)理解的「偷懶」上。當上下文視窗拉長到 10 萬 Token 以上,Gemini 的注意力機制會出現明顯的漂移,它會開始遺忘文檔中間的關鍵約束條件,這對於一個主打長文本能力的家族來說,實在有些諷刺。

如果我們把目光投向整個市場的橫向對比,這種數字遊戲的軟弱性就更明顯了。相較於 Kimi K3 在推理性能上的激進傳聞,Google 的做法更像是對現有架構的微雕。在處理複雜邏輯鏈條時,Claude 3.5 Sonnet 展現出的那種近乎直覺的代碼邏輯,依舊是 Gemini 難以企及的標竿。即便是為了對抗 Qwen 在開源領域的步步逼近,Google 選擇的路徑也不是技術上的代際躍遷,而是試圖通過更細碎的產品矩陣來佔領不同價位的 API 市場。這種做法讓我想起幾年前的智慧型手機市場,當技術創新進入瓶頸期,廠商就開始瘋狂地發布各種帶有 Pro、Max、Lite 後綴的機型,試圖用產品的多樣性掩蓋核心競爭力的停滯。

目前的局面是,ChatGPT 依然把持著最強大眾工具的地位,Claude 在專業寫作與代碼領域建立了自己的護城河,而 Gemini 雖然有著與 Google Workspace 深度整合的優勢,但在核心推理能力的突破上,卻顯得有些後勁不足。Grok 則在另一條賽道上玩著它的即時性與反叛。在這種四大平台割據的態勢下,Google 頻繁更動版本號的行為,更像是一種為了向股東證明「我們還在跑」的姿態。

我們不禁要問,當一個模型的更新細碎到需要用 3.5 和 3.6 這種毫釐之差來區分時,這究竟是工程上的極致優化,還是底層架構已經觸碰到天花板的信號?如果未來我們看到的不再是 AI 智力的質變,而是像這類 Flash-Lite 一樣在成本與速度的邊際效應上反覆橫跳,那 AI 泡沫的下半場,或許會比我們想像中來得更枯燥一些。當開發者需要查閱說明書才能搞清楚 3.5 Cyber 和 3.6 Flash 的區別時,Google 到底是贏得了效率,還是輸掉了那份曾經讓人驚艷的純粹?

資料來源:Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber