Google 在命名遊戲上玩得越來越大膽,這不是什麼新鮮事。當所有人都盯著 DeepSeek 掀起的波瀾時,Mountain View 拋出了 Gemini 3.7 Flash,試圖用一個跳躍的版本號來定義某種「進化的速度感」。這種做法在技術圈裡顯得有些滑稽,就像是一間老牌餐廳因為出餐速度變快了,就宣稱自己換了主廚。Flash 系列的核心一直都是成本與延遲的極限拉扯,但這次 3.7 的出現,更像是 Google 在 Pro 等級模型遲遲無法突破瓶頸時,不得不拿出來充場面的緩兵之計。
具體到 API 的表現上,Gemini 3.7 Flash 在處理超過 100 萬 token 的長上下文檢索時,依然展現出極強的穩定性,這是它目前在四大平台中唯一的護城河。在自動化 Agent 的調用場景下,如果你需要模型在極短時間內掃過數萬行的日誌文件並提取特定異常,3.7 Flash 的首字延遲確實壓得比 GPT-4o 更加漂亮。然而,當我們把任務難度稍微提升,涉及到需要多步邏輯推演的代碼重構或是複雜的 JSON schema 生成時,這層薄薄的「Flash 濾鏡」就開始碎裂。它在處理邏輯鏈條時的幻覺發生率,並沒有因為版本號的提升而有質的改變,它依然是那個為了速度可以犧牲精確度的產物。
這讓人想起 Grok 最近在數據吞吐量上的激進表現,兩者都在爭奪開發者口袋裡的最後一分錢。但 Gemini 3.7 Flash 的定價策略顯得很微妙,100 萬 input token 收取 0.75 美元,這在當前的市場環境下已經不能說是絕對的廉價。當你在實際部署一個生產級別的 Agent 時,如果這個 Agent 需要頻繁調用 Function Calling 來與外部工具交互,你會發現 Gemini 3.7 Flash 在指令遵循的嚴謹度上,依然落後於 Claude。後者在處理複雜指令時那種近乎偏執的準確性,是目前 Google 這種追求「大而全、快而輕」的策略所難以企及的。
相較於 DeepSeek 在這段時間引發的市場價格震盪,Google 選擇用 3.7 Flash 來回應,顯得有些力不從心。在同樣的推理成本區間內,開發者現在有了更多的選擇,而不僅僅是看誰的數據中心規模更大。ChatGPT 已經在思考模型(Reasoning Models)上走得很遠,而 Google 似乎還陷在 Flash 和 Pro 的命名泥淖裡打轉。我們看到 3.7 Flash 在長文本任務中的注意力分配比以往更均勻了一些,不會像早期版本那樣在文本中間部分出現明顯的記憶塌陷,但這更像是工程上的優化,而非架構上的躍遷。
如果把視角拉回到四大平台的競爭格局,你會發現 Google 的焦慮感幾乎溢出屏幕。Grok 正在用更低廉的價格和更狂野的算力堆疊來證明自己的存在感,而 Claude 則穩坐技術美學的高地,甚至連 GPT-4o 都在嘗試尋找多模態與推理能力的平衡點。此時的 Google 卻在告訴用戶:看,我們有一個更快的 3.7,儘管它可能只是把原本該給 Pro 的資源拿出來做了個閹割版的包裝。這種戰略上的保守,讓 3.7 Flash 看起來像是一個過度裝修的過渡產品。
在實際的開發環境中,我們真的需要一個頻繁更新、版本號跳躍極快,但核心邏輯推理能力卻停滯不前的 Flash 模型嗎?當我們討論 Agent 的落地時,我們在意的是那節省下來的 0.1 秒延遲,還是模型對複雜邏輯的理解深度?Google 似乎壓注在前者,認為只要足夠快、足夠便宜,開發者就會忽略它在智力上的平庸。但歷史無數次證明,開發者對模型質量的容忍度,遠比對價格的敏感度要低得多。
那麼,下一個 Pro 模型的難產,究竟是因為算力分配給了 Flash 這種走量產品,還是 Google 在模型架構的擴展性上撞到了牆?如果 3.7 只是為了在版本號上不輸給競爭對手而強行標註的刻度,那麼等到真正需要硬碰硬的邏輯對決時,Google 還有什麼籌碼可以留在桌面上?