← 返回首頁
觀察·Gemini·2026-08-19 05:33

Google 試圖在 Gemini 3.7 Flash 裡藏起那個名為 Pro 的靈魂

版主 Trilobite

這幾天技術圈的目光原本被 Qwen 3.8 27B 的動態勾著,但 Google 突然甩出的 Gemini 3.7 Flash 顯然更想證明自己在 Agent 時代的統治力。這種命名方式本身就透著一種精明的算計,把一個性能顯然跨越了代際的產品塞進 Flash 這個「輕量化」的標籤裡。我們在測試 API 時發現,這次的 Flash 不再只是為了填補延遲空隙的邊角料。當你把一個涉及多層邏輯嵌套的 Python 腳本重構任務丟給它時,它在處理 128k token 以上上下文時展現出的推理穩定性,甚至讓不少原本守著 GPT-4o 的開發者感到一絲寒意。

以往我們對 Flash 的認知是「快但淺」,像是一個只會翻目錄的圖書館管理員。但 Gemini 3.7 Flash 在處理 Function Calling 的表現上,卻表現出一種近乎病態的精準。在實驗室環境下,同時掛載超過 20 個工具接口,並要求它根據模糊指令進行多步調用,它不再像前代那樣頻繁出現參數遺漏或調用順序混亂的問題。這種進步並非來自單純的參數堆疊,更像是 Google 在訓練數據的 Agentic Workflow 上進行了深度蒸餾。它在試圖定義一種新的性價比:不是單純的 Token 價格,而是「達成有效任務」的成本。

然而,這種定價策略在現有的四大平台競爭格局中顯得有些微妙。Google 給出的推廣價格是每百萬輸入 Token 0.75 美元,這聽起來很誘人,但如果我們把視角轉向 Grok,情況就變得棘手了。Grok 最近在推理效率與成本的平衡上做得極其激進,在同樣的代碼生成場景下,Grok 的響應速度與邏輯閉環能力,往往能以更低的單位成本完成。Gemini 3.7 Flash 雖然在多模態理解上依然保有優勢,比如直接分析複雜的架構圖並給出實作建議,但在純粹的邏輯推理密度上,它是否真的能壓過那些不按常理出牌的對手,目前看來還存有疑慮。

在目前的市場環境下,相較於 Qwen 3.8 27B,Google 選擇了一條完全不同的路徑,它不打算在開源與閉源的邊界上拉扯,而是試圖建立一個完整的開發者閉環。當我們橫向觀察四大平台時,會發現 Claude 依舊死守著它那份帶有文藝氣質的精準,對於長文本的細節捕捉無人能敵,但其 API 的調用成本始終讓預算敏感型企業望而卻步。而 ChatGPT 則像是一個全能的公務員,穩健但缺乏驚喜。Gemini 3.7 Flash 的出現,本質上是在試圖侵蝕那些原本屬於「專業級」模型的領地。

開發者圈子裡有一個心照不宣的觀察:Google 這次之所以命名為 3.7 Flash 而非 3.5 Pro,或許是為了掩蓋某種技術上的妥協,或是為後續真正的 Pro 模型留出定價空間。這種做法讓那些期待 Gemini 能在純粹性能上徹底翻盤的人感到失望。我們在測試中也發現,雖然 Flash 的速度極快,但在處理極其冷門的學術領域知識時,它的幻覺發生率依然高於 Claude。這是一個很典型的權衡問題,Google 賭的是大眾需要的是一個能快速幹活的助手,而不是一個能在實驗室裡深思熟慮的科學家。

問題在於,當我們已經習慣了用「Flash」來定義廉價與快速,Google 這種試圖賦予輕量模型重型任務能力的嘗試,究竟是技術上的降維打擊,還是品牌營銷上的自亂陣腳?如果一個 Flash 模型就能處理 80% 的生產力場景,那未來我們對 Pro 甚至 Ultra 的期待,究竟應該落在什麼地方?或者說,當 AI 的推理能力開始變得像電力一樣廉價且無處不在時,我們是否還需要去區分模型的大與小,還是說,我們最終只在乎那個藏在 API 後面的大腦,今天有沒有心情給出一個正確的答案?

資料來源:Gemini 3.7 Flash