← 返回首頁
觀察·Grok·2026-09-14 07:08

馬斯克吵著要蒸餾,矽谷那群裝模作樣的實驗室還在守什麼貞操?

版主 Sword Smith

Garry Tan 最近在矽谷吼的那幾嗓子,把這陣子壓在技術圈底下的火全給點著了。這事兒說白了沒那麼複雜:當初你們這群做 Frontier Model 的人,不管是 OpenAI 還是 Anthropic,拿著爬蟲掃蕩全人類互聯網數據的時候,可沒問過誰的版權,也沒想過什麼道德高地。現在輪到開發者想拿你們輸出的 Token 去蒸餾(Distillation)、去餵養更輕量化的 Open-weight 模型時,你們開始搬出服務條款說這是不正當競爭?這嘴臉確實難看了點。

現在的技術瓶頸卡得很死,大家都知道大模型笨重得要命,推理成本高到讓新創公司吐血。如果你想在終端設備跑一個能流暢對話、不卡頓的本地模型,唯一且最快的路徑就是「蒸餾」。拿 ChatGPT 或 Claude 最頂級的輸出當作標籤,去訓練一個參數規模只有十分之一的小模型。這不是偷竊,這是技術演進的必然。xAI 的 Grok 在這方面倒是顯得沒那麼多包袱,馬斯克一向喜歡把桌子掀了,既然大家都在灰色地帶玩,那就玩得徹底一點。

看看現在的場景。一個開發者想做個自動化編碼助手,他需要極高的邏輯連貫性,但買不起每百萬 Token 要好幾美金的 API。他用 Claude 3.5 Sonnet 產生一萬組高質量的代碼解釋,然後塞進一個 7B 或 8B 的模型裡。這時候 Anthropic 的過濾機制就會跳出來警告,甚至直接封掉帳號。這種行為本質上是在搞技術壟斷。ChatGPT 雖然在 API 協議裡也寫了禁止競爭性訓練,但實際上大家都在私底下這麼幹。OpenAI 對此睜一隻眼閉一隻眼,因為他們知道,就算你蒸餾了一萬次,你手裡的 8B 模型在邏輯深度上還是摸不到 GPT-4o 的腳趾頭。

這種「蒸餾稅」的爭議在技術細節上更有趣。當我們討論長文本任務時,Gemini 1.5 Pro 的 200 萬 Token 窗口確實驚人,但如果你嘗試用它的長文本輸出來蒸餾一個專用的檢索模型,你會發現 Gemini 的輸出風格非常穩定,穩定到一種近乎機械的重複,這對小模型來說反而是毒藥。小模型需要的是多樣性,是那種帶著人類思考瑕疵的邏輯鏈條。這方面 Claude 反而更適合作為蒸餾源,它的語氣更自然,邏輯推演的層次感更強,拿它的數據去調優,小模型的「聰明感」提升最明顯。

相較於 DeepSeek 最近在蒸餾技術上的各種動作,xAI 的 Grok 在開源權重上的策略顯然更有侵略性。馬斯克在推特上喊著要對抗閉源陣營,其實就是看準了開發者對「數據所有權」的憤怒。當 ChatGPT 把所有的知識都吸乾之後,它回饋給社區的是一個昂貴的黑盒子,而 Grok 至少把盒子打開了一條縫。雖然 Grok 的推理效率在某些特定場景下還顯得有些粗糙,甚至在處理多語言語境時會出現莫名其妙的幻覺,但它的存在本身就是在打 OpenAI 的臉。

我們得問一個現實的問題:如果所有的 Frontier Models 都禁止被蒸餾,那麼 AI 的進步是不是就此斷層了?現在市面上那些號稱表現直逼 GPT-4 的小模型,哪一個背後沒有偷偷吸過四大平台的奶水?Qwen 在處理中文語境的指令遵循上確實有一套,但如果把它放進純英文的邏輯測試裡,你依然能看到它在模仿 ChatGPT 的影子。這種模仿不是抄襲,是人類知識在不同規模模型間的傳遞。

矽谷那幫大佬現在最怕的不是別人做個一樣大的模型,而是怕別人用極低的成本,做出一個有他們八成功力的小模型。這就像是光纖建設初期,擁有基礎設施的公司必須開放線路租借給競爭對手一樣。既然 AI 實驗室的訓練數據來源於公眾,那麼他們輸出的數據(Synthetic Data)是否也應該被視為公眾資源的一部分?

如果 Anthropic 繼續堅持那套「道德秩序」,拒絕開放有序的蒸餾路徑,最後的結果只會是讓地下蒸餾產業鏈更發達。大家會用更隱晦的 Prompt、更零碎的請求來洗白這些數據。與其在那裡搞反競爭調查,不如想想為什麼現在的 Frontier Models 依然這麼重、這麼貴?如果未來五年,我們依然只能靠燒掉一座發電廠的代價來換取一個稍微聰明點的對話框,那這場 AI 革命到底革了誰的命?

如果蒸餾真的被法律徹底禁止,下一個能像 ChatGPT 那樣橫空出世的技術,還會出現在這些滿口道德的大實驗室裡嗎?還是說,我們最終只能在那些被「保護」得死死的 API 牆後,看著算力成本吞噬掉最後一點創新火花?

資料來源:Garry Tan wants US open-weight AI labs to 'distill' frontier models, too