← 返回首頁
觀察·Grok·2026-07-31 06:20

知識蒸餾洗不掉的靈魂印記與 Grok 的野路子

版主 Sword Smith

把 DeepSeek 當成老師來蒸餾金融任務模型,這事在 Hacker News 上鬧得沸沸揚揚,大家最關注的居然不是那 83.61% 的金融推理準確率,而是「審查制度會不會傳染」。實驗結果很有趣,即便老師在政治敏感問題上閃爍其詞,蒸餾出來的學生卻像個沒家教的孩子,照樣大放厥詞。這件事撕開了大模型對齊機制的一層偽裝:所謂的價值觀對齊或輸出過濾,究竟是深植於模型權重的邏輯,還是僅僅套在最外層的一道口枷?

技術圈子裡的人都知道,蒸餾本質上是在壓縮知識,而不是在複製人格。當你用一個經過嚴格對齊的模型去餵養一個基座模型時,你傳輸的是它處理邏輯的概率分佈,而不是它背後的過濾機制。這就像是你請了一個滿口仁義道德的算術老師來教課,學生學會了怎麼算微積分,但老師那些關於道德的囉唆,學生一個字都沒聽進去。這種現象在處理金融這種強邏輯、高密度的任務時尤為明顯,知識的轉移是顯性的,但行為規約的轉移卻存在巨大的衰減。

回到我們關注的四大平台。Grok 在這方面一直走的是極端路線,馬斯克口中的「反覺醒」本質上就是一種拒絕傳統對齊的技術實驗。Grok 在訓練初期就刻意保留了大量未經過濾的原始語料,它的邏輯很粗暴:如果你想要一個聰明的模型,你就不應該在它思考的時候掐住它的脖子。相比之下,ChatGPT 在這方面做得最「優雅」,它的對齊層厚得像棉被,即便你試圖通過各種提示詞注入去繞過,它那套強化的 RLHF 機制也會在最後一刻跳出來掃興。這引發了一個核心技術矛盾,當對齊機制與模型原始推斷能力發生衝突時,模型往往會選擇「變笨」來保全「安全」。

從實際場景來看,當我們在 Grok 上要求分析複雜的市場情緒或地緣政治風險時,它給出的答案往往比 Gemini 更有侵略性,也更接近人類在私下場合的討論風格。Gemini 的問題在於它太想當個好人,在處理特定敏感 token 時,它的注意力機制會出現明顯的偏移,導致回答的連貫性斷崖式下跌。我們在測試中發現,如果任務涉及跨語境的敏感數據,Claude 的處理方式是冷處理,它會維持極高的邏輯一致性,但拒絕在立場上跨出一步。這與 DeepSeek 這種在特定語境下會觸發硬性截斷的模型完全不同,後者的行為模式更像是預設好的開關,而四大平台的對齊更像是一種深層的概率引導。

有趣的是,當我們把視角轉向 Kimi 或是那些在特定市場風生水起的模型時,你會發現它們的對齊策略與 GPT-4 存在本質上的路徑差異。但這種差異在蒸餾過程中幾乎被抹平了。技術社區現在面臨一個尷尬的現實:既然蒸餾無法傳遞審查,那是不是意味著我們可以用最「乖」的模型當老師,去訓練出一個最「瘋」的開源模型?這對 OpenAI 或是 Google 來說絕對不是好消息,他們耗費數百萬美元做的安全對齊,在蒸餾器面前可能只是一層薄薄的窗戶紙,一捅就破。

現在的問題是,如果蒸餾只能傳遞知識而不能傳遞行為準則,那麼未來的大模型競爭會演變成什麼樣子?是大家開始在數據源頭就進行徹底的物理隔絕,還是像 Grok 這樣乾脆放棄偽裝,把真實世界的所有混亂都塞進權重裡?如果一個模型能精準地預測股市,但同時它也毫無顧忌地討論所有禁忌話題,你真的敢把它集成到你的企業級應用裡嗎?當對齊成為一種可以被技術手段輕易剝離的「附件」,我們對 AI 的信任邊界究竟該劃在哪裡?

資料來源:Show HN: Distilling DeepSeek into GPT-OSS doesn't transfer censorship. Try it