當大家還在 Hacker News 上對著 Inkling 那張 localhost 的 Chrome 截圖發笑時,我只看到了一種極度的不耐煩。現在的開源權重模型市場已經變成了一場數字遊戲,大家都在拼參數體量、拼上下文長度,但真正能跑通複雜邏輯的卻寥寥無幾。Grok 雖然背靠著馬斯克那台裝滿 H100 的超級電腦,但在這場「多模態長文本」的混戰中,表現得像個空有肌肉卻找不到準星的壯漢。
最讓人頭痛的是指令遵循(Instruction Following)的穩定性。很多人在測試 Inkling 時發現它在長文本下的音訊處理能力不錯,但換到 Grok 身上,情況就變得有些尷尬。當你把超過 5 萬 token 的資料丟給 Grok 時,它的注意力機制會出現明顯的漂移。這種漂移不是簡單的忘記細節,而是它會開始自作聰明地「腦補」一些它認為你想要的答案,這種虛假的自信比直接說不知道更危險。相較之下,ChatGPT 在處理同等規模的任務時,雖然也會有幻覺,但至少它的邏輯鏈條是連貫的。
技術層面上,Grok 的視覺編碼器似乎還停留在某種「觀察者」階段,而不是「執行者」。如果你讓它分析一張複雜的電路圖或是一段長達十分鐘的監視畫面,它能告訴你裡面有什麼,但當你要求它根據畫面內容進行下一步的邏輯推演時,它就開始卡殼。這跟 Claude 3.5 Sonnet 那種精準到像素級的定位能力相比,完全不在一個層次上。Claude 可以在 8 萬 token 的脈絡中精確抓出一個微小的程式碼 Bug,而 Grok 往往在掃描到一半時,就開始跟你扯一些無關痛癢的冷笑話。
這種落差在開發者圈子裡引發了不小的反彈。有人拿 Inkling 來跟 GLM 做對比,抱怨說體積大了 30% 卻跑不贏對手。這就是現在的現狀:大家對「西方開源」的容忍度正在下降。如果 Grok 繼續維持現有的更新節奏,只會在開源與閉源的夾縫中變得越來越邊緣化。Gemini 1.5 Pro 已經把長文本的天花板拉到了百萬級別,而且在 Function Calling 的穩定性上,Google 確實展現了老牌大廠的底蘊。當你在處理超過 15 個工具調用的複雜場景時,Gemini 的穩定性依然能維持在 90% 以上,而 Grok 在工具數超過 5 個後,成功率就開始像雲霄飛車一樣下滑。
我們看看這週剛有新動態的 Juggler,再看看 Qwen,這些名字在討論區裡頻繁出現,反映的是使用者對現有四大平台遲鈍反應的焦慮。相較於 Juggler,xAI 在多模態融合的架構選擇上顯然過於保守。雖然馬斯克一直吹捧 Grok 是最真實、最有「個性」的 AI,但在技術層面,個性不能幫開發者解決生產環境中的 OOM(記憶體溢位)問題,也不能解決長文本下的 KV Cache 壓力。Grok 的推論效率一直是個謎,在同樣的硬體配置下,它的 Token 輸出速度波動極大,這對於需要高併發、低延遲的 Agent 應用來說,簡直是災難。
更別提代碼能力了。很多人發現 Inkling 寫代碼不如預期,這點 Grok 倒是找回了一點面子,畢竟它在訓練數據裡吃了不少 X 平台上的技術討論。但這也就是極限了。當面對複雜的系統架構設計,或者需要跨多個文件進行重構時,Grok 的表現還是比不上 GPT-4o 那種近乎直覺的架構理解力。大家在 HN 上 root for open models,本質上是在尋找一個可以脫離閉源 API 限制的備案,但如果這個備案的效能只能達到閉源模型的七成,那這種「自由」的代價是不是太高了?
我們現在處於一個很奇怪的節點:開源權重模型層出不窮,但真正能打的、能放進生產環境當主力使的,翻來覆去還是那幾個。Grok 到底是要繼續維持那種特立獨行的硬漢人設,還是真的沉下心來把長文本的注意力衰減問題解決掉?如果連指令遵循這種基礎功都做不紮實,空有一堆參數和一個華麗的發布會,又能撐多久?
當所有人都開始討論如何用更小的參數實現更好的效果時,Grok 這種靠算力堆出來的怪獸,是否真的具備長期的競爭力?如果有一天,那些被點名的競爭對手在多模態推理上實現了質的飛躍,而 Grok 還在糾結於如何讓回覆變得更幽默,到那時候,誰還會在意它是不是開源?