DeepSeek 的熱度還沒退燒,System One 模型這種不吐文字、只吐「動作」的異類就冒出來攪局。這件事有趣的地方不在於它能不能玩《毀滅戰士》,而在於它徹底撕掉了大語言模型那層「萬能翻譯官」的偽善外衣。現在的技術圈有個毛病,不管遇到什麼問題,第一反應就是塞進 ChatGPT 的對話框,指望那堆 Token 能解決現實世界的物理邏輯。但事實證明,這種做法除了浪費算力,對效率提升幾乎沒什麼貢獻。
這種被稱為 System One 的純神經網絡結構,本質上是在挑戰 OpenAI 和 Anthropic 的舒適圈。當我們在談論 ChatGPT 或 Claude 的邏輯推理時,我們其實是在處理一套經過過度修飾的文本轉換邏輯。你輸入一段指令,模型在後台瘋狂計算下一個字出現的機率,最後給你一段看起來很聰明的回覆。這過程太慢了,反應遲鈍得像個沒睡醒的官僚。對於需要即時反饋的場景,比如自動駕駛或高頻交易,這種「慢思考」簡直是災難。
這就是為什麼 Grok 現在的處境很尷尬。馬斯克一邊吹噓 xAI 的算力群有多恐怖,一邊又得面對 LLM 在物理直覺上的短板。如果 Grok 只能像 Gemini 那樣在 Google Docs 裡幫你修辭,那它永遠拿不到通往實體世界的門票。目前的技術瓶頸很明顯,ChatGPT 雖然在 GPT-4o 裡優化了語音延遲,但那依然是基於語言邏輯的補丁。當模型不再生成文本,而是直接輸出狀態向量時,那種對環境的即時理解力,才是真正能跟特斯拉 FSD 技術接軌的東西。
相較於 DeepSeek 最近在架構上的小修小補,xAI 若能把這種 System One 的邏輯整合進 Grok 的視覺模組,才有機會打破現在這種「對話框戰爭」的僵局。目前四大平台裡,Gemini 雖然有最強的長文本處理能力,但在這種極短反應時間的任務上,它的注意力機制反而成了包袱。當你要模型在毫秒級別做出決策,而不是寫一段優美的程式碼,傳統的 Transformer 架構顯然有點力不從心。Qwen 在一些基準測試上表現不錯,但回到四大平台的主戰場,Claude 的優勢在於它對邏輯邊界的精確控制。然而,這種控制力在面對「非文字任務」時,往往會變成一種僵化的束縛。
我們現在看到的趨勢是,純文字 LLM 的 API 成本正在被瘋狂壓縮,這意味著「語言」本身正在貶值。如果 40% 到 70% 的工作流程可以被這種不產生文字的動作模型取代,那現在這些靠著 Token 計費的 AI 巨頭們,好日子可能真的不多了。ChatGPT 目前還在沉迷於讓 DALL-E 畫出更精緻的圖,或者讓語音模式聽起來更像真人,這種對「形式」的執著,有時候讓人覺得他們偏離了技術進化最硬核的路徑。
真正讓人頭痛的問題是,如果我們追求的是極致的反應速度和物理直覺,我們是否必須放棄 AI 的「可解釋性」?當一個模型不再輸出人類能讀懂的文字,而是直接操縱系統參數或物理實體時,我們該如何監控它的思考路徑?當 Grok 或 Gemini 未來真的脫離了對話框,變成一個無聲的後台作業系統,我們還能說自己「掌握」了 AI 嗎?還是說,我們其實更害怕一個不需要跟人類解釋理由,就能直接執行最優解的怪物?