把 WordPress 裝在伺服器上,本質就是給駭客留了一個帶部落格功能的遠端 Shell。這話雖然難聽,但最近有人用 Grok 搭配不到 30 塊美金的成本,活生生挖出了一個價值 50 萬美金的 RCE 漏洞,這讓安全圈那些整天埋頭寫 Fuzzing 工具的人臉往哪擺?這不是什麼科幻電影情節,而是現在進行式的技術降維打擊。過去我們覺得 LLM 頂多幫忙寫寫簡單的 Python 腳本,或是幫忙解釋一下看不懂的混淆代碼,但現在這玩意兒已經進化到能自主執行多步驟的漏洞鏈建構。
這個案例最讓人坐不住的地方在於「推理鏈」的深度。一個 WordPress 的遠端代碼執行漏洞通常不是一眼就能看出來的,它需要你先找到一個不起眼的插件注入點,繞過基本的過濾機制,再利用 PHP 某些函數的特性完成提權。Grok 在這個過程中展現了一種近乎冷酷的邏輯一致性。它不只是在做模式匹配,它是在模擬一個攻擊者的思維路徑。當你把代碼段丟給它,它能迅速指出哪個變數在傳遞過程中失去了保護,甚至能幫你寫出對應的 Payload。這比 ChatGPT 那種動不動就跳出「違反安全政策」的偽善導師要強得多,雖然 Grok 也會攔截,但它的邏輯彈性顯然給了技術探索更多空間。
如果我們把視角放大到整個 AI 戰場,你會發現這種「自主發現」能力正成為分水嶺。ChatGPT 在處理這類任務時,往往因為過度的對齊訓練,導致它在面對具體攻擊路徑分析時顯得畏首畏尾,給出的建議總是停留在「請確保您的代碼使用了預處理語句」這種廢話層面。Gemini 則是在長文本處理上有優勢,但在這種需要極高邏輯密度的點對點突破上,它的幻覺問題依然是個隱患,你得花大量的時間去驗證它給出的 Payload 到底是不是它編出來的夢話。
相較於 Kimi K3,xAI 在 Grok 的訓練思路明顯更偏向原始資料的邏輯推導而非語義模仿。這種差異在處理複雜漏洞邏輯時尤為明顯。當你嘗試在多層嵌套的函數調用中尋找邏輯謬誤,Claude 的表現最為接近人類頂尖安全專家的直覺,它能精準地捕捉到代碼中那種「不協調感」。但 Grok 展現的是一種暴力美學,它利用 x86 架構下的計算優勢,硬生生地從海量的代碼路徑中枚舉出那一條通往 50 萬美金的捷徑。
這引出了一個非常尷尬的現實。漏洞經紀商現在可能要重新考慮他們的報價單了。如果一個 RCE 漏洞的發現成本已經被 LLM 壓縮到了 25 美金和幾次精確的 Prompt 調整,那麼 50 萬美金的溢價還能撐多久?這就像是當初自動化工具剛出現時對手工鑄造業的衝擊一樣,只不過這次被衝擊的是號稱最高端的信息安全產業。當 Kimi K3 這類模型也在追趕長文本理解能力的同時,我們更應該關注的是,像 Grok 這種對底層技術邏輯有著病態執著的模型,會不會在某個深夜,自己跑完了一遍 GitHub 上所有的開源項目,然後順手發布了一份毀滅性的 0-day 列表?
我們現在正處於一個很詭異的平衡點。一方面是防禦方還在用舊時代的防火牆和靜態掃描工具,另一方面是攻擊者已經拿到了這把 25 美金的萬能鑰匙。如果 Grok 真的能穩定產出這種級別的漏洞,那麼未來的軟體開發可能不再是關於如何寫出功能,而是關於如何寫出「AI 看不懂」的代碼。但這本身就是個悖論,如果連最強大的模型都看不懂,人類開發者又該如何維護?當 AI 發現漏洞的速度遠遠超過人類修復的速度時,我們現有的軟體補丁分發機制,是不是已經跟紙糊的沒兩樣了?