xAI 最近在 Hacker News 上意外掀起了一波「非典型基準測試」熱潮。事情起因於有人拋出了一個極其刁鑽的視覺邏輯指令:用 SVG 代碼生成一隻長著「哈布斯堡下巴」的青蛙。這個要求看似荒誕,實則精確地刺向了底層模型的跨模態理解極限。
Grok-2 在處理這種具備歷史隱喻、生物結構與代碼生成三合一的任務時,展現出一種令人不安的幽默感。它沒有像 Gemini 那樣陷入道德審查的泥淖,反覆確認是否涉及外貌歧視;也沒有像 GPT-4o 偶爾會給出一個結構崩壞的圓形堆疊。Grok 畫出了那個標誌性的、厚重且突出的畸形下顎,甚至在 SVG 路徑中精準捕捉到了那種貴族的頹廢神韻。
當我們還在爭論 DeepSeek-V4-Flash 的推理效率時,xAI 正在用這種充滿「馬斯克式惡趣味」的方式重新定義什麼叫通用理解。這不單是代碼生成的準確度問題,而是模型是否真正理解了「哈布斯堡」這個詞背後隱藏的視覺特徵。
目前的觀察是,Grok 在長文本推理與冷門知識的視覺化轉譯上,節奏感明顯優於 Claude 3.5 Sonnet。這種能力在處理複雜的工業製圖或特定風格的代碼佈局時,可能比單純跑分更有實質意義。至於那隻青蛙到底像不像查理二世,或許已經不重要了。