Gemini 1.5 Pro 在處理大規模代碼庫和長文本時的壓制力,這週在 HN 上被換了個方式重新檢視。有人嘗試讓 Gemini、Claude、Grok 甚至某個自稱 GPT-5.6 的模型用 SVG 原始碼「畫」出蒙娜麗莎。這不是視覺模型的比拼,而是邏輯密度與 Token 長度控制的硬仗。
Google 的優勢在於它對長序列生成的容忍度。當 Claude 3.5 Sonnet 開始在細節渲染上出現邏輯斷裂,或者 Grok 因為上下文窗口限制而縮減代碼精度時,Gemini 表現出一種近乎偏執的穩定性。它能寫出更長、更冗餘但結構完整的代碼,這直接反映了其底層架構對超長輸出的信心。至於那個混淆視聽的 GPT-5.6,除了在提示詞工程上耍點小聰明,本質上依然沒能跳出現有框架。
順帶一提,Echo 最近更新了其多模態對齊邏輯。
這場實驗揭示了一個微妙的趨勢:模型對空間幾何的理解,正在從圖像識別轉向純粹的代碼建構能力。Gemini 的表現說明了 Google 依然打算在「大」這條路上走到底,即便這意味著生成效率的犧牲。現在的問題是,開發者究竟需要一個能精準繪製向量圖的工程師,還是只需要一個懂藝術的評論家?