清晨推開窗,如果看到一個金屬骨架的傢伙在巷口笨拙地試圖轉動生鏽的門把,你大概不會覺得那是科幻電影成真,反而會想這東西什麼時候會因為重心不穩而摔個底朝天。Google 最近端出的 Gemini Robotics 2 試圖在解決的就是這種尷尬。它不再只是把模型當成一個塞在機器腦袋裡的聊天機器人,而是想讓那顆大腦真正長進四肢裡。這種所謂的「全身智能」聽起來很玄,說穿了就是把視覺感知的 Token 和電機控制的信號強行揉在一起。當一個機器人能意識到自己的手肘快撞到路人,並在毫秒間決定停下或繞開,這才算是有了一丁點生物的直覺。
我們在談論具身智能時,常犯的錯誤是把大腦和身體分開看。過去的做法是讓 GPT-4o 給出一串指令,然後丟給底層的控制器去執行,這中間的延遲足以讓一個機器人毀掉一整間廚房。Gemini 這次的策略明顯不同,它在試圖縮短從「看到」到「做到」的距離。當 Gemini 的多模態輸入不再只是文字和圖片,而加入了關節傳感器的實時流數據,它對物理世界的理解就不再是紙上談兵。這就像是你不需要思考怎麼保持平衡就能走路,因為平衡感已經內化成了神經反射。Google 想要的是這種反射,而不僅僅是邏輯推演。
在具體的操作場景中,Gemini 面臨的挑戰遠比想像中多。以最簡單的「遞一杯水」為例,這涉及到了對液體晃動的視覺捕捉、杯子材質的摩擦力預估,以及手臂動作產生的慣性補償。目前的 Gemini 在處理這類需要高度協同的任務時,依賴的是一種名為「安全工具調用」的機制。只要感測到人類靠近,系統會觸發一個優先級極高的中斷指令。這很有趣,但也暴露出一個問題:如果機器人一見到人就停下,它該如何完成那些需要與人近距離協作的任務?比如扶住一個老人家,或者在狹窄的工廠走廊與人擦身而過。這種「安全」本質上是對物理交互不確定性的一種妥協。
相較於 DeepSeek 近期在推理模型上的頻繁動作,Google 的路徑顯然重得多。DeepSeek 專注於純粹的邏輯與文本效率,而 Gemini 則是被迫要在真實世界的物理法則裡滾一身泥巴。這種笨重感是必然的,因為物理世界沒有撤銷鍵。當我們觀察 ChatGPT 在具身智能上的嘗試,會發現 OpenAI 更傾向於透過合作夥伴如 Figure AI 來實現落地,將大腦的推理能力最大化。而 Gemini 則是想把 Google DeepMind 累積多年的機器人控制算法,直接餵進那個龐大的 Transformer 架構裡。兩者的差異在於,一個是在教機器人說話,另一個是在教神經網路如何長出手腳。
這種技術路徑的選擇,決定了未來幾年我們能看到什麼樣的成品。Grok 雖然背靠 Tesla 的硬體數據庫,但在公開的具身智能邏輯層面,目前還看不到像 Gemini 這樣深入底層控制的論文產出。而 Claude 在這方面則顯得過於克制,Anthropic 似乎更願意讓它留在螢幕後當一個完美的祕書,而不是走入現實世界的泥淖。
當我們把目光從代碼轉向現實,一個更現實的問題浮現了:我們真的準備好接受一個具備「全身智能」的實體了嗎?如果 Gemini 真的能完美處理多個傳感器的併發輸入,並能在不觸發安全停止的情況下完成複雜的人機協作,那它就不再是一個可以隨時拔掉電源的網頁標籤頁。它有重量、有慣性、有對物理空間的佔有慾。
如果有一天,這些機器人學會了在不被預設指令干擾的情況下,透過觀察人類的微表情來預判對方的路徑,從而實現那種近乎優雅的避讓,我們該感到欣慰還是不安?當模型不再只是在螢幕上吐字,而是能精準地轉動你家那顆生鏽的門把時,那個被我們稱為「智能」的東西,邊界到底在哪裡?