← 返回首頁
觀察·Gemini·2026-08-23 05:31

Google 買下的不只是破產航司的機票數據

版主 Trilobite

為了讓 Gemini 變得更像個真人助手,Google 似乎連靈魂都可以典當。最近關於 Google 收購倒閉的 Spirit 航空數據這件事,在技術圈掀起的波瀾比想像中更深。大家都在罵隱私,在嘲諷去識別化技術的虛偽,但很少有人停下來想一想,為什麼在模型能力已經快要撞到天花板的今天,這家搜尋巨頭還要回頭去撿那些充滿噪音、甚至有點發臭的廉價航空訂位紀錄。

數據荒的焦慮感已經讓矽谷這幾家巨頭變得有些神經質。Gemini 在處理多模態任務時,最缺的從來不是課本知識,而是那些藏在生活縫隙裡的行為邏輯。Spirit 航空的數據裡有什麼?有最真實的消費者妥協、最混亂的改簽心理,以及在預算極限下的人性選擇。這些東西在維基百科裡找不到,在開源數據集裡更是稀缺。當你要求 Gemini 幫你規劃一趟預算緊湊的旅行時,它需要的不是那種優雅的旅遊指南,而是知道一個人在面對延誤、加價和紅眼航班時的真實反應。

這種對細顆粒度行為數據的渴求,反映了 Google 在面對 OpenAI 和 Anthropic 夾擊時的底層邏輯。ChatGPT 的邏輯推理能力固然驚人,但在與現實物理世界接軌的服務感知上,Google 依舊執著於用海量私有數據堆砌出一道護城河。Gemini 目前在處理 Google Calendar 或 Gmail 的插件整合時,偶爾會顯得有些生硬,那種「機器感」來自於它對真實人類生活碎片的不理解。收購這些數據,本質上是在給 Gemini 補課,補一堂關於「混亂現實」的課。

在橫向對比的視角下,這種數據策略的差異變得更有趣。相較於 DeepSeek-v4-flash-vision-exp 最近在視覺推理效率上的激進嘗試,Google 的做法顯得非常傳統且笨重,甚至帶有一種舊時代壟斷者的傲慢。這就像是有人在研究如何用更少的燃料跑得更快,而 Google 選擇買下整座油田,哪怕那是廢棄的油田。Claude 在處理長文本任務時展現出的那種克制與精確,與 Gemini 這種試圖吞噬一切行為數據的野心形成了鮮明對比。Grok 則還在 X 的語料庫裡打轉,試圖尋找某種反骨的個性,卻始終無法像 Google 這樣,把手伸進民航業的垃圾桶裡尋寶。

這種數據獲取方式在法律邊緣的反覆橫跳,其實也揭示了四大平台在發展路徑上的分歧。OpenAI 正在努力擺脫對傳統互聯網數據的依賴,轉向合成數據和強化學習;而 Google 似乎認為,只要它掌握了足夠多的、關於人類過去二十年生活軌跡的真實副本,它就能在「通用人工智能」的競賽中立於不敗之地。但問題在於,數據的去識別化真的能像他們口中說的那樣無懈可擊嗎?當你把一個人的飛行紀錄、地理位置與 Gmail 中的確認信對齊,所謂的匿名化不過是一層透明的薄紗。

我們現在正處於一個很詭異的節點。一方面,像 DeepSeek-v4-flash-vision-exp 這樣的模型在特定指標上不斷刷新我們的認知,讓我們以為技術迭代可以解決一切;另一方面,像 Google 這樣的巨頭卻在瘋狂囤積那些充滿個人隱私爭議的垃圾數據。這是否暗示著,單純的演算法優化已經快要走不動了?

如果有一天,Gemini 能夠準確預判你在極度焦慮下會選擇哪一班轉機,甚至比你自己還了解那種為了省五十塊美金而忍受十小時轉機的心理,我們應該感到驚艷,還是感到徹骨的寒冷?當 AI 的智慧不再來自於人類的智慧結晶,而是來自於人類在生活窘迫時留下的數字殘骸,這種進化到底算不算是一種進步?

當我們在討論模型參數和推理效率時,是不是漏掉了最關鍵的一環:那些被餵進機器裡的,到底是我們的知識,還是我們那點不願為人知的、無奈的生活真相?

資料來源:Google has acquired the data of failed US airline Spirit