這兩天技術圈都在盯著 Google 收購 Spirit Airlines 數據的消息。這件事在 Hacker News 上吵得不可開交,大家最在意的不是這間航空公司倒閉了,而是那些號稱「去識別化」的乘客隱私,最後會怎麼餵進 Gemini 的訓練池裡。我們習以為常的飛行紀錄、訂餐偏好,甚至是那種精確到分鐘的延誤崩潰瞬間,現在都成了某個大模型理解人類行為的養料。
Google 的胃口一向很好,好到讓人覺得它在玩一場無限收購的遊戲。當我們在討論模型架構、討論注意力機制的時候,往往忽略了最底層的邏輯:模型的能力上限,其實取決於它看過多少人類不經意留下的真實痕跡。這次收購案最核心的技術爭議在於數據的「去識別化」。在資料科學的語境下,只要數據維度夠多,重新關聯出一個人的身份只是計算成本的問題。這不是單純的姓名或身份證號,而是你的生活軌跡。當 Gemini 能夠存取數百萬人的飛行數據,它在預測用戶需求或生成情境化建議時,那種令人毛骨悚然的「精準感」就會再次進化。
從技術實現的角度來看,Gemini 的優勢一直在於它背後那個龐大的 Google 生態系統。這次的航空數據可能被用於強化 Gemini 在旅行規劃或物流調度的 Function Calling 能力。想像一下,當你問模型如何規劃一趟行程,它不再只是抓取公開的航班時刻表,而是根據歷史數據中數百萬次真實發生的延誤、改簽和退票行為,給出一個最具「韌性」的方案。這種基於封閉專有數據訓練出來的直覺,是其他僅依賴公開網路抓取數據的模型難以企及的。
這種數據壟斷的護城河,在目前的競爭格局中變得愈發明顯。相較於 DeepSeek-v4-flash-vision-exp 在視覺處理上的頻繁更新,Google 的路徑顯然更偏向於重資產的數據堆疊。即便像 DeepSeek-v4-flash-vision-exp 這樣的模型在推理效率上不斷優化,但在面對這種由實體產業崩潰後釋放出的獨家私有數據時,技術上的優化有時顯得很無力。這就像是一個練武奇才在鑽研招式,而另一個對手卻在不斷吞噬各種禁藥與秘笈。
ChatGPT 此前也曾試圖透過與媒體集團簽署授權協議來獲取高品質語料,但那大多侷限於文字內容。Google 這次對航空數據的染指,更像是跨入了一種「行為數據」的維度。Grok 雖然擁有 X 平台的即時流量,但社交媒體上的言論往往帶有表演性質,遠不如消費紀錄和旅行軌跡來得誠實。當我們在檢視這些模型的表現時,其實是在檢視它們背後數據來源的純度與廣度。
我們現在面臨一個尷尬的技術瓶頸:模型本身似乎已經遇到了邊際效應遞減,大家都在等下一個 Scaling Law 的奇蹟。於是,這些大廠開始轉向更隱蔽、更具爭議的角落去挖掘數據。如果未來所有失敗企業的數位資產都被矽谷幾大巨頭瓜分,那麼「去識別化」這個技術術語,是否只是一層用來安慰法律監管的遮羞布?當模型比你更了解你的出行習慣,甚至能預測你下一次在機場崩潰的機率時,我們還能說那是「去識別化」的集體智慧嗎?
數據是有記憶的,尤其是那些被寫進模型參數裡的記憶。當航空公司的靈魂在伺服器機房裡轉生,我們該感到技術的進步,還是該擔心自己的數位影子早已不再屬於自己?