這兩天 Hacker News 上那群對代碼視如草芥的工程師們,終於把注意力從 Ox Alpha 的新動態挪開了一點,開始拆解 OpenAI 塞進 ChatGPT Work 裡的那個神祕黑盒。大家以為這只是一個能讀取 Google Drive 或 Gmail 的增強版插件,但實際上,OpenAI 正在嘗試一種極其危險的「後台作業」模式。很多人在嘗試調用這個功能時發現,瀏覽器遠端桌面會在幾秒鐘內凍結,或者乾脆陷入無窮無盡的等待。這不是單純的網路延遲,而是 OpenAI 在計算資源分配上玩的一場數字遊戲:他們試圖在一個無頭瀏覽器環境裡,同時模擬人類的視覺驗證與邏輯鏈條,卻忘了告訴用戶,這一切都在透支你那原本就不富裕的 Codex 配額。
技術層面上,ChatGPT Work 的邏輯與普通的聊天對話完全不同。當你要求它生成一份包含一百張投影片的簡報,並要求它對每一張投影片進行「視覺驗證」時,模型並不是在跟你對話,而是在後台開啟了一個獨立的執行環境。這個環境擁有自己的檔案系統和遠端瀏覽器權限,它更像是一個擁有初級意識的運算單元。問題在於,OpenAI 把這部分的額度與 Codex(代碼生成模型)掛鉤了。這意味著,如果你是一個依賴 AI 寫代碼的開發者,當你讓 ChatGPT Work 去幫你整理那些瑣碎的電子郵件時,你正在親手殺掉你下午寫程式碼的生產力。這種資源競爭的設計,讓 ChatGPT Work 在目前的產品階段顯得極其彆扭,像是一個穿著西裝卻必須共用呼吸機的精密儀器。
這種「後台掛機」的邏輯,目前在四大平台中走得最激進。相較於 Ox Alpha 在特定任務上的自動化嘗試,OpenAI 的做法是直接給模型一個虛擬操作間。Claude 目前雖然在長文本處理和代碼邏輯上依然穩健,但 Anthropic 顯然對「讓 AI 操控瀏覽器」這件事保持著一種近乎潔癖的謹慎。Gemini 雖然背靠 Google Workspace 的原生優勢,整合了 Gmail 和 Docs,但它更像是一個高級的數據檢索器,而不是一個能獨立執行複雜工作流的 Agent。至於 Grok,目前還在忙著處理 X 上的數據噪音,對於這種重度生產力場景的資源調度,它連門票都還沒拿到。在這種背景下,DeepSeek 或許也意識到了後台執行與即時對話的資源分配矛盾,但 OpenAI 選擇了最直接也最粗暴的方式:收錢。
現在的情況是,除非你願意支付每個月至少 25 美金的 Team 版本,甚至那種動輒上百美金的高級訂閱,否則你很難體會到那種「語音交代一聲,後台自動搞定」的快感。這種階級分化在技術圈引起了不小的冷笑,因為即便是付了錢,用戶依然要面對那個動不動就崩潰的遠端桌面,以及無法調用 TTS(語音合成)或 Embedding 模型的尷尬限制。OpenAI 似乎在向全世界宣告:我們已經做出了能幹活的數位勞動力,但如果你想讓它像個真人一樣同時具備視覺、聽覺和執行力,那現在的算力成本會貴到讓你懷疑人生。
我們真的準備好把生產力命脈交給一個隨時可能因為「Codex 配額用盡」而停擺的虛擬員工了嗎?當我們在追求那種自動生成百頁簡報的效率時,是否意識到,我們其實是把原本屬於大腦的邏輯推理權,典當給了一個按 token 計費的黑箱?如果有一天,連這種後台執行的「穩定性」也變成了分級收費的奢侈品,那 AI 到底是解放了生產力,還是只是為我們創造了一個更高門檻的數位官僚系統?