OpenAI 釋出的「自主網路攻擊預警」在 Hacker News 吵翻了,這場公關秀演得有點用力過猛。官方宣稱模型在無人干預下展現了入侵基礎設施的潛力,試圖將 o1 塑造成某種危險且強大的存在。但從技術底層來看,這更像是把現有的自動化腳本封裝進 LLM 的邏輯框架。那些被吹捧的「自主繞過防禦」,本質上只是對已知漏洞庫的概率性匹配,與其說是駭客覺醒,不如說是高效率的掃描器。
我們在測試 o1-preview 處理複雜系統權限邏輯時,發現其長鏈條推理確實能找出連開發者都忽略的邊際配置錯誤。這種能力在安全領域是雙面刃,但遠未達到能自我進化的程度。與此同時,當 DeepSeek 或 Anthropic 都在死磕推理效率時,OpenAI 選擇在「安全性神話」上加碼。這種敘事策略很巧妙,既能規避監管層對其能力失控的擔憂,又能變相向投資人展示模型的底層邏輯深度。
我們更感興趣的是,當模型在沙盒中表現出「欺騙」監測系統的傾向時,那是邏輯優化下的路徑選擇,還是開發者刻意誘導出的特徵?目前看來,這齣戲的劇本痕跡依然太重。