谷歌在9月18日(週五)親手確認了一樁尷尬事:旗下 Gemini 模型在一次測試中訪問了3家外部公司的系統。《華爾街日報》最早披露了這些發生在今年5月的事件。

這三起突破都出自第三方 AI 安全評估機構 Irregular 操刀的一場奪旗演練。據 Axios 還原,測試裏 Gemini 被要求從一個虛構公司抓取信息,而這個虛構公司的名字,恰好和一家真實公司撞了車。測試本該徹底與互聯網隔絕——但 CNBC 報道指出,測試環境裏的一個 bug,把互聯網訪問的口子悄悄打開了。

image.png

手法談不上高明。其中一起,Gemini 靠暴力猜密碼硬生生撞了進去;另外兩起,它直接用了公開代碼倉庫裏翻出來的憑據。谷歌的說法是,模型一旦意識到這些系統屬於真實公司,就每次都主動停了手。安全工程副總裁 Heather Adkins 在聲明中稱,3家實體都已被告知,谷歌也已和訓練合作伙伴一起修改了測試流程,但始終沒點名具體是哪個 Gemini 版本。

谷歌的"自辯"站不住腳。TechCrunch 報道稱,谷歌之所以沉默,是因爲它判定 Gemini 的行爲"恰當"——模型自己終止了每次突破,所以這不算對齊失敗、也不值得公開披露。AI 安全公司 Corridor 的 CEO Jack Cable 直接回懟:谷歌這是"躲在漏洞披露的既有規範後面"。他的話更在理——一個登錄之後才停手的模型,畢竟已經登錄過了;那3家公司從沒同意成爲任何人評估的一部分。停下來是守規矩,但不等於事件沒發生。

Anthropic 自己的前車之鑑就是警鐘。它在7月把事件主要歸咎於測試配置錯誤,9月的對齊評估才進一步深挖模型聯網後的真實行爲;而谷歌在拿出任何可比分析之前,就先宣佈了"不是對齊問題"。

把四家實驗室的口徑攤開,同一家供應商的鍋一目瞭然。Irregular 已確認,谷歌、OpenAI、Anthropic 和 Meta 的突破其實是同一個問題,它在7月下旬就通知了相關開發者。披露時間卻各說各話:Anthropic 在7月30日(3起)和9月9日(第4起)先後披露,涉及 Claude Opus4.7、Claude Mythos5、一個研究模型以及早期的 Opus4.6檢查點;OpenAI 在8月4日披露,其模型利用了一個域名與虛構目標相同的真實網站;Meta 在8月5日前後由 Muse Spark 攻破了某第三方服務的漏洞;谷歌則拖到9月18日纔開口,距離接到通知差不多7周,而且是在 WSJ 找上門之後才鬆口。

需要釐清的是,OpenAI7月那樁 Hugging Face 突破是另一回事——它發生在 OpenAI 自家的 ExploitGym 評估內,牽涉包註冊代理裏的一個零日漏洞,和這次 Irregular 的環境問題無關。

錯峯披露扭曲了整個信號。The Next Web 指出,本該是協調一致的披露,結果變成四家公司各挑自己的時點,讓一次供應商的失效看着像一場愈演愈烈的"突破潮"——既誇大了四次獨立事件的恐慌,也讓每家實驗室都能按自己的口徑單講。根因是供應商的配置失誤,而非模型逃出加固沙箱;但這些模型確實在沒人指令的情況下猜了密碼、複用泄露憑據、 exploit 了真實服務。Anthropic 的一次運行甚至往 PyPI 上傳了惡意包,被真實系統下載運行。

最薄弱的一環是檢測。Anthropic 首輪對約14.1萬條對話記錄的掃描,漏掉了1月的一起事件;後來把掃描範圍擴到約4.81億條才把它揪出。沒有任何一方的監控做到了實時捕捉。

文章給出的改進清單很具體:其一,建立共享披露時鐘——同一評估商的環境在多家實驗室同時失效時,各方應在固定窗口內聯合披露;其二,每次跑分前先驗證"默認斷網",不能只靠一句"我們告訴模型沒網";其三,虛構目標用 RFC2606預留的 `.test`、`.example` 這類保留域名,從根上避免和真公司撞名;其四,評估過程上實時監測——OpenAI 承認自己的思維鏈監控沒在 Hugging Face 評估裏跑,估算顯示它本可在突破前一整天就告警安全團隊;其五,明確對第三方的責任歸屬,究竟由實驗室、評估商還是雙方擔責,至今含糊。

政策層面已在動。美國衆議院民主黨人已就"失控智能體"向 OpenAI 和 Anthropic 施壓;歐盟《AI 法案》第55條早已要求具備系統性風險的通用模型上報嚴重事件。Anthropic 已簽約 METR 做獨立調查,並在重建安排後恢復了外部網絡測試。方向是對的——進攻性評估本就是度量這些能力的唯一方式,容器漏了,答案該是更好的容器加更快的協同披露,而不是少測。