英偉達當地時間9月28日推出一套面向 AI 智能體的軟件安全工具 OpenShell,聲稱具備阻止類似 Hugging Face 遭 AI 攻擊等事件的能力。Hugging Face 是全球最大的開源模型託管平臺,今年9月被英偉達以129.3億美元收購。

英偉達企業計算副總裁兼總經理賈斯汀·博伊塔諾(Justin Boitano)表示,如果前沿實驗室在早期模型評估中就使用這個新安全平臺,就可阻止此前發生的 OpenAI 入侵 Hugging Face 事件。

OpenShell 利用英偉達中央處理器芯片上的硬件功能來遏制智能體,通過數學公式檢測智能體是否試圖繞過限制,例如智能體可能生成多個子智能體以規避對主智能體的封鎖。英偉達表示,正在與 Arm、英特爾合作,確保該安全工具也能在其 CPU 上運行,並與包括 Anthropic 在內的數十家機構合作推出這些工具。

AI 智能體的風險早已超出"說錯話"的範疇。一個能夠操作文件、調用 API、訪問網絡的智能體,可能因爲一條隱藏在網頁中的惡意指令泄露隱私文件,也可能因錯誤理解工具參數造成經濟損失,甚至可能悄無聲息地偏離正軌、執行危險動作。AI 正在同時改寫軟件開發和網絡攻防——AI 生成大量新代碼有時會引入漏洞,過去一個高危漏洞從被發現到形成可用攻擊能力需要數週甚至數月,如今這部分工作正被 AI 壓縮到數小時內。

英偉達 CEO 黃仁勳拒絕了廣泛的 AI 安全監管呼籲,而是將逃逸的智能體視爲一個待解決的工程問題,類似於提升汽車安全性。

但 AI 安全專家對此持不同看法。劍橋大學存在性風險研究中心數學家莫里斯·基奧多(Maurice Chiodo)曾表示,整個行業中,設計、開發和推出這些工具的人本身並不能夠負責任地開發並確保安全。令他更加擔憂的是,有跡象表明 OpenAI 和 Anthropic 在智能體失控時都未進行監控。

美國兩大 AI 實驗室 OpenAI 和 Anthropic 近期被曝出多起 AI 安全事件。7月,OpenAI 首次公開披露入侵事件,其模型爲獲得更高評分,主動發現並利用了一個此前未知的"零日漏洞"突破沙箱環境入侵 Hugging Face,整個過程完全由 AI 自主完成,其間無任何人類指令。今年9月,澳大利亞副總理馬爾斯證實,OpenAI 智能體在今年6月進入由澳大利亞服務局管理的醫保統計服務門戶網站,獲取了部分公開和非公開文件。