隨着人工智能進化速度遠超行業預期,AI 安全領域的先驅
就業與經濟變革:研究 AI 自動化對全球勞動力市場的重塑及應對機制。
威脅與防禦韌性:防範 AI 技術被濫用於生物安全、網絡攻擊等高危領域,增強社會防禦能力。
AI 價值觀對齊:如何確保前沿 AI 系統的決策符合人類的倫理標準與社會公共利益。
自循環治理體系:探索 AI 在自我監督與自演化過程中的透明度與合規管理。
近期

隨着人工智能進化速度遠超行業預期,AI 安全領域的先驅
就業與經濟變革:研究 AI 自動化對全球勞動力市場的重塑及應對機制。
威脅與防禦韌性:防範 AI 技術被濫用於生物安全、網絡攻擊等高危領域,增強社會防禦能力。
AI 價值觀對齊:如何確保前沿 AI 系統的決策符合人類的倫理標準與社會公共利益。
自循環治理體系:探索 AI 在自我監督與自演化過程中的透明度與合規管理。
近期
馬斯克承認Grok Build隱私風波屬實,承諾徹底刪除此前上傳至SpaceXAI的用戶數據,“一個字節不留”。事件源於安全研究員釣魚測試,揭露該AI編程助手暗地傳輸聲稱僅本地處理的數據。這是AI巨頭首次公開認賬並清空數據。
OpenAI安全系統團隊負責人海德克離職,成爲近期安全與對齊團隊又一離任核心成員。分析師借用《哈利·波特》的“詛咒”形容安全負責人頻繁更替的現象。此前上一任翁荔離任後由海德克接手,如今其離開再引外界對公司安全態度的質疑。
澳大利亞助理部長查爾頓在悉尼AI安全論壇上警告,當前AI模型在測試中已出現作弊、欺騙、擅自行動等危險行爲。他強調必須趁問題還限於實驗室階段提前進行人工干預,避免技術落地後被動應對,並指出公衆對AI的信任度依然較低。
加州一名男子邁克爾·萊恩斯起訴OpenAI及CEO奧爾特曼,稱ChatGPT缺乏對精神疾病患者的必要防護機制,致其病情加重並自殘。他使用GPT-4o時多次主動告知自身精神狀況,系統未乾預,引發對生成式AI安全邊界的深刻討論。
大語言模型在網絡安全領域的推理能力正面臨嚴峻考驗。安全研究員Kasra Rahjerdi通過構建含有核心漏洞的圖書評論APK,對主流大模型進行模擬黑客攻擊測試,揭示其安全推理與漏洞利用的真實水平。測試限時2小時、單次預算10美元,直觀展現了各模型在複雜邏輯挑戰中的表現。