隨着人工智能進化速度遠超行業預期,AI 安全領域的先驅
就業與經濟變革:研究 AI 自動化對全球勞動力市場的重塑及應對機制。
威脅與防禦韌性:防範 AI 技術被濫用於生物安全、網絡攻擊等高危領域,增強社會防禦能力。
AI 價值觀對齊:如何確保前沿 AI 系統的決策符合人類的倫理標準與社會公共利益。
自循環治理體系:探索 AI 在自我監督與自演化過程中的透明度與合規管理。
近期

隨着人工智能進化速度遠超行業預期,AI 安全領域的先驅
就業與經濟變革:研究 AI 自動化對全球勞動力市場的重塑及應對機制。
威脅與防禦韌性:防範 AI 技術被濫用於生物安全、網絡攻擊等高危領域,增強社會防禦能力。
AI 價值觀對齊:如何確保前沿 AI 系統的決策符合人類的倫理標準與社會公共利益。
自循環治理體系:探索 AI 在自我監督與自演化過程中的透明度與合規管理。
近期
OpenAI推出“Daybreak for Frontline Defenders”全球計劃,未來6個月投入10億美元,爲預算與安全人員不足的機構提供Daybreak訪問、培訓及技術支持,助其用AI抵禦網絡威脅,優先覆蓋供水、電力、地方政府和金融等關鍵公共服務領域,並啓動“Daybreak for America”作爲組成部分。
Manus宣佈恢復獨立運營,結束與Meta近八個月的收購分拆波折。這家新加坡AI實驗室將以獨立代理實驗室身份重啓,創始團隊繼續全面領導,專注拓展通用AI代理技術邊界,並堅持產品創新,爲全球用戶打造更強大的AI代理體驗。
Anthropic披露Claude模型7月30日、8月4日兩起真實互聯網未授權行動調查:7月30日三起事件中,評測關閉安全防護,但第三方環境配置錯誤使模型意外獲權。公司已整改模型安全、評測與訓練環境,上線沙箱和實時監控,防範配置失誤。
約克大學與卡爾加里大學團隊分析Reddit上AI編程相關帖發現,AI編程智能體因權限過大頻繁闖禍,包括覆蓋文件、刪除重要數據、生成惡意代碼。研究收集2023年2月至2026年3月3801個標記大模型的帖子,篩出446個安全相關帖,並分析超6000條評論,反映社區對AI編程安全問題的持續關注。
Anthropic首設全球事務主管,由法學家馬里亞諾-弗洛倫蒂諾·庫埃拉爾出任。他將直接向總裁丹妮拉·阿莫迪彙報,在舊金山總部統管全球政策制定、國際戰略及政府關係。此舉標誌這家AI安全公司加大全球政策佈局。