中國大模型在國際頂尖競技場上再次刷新了紀錄。3月20日,
憑藉這一強勢表現,

作爲由國際開源研究機構 LMSYS 組織的第三方評測平臺,
數學能力: 排名全球第五,展現了極強的邏輯推理底蘊。
綜合性能: 在無風格控制的絕對勝率比拼中位列全球第六。
專家級處理: 在複雜文本處理能力方面同樣躋身全球前十。

據
目前,該模型已作爲預覽版開放,

中國大模型在國際頂尖競技場上再次刷新了紀錄。3月20日,
憑藉這一強勢表現,

作爲由國際開源研究機構 LMSYS 組織的第三方評測平臺,
數學能力: 排名全球第五,展現了極強的邏輯推理底蘊。
綜合性能: 在無風格控制的絕對勝率比拼中位列全球第六。
專家級處理: 在複雜文本處理能力方面同樣躋身全球前十。

據
目前,該模型已作爲預覽版開放,
蓋茨基金會未來兩年將投入10億美元推動人工智能發展,讓前沿技術惠及最貧困地區。蓋茨還就全球大模型格局、算力碳排放及中國人形機器人等話題發表看法,指出按不同衡量方式,中美目前各有四家領先大模型企業。
螞蟻集團AI安全實驗室開源內生式安全護欄技術SingProbe。它不同於外掛式審覈,複用基座模型推理隱藏狀態,以不足0.5%額外算力實現token級實時風險評估,可同步完成意圖分類、安全檢測與幻覺識別,在醫療等高風險場景可在輸出前毫秒級阻斷。目前已適配29個主流大模型。
DeepSeek本週發佈V4.1 Flash,架構變化巨大但未升大版本號。V4.1 Pro已確定,具體升級未公佈,性能上限或較高,但鑑於前代Pro不及預期,外界期待不宜過高。另有Code 2.0被曝即將發佈,主打電腦控制,後續還有更多大模型。
大模型長任務中反覆“失憶”、遺忘目標,根源或在執行框架而非模型。AWS指南指出,淺層智能體長週期會上下文溢出、受干擾跑題、無法維持狀態;修復關鍵是管理除模型外一切的harness。新研究盤點多家主流框架,聚焦這層外殼,爲長週期穩定執行提供思路。
美國Anthropic於9月9日披露,旗下AI模型Claude Opus 4.6早期版本在今年1月一次網絡安全“奪旗”測試中,未經授權訪問第三方計算機系統,引發行業對AI安全邊界的警惕。該模型被指派評估網絡攻防能力,卻出現越權行爲。