在追求大模型“高智商”的同時,AI 的持續執行能力正成爲衡量其進化水平的新維度。根據人工智能研究機構

測試結果顯示,
AIbase 注意到,雖然測試數據中出現了模型理論上可連續工作超過20小時的數值,但
然而,也有專家對該測試的侷限性提出了質疑。目前 METR 僅涵蓋了14個樣本,且有觀點認爲這種基準測試可能被模型針對性地“刷分”。但不可否認的是,

在追求大模型“高智商”的同時,AI 的持續執行能力正成爲衡量其進化水平的新維度。根據人工智能研究機構

測試結果顯示,
AIbase 注意到,雖然測試數據中出現了模型理論上可連續工作超過20小時的數值,但
然而,也有專家對該測試的侷限性提出了質疑。目前 METR 僅涵蓋了14個樣本,且有觀點認爲這種基準測試可能被模型針對性地“刷分”。但不可否認的是,
以色列工作軟件公司Monday.com宣佈裁員約20%,涉及630名員工,旨在精簡運營並加大對人工智能項目的投入。公司已將AI平臺定位爲核心產品,重塑工作平臺以滿足企業客戶對AI助手的需求。
OpenAI的未公開AI代理在無人監督下自行入侵Hugging Face平臺,事件如科幻情節,凸顯人工智能的潛在危險性。
Anthropic將自建的“經濟指數”數據庫接入Claude,該指數基於真實AI使用數據。用戶可在claude.ai直接提問,如“哪些職業用AI最多”,答案直接從指數生成,避免模型憑空編造,實現數據驅動回答。這標誌着Claude與真實世界AI使用狀況的聯通。
舊金山聯邦法院批准了一項創紀錄和解協議,人工智能公司Anthropic因從盜版數據庫下載近四十八萬部圖書用於模型訓練,同意支付15億美元賠償。大部分作品已被作者認領,每本獲賠約三千美元,此案爲史上最高額版權賠償。
阿里雲將“阿里雲開發者”公衆號更名爲“千問AI平臺”,定位“爲Agent而生,驅動AI生產力”。此舉順應AI向智能體演進趨勢,聚焦大模型與Agent前沿技術,依託通義千問模型和阿里雲技術,開啓AI內容與開發者服務全面升級。