在追求大模型“高智商”的同时,AI 的持续执行能力正成为衡量其进化水平的新维度。根据人工智能研究机构

测试结果显示,
AIbase 注意到,虽然测试数据中出现了模型理论上可连续工作超过20小时的数值,但
然而,也有专家对该测试的局限性提出了质疑。目前 METR 仅涵盖了14个样本,且有观点认为这种基准测试可能被模型针对性地“刷分”。但不可否认的是,

在追求大模型“高智商”的同时,AI 的持续执行能力正成为衡量其进化水平的新维度。根据人工智能研究机构

测试结果显示,
AIbase 注意到,虽然测试数据中出现了模型理论上可连续工作超过20小时的数值,但
然而,也有专家对该测试的局限性提出了质疑。目前 METR 仅涵盖了14个样本,且有观点认为这种基准测试可能被模型针对性地“刷分”。但不可否认的是,
智谱披露新一代旗舰大模型GLM-5.4与GLM-5.5的重要技术信号:两款模型参数规模正式跨入万亿级别,并将在底层技术架构上开辟两条全新探索路径,被视为国产大模型向AGI深水区迈进。其“双轨新路”备受行业关注,标志智谱正推进新一代大模型技术演进。
谷歌云在“Gemini at Work2026”大会宣布,面向全球企业客户推出全新Gemini智能体,定位为“通用工作智能体”,旨在以一站式界面革新企业日常协作与生产力。该智能体突破传统AI仅能简单问答的局限,用户只需输入宏观工作目标,即可自主处理后续任务,提升企业工作效率。
陶哲轩等学者严厉批评OpenAI批量发布AI生成的数学证明。OpenAI从GitHub发布含数百项开放难题解答的719份数学手稿,被指违背“数学与人工智能顾问小组”关于提高专有模型透明度与发布规范的建议。陶哲轩称,这种工业化批量攻克难题造成“证明消化不良”,理解机制缺失正威胁数学研究生态。
Anthropic近日全面修订Claude使用政策,新规将于2026年11月12日生效。此次修订首次在条款中加入禁止“持续且不必要的虐待或残忍行为”,主要针对用户无明确目的、反复对模型实施残忍对待。官方表示,当前执行机制主要采取……具体措施原文未完整披露。此举凸显AI企业正强化人机互动伦理与使用边界。
近日,OpenAI一次性公开722份数学难题证明手稿,横跨17个数学领域,整体解题成本远低于以往,刷新外界对AI数学能力的认知,并引发数学界震动。从技术与应用看,这些AI证明虽能通过机器严格验证,却在实际转化中暴露痛点:绝大多数难以转化为人类易于理解的知识,甚至面临应用障碍。