在追求大模型“高智商”的同时,AI 的持续执行能力正成为衡量其进化水平的新维度。根据人工智能研究机构

测试结果显示,
AIbase 注意到,虽然测试数据中出现了模型理论上可连续工作超过20小时的数值,但
然而,也有专家对该测试的局限性提出了质疑。目前 METR 仅涵盖了14个样本,且有观点认为这种基准测试可能被模型针对性地“刷分”。但不可否认的是,

在追求大模型“高智商”的同时,AI 的持续执行能力正成为衡量其进化水平的新维度。根据人工智能研究机构

测试结果显示,
AIbase 注意到,虽然测试数据中出现了模型理论上可连续工作超过20小时的数值,但
然而,也有专家对该测试的局限性提出了质疑。目前 METR 仅涵盖了14个样本,且有观点认为这种基准测试可能被模型针对性地“刷分”。但不可否认的是,
一行GitHub公开代码意外暴露Anthropic芯片布局。AMD AI业务高管提交的代码中,留下Anthropic将作为其客户的痕迹。行业分析机构SemiAnalysis指出,这虽非官方披露,却释放出明确信号:Anthropic正主动拓宽算力供应链,不再依赖单一芯片供应商。
《2026年Q2中国办公智能体市场洞察报告》显示,腾讯WorkBuddy在PC端AI原生办公智能体市场领先,6月访问量达2097万次,超过第二、三名的总和。当月市场总访问量突破6000万次,行业规模持续扩大。腾讯旗下AI编程智能体CodeBuddy亦居头部。WorkBuddy可通过自然语言指令完成办公任务。
2026世界人工智能大会上,智象未来发布全球首个无限时长内容创作多模态智能体Vivago R1,并联合中科类脑等组建一带一路Token出海联盟,携手飞捷科思等发起物理智能创新联合体,以技术创新与生态协同双轮,推动AI从
Ollama凭借一行命令在本地运行开源大模型,让开发者摆脱API密钥与天价账单。7月9日其宣布完成8800万美元融资,由Benchmark的Peter Fenton、Theory Ventures的Tomasz Tunguz及8VC的Alex Kolicich共同领投,Docker创始人Solomon Hykes、ClickHouse CEO Aaron Katz、GIMP联合创建人兼Cockroach Labs联合创始人等参投。
DeepSeek V4正式版测试视频曝光,或于下周一发布,承接Kimi K3热度。实测性能对标Claude Opus4.8,核心指标惊艳,引发行业关注。