阿里最新推出的基于音频驱动的肖像视频生成框架EMO,可以根据输入音频生成任意持续时间的视频。该框架由阿里巴巴智能计算研究院团队开发,是一种富有表现力的视频生成技术。EMO与之前的AI视频生成方法相比有较大提升,但也存在耗时较长的缺点。团队成员包括薄列峰等人,他们在论文中详细介绍了EMO的技术路线和特性。这一新技术为AI领域带来了新的突破,让人们对未来的发展充满期待。
相关推荐
消息称阿里将推出千问办公,整合三款智能体布局AI办公市场
据《财经》报道,阿里计划推出“千问办公”产品,已整合QoderWork、悟空、MuleRun三款智能体,主攻Agent办公市场,推动企业AI落地。产品由钉钉新任CEO陈宇森负责,他6月接替原CEO陈航,7月统一接管上述三款产品,形成阿里在Agent办公的重要布局。
2026年7月21号 15:42
234.3k
阿里发布Qwen-Image-3.0,支持4.5K Token超长输入与复杂图文生成
阿里发布Qwen-Image-3.0图像生成基础模型,支持最长4.5K Token文本输入,可一次性生成公式、几何图形、逻辑推导及多层UI等复杂内容,原生兼容12种语言和20余款字体渲染,文本长度较上代提升4.5倍,大幅强化影视分镜、知识图解等商业级图文创作能力。
2026年7月21号 15:16
268.8k
阿里发布Token Plan个人版,Qwen3.8-Max-Preview同步上线
阿里正式推出Token Plan个人版,并开放2.4万亿参数大模型Qwen3.8-Max-Preview抢先体验。该模型在代码与办公场景表现突出,正式版将开源。用户可通过Token Plan获取模型使用权限,阿里同步推出限时优惠:个人版Lite套餐39元/月,Standard套餐139元/月,Pro套餐499元/月;团队版提供标准及高阶方案。
2026年7月20号 10:42
289.4k
阿里开源统一科学大模型 LOGOS,仅用五十六分之一参数超越微软
阿里 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源科学基础模型 LOGOS。该模型采用统一科学语法与纯序列建模范式,在六大科学任务上匹配或超越传统专用方法。其中 LOGOS-1B 仅 1B 参数,即展现出极高效率,性能超越参数量达 8×7B 的微软模型。
2026年6月18号 16:01
307.3k
编程与GUI双向通吃!Qwen3.7-Plus 登场,11小时自主闭环开发真实APP
阿里发布多模态大模型Qwen3.7-Plus,在文本能力基础上增强视觉-语言功能,统一为智能体基座。该模型融合GUI与CLI交互,实现从原型到软件工程的端到端自动化,并在Vision Arena榜单中表现强劲。
2026年6月2号 9:18
237.1k
