人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型
在权威的 Artificial Analysis 语音识别基准测试中,
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约 1.4 倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大。
技术架构上,
目前,该技术已在实际业务场景中展开验证,并在

人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型
在权威的 Artificial Analysis 语音识别基准测试中,
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约 1.4 倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大。
技术架构上,
目前,该技术已在实际业务场景中展开验证,并在
9月28日,xAI推出Team Bots,一种能与团队并肩工作、随团队学习的Grok智能体。授予其所需文件、应用和专业知识访问权限并共享后,全员可基于同一上下文协作,个人私聊仍独立。每个Team Bot围绕团队共有角色或工作流构建,由四块能力组成,强调上下文供给。
千问发布Qwen-Audio-3.1系列语音大模型,全面升级语音识别、合成与实时交互,并推出音频创作模型TTS-Next与理解模型ASR-Next,五款模型覆盖“理解—生成—交互—创作”完整能力栈。同时全线降价,TTS降约70%,降低使用门槛。
阿里千问9月23日升级语音栈,推出Qwen-Audio-3.1系列五款模型,覆盖识别、合成、实时交互、音频创作与理解,形成“理解—生成—交互—创作”完整矩阵。价格大幅下调:TTS降约70%、Realtime降约85%、ASR降95%,大幅降低语音使用门槛。
千问9月23日发布Qwen-Audio-3.1系列语音大模型,形成覆盖理解、生成、交互与创作的完整音频能力栈,含ASR、ASR-Next、TTS、TTS-Next及Realtime。API已上架千问AI平台,ASR-Next即将上线。同步全线降价:TTS约70%、Realtime约85%、ASR达95%。ASR增强多语种、方言识别与上下文理解,新增原生转写润色。
xAI于2026年9月16日在Grok Build推出记忆功能,解决开发者每次新会话需重复交代项目架构、代码规范等痛点。该功能可自动延续先前会话中的核心决策与项目事实,并在后台静默运行,每轮对话后自动更新。