返回热力追踪
关注AI产品

阿里通义千问发布Qwen-Audio-3.0-TTS 登顶全球语音合成权威榜单

2026年7月20日,阿里巴巴通义千问团队正式发布新一代语音合成大模型Qwen-Audio-3.0-TTS。模型推出两个版本,面向实时交互的Flash版首包延时300ms,Plus版登顶第三方权威榜单Artificial Analysis。模型在细粒度控制、多语种方言支持等能力上实现了系统性提升。

编辑视角

语音合成是AI落地的核心场景之一,本次新模型在控制精度、实时性和输出质量上实现明显升级,夺冠权威榜单对行业技术迭代有参考价值,值得从业者关注。

深度解读

本次信号是阿里通义千问团队发布新一代语音合成大模型Qwen-Audio-3.0-TTS,主打从“能说话”到“会表达”的体验升级,登顶全球第三方权威榜单,是国内语音合成领域的一次重要技术进展。多个公开信源确认,模型分为Flash和Plus两个版本,分别满足实时交互和高质量生成需求,支持16种语言、20种方言,可通过细粒度结构化标签控制单字级别的情绪、停顿,输出采样率提升至48KHz,单次最长支持3分钟语音合成。目前公开信息仅披露了评测成绩和核心能力参数,尚未明确模型是否完全开源、是否已上线正式商用产品,也未披露训练算力、授权规则等细节,暂无第三方独立落地案例验证效果。后续需要关注模型开源进度、商用落地进展以及实际场景的效果验证。

核心要点
  • 2026年7月20日阿里通义千问发布新一代语音合成大模型
  • Qwen-Audio-3.0-TTS-Plus登顶全球第三方语音合成权威榜单
  • 模型支持细粒度标签控制,覆盖16种语言和20种方言
延伸阅读
  • Qwen3.8预览版持续进化,前端能力大提升同属阿里通义千问系列模型,为相关技术进展