从“能说话”到“会表达”,阿里发布 Qwen-Audio-3.0-TTS
7 月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获冠军,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。

Qwen-Audio-3.0-TTS的上一代版本已支持freestyle(自由风格模式),可在提示词中加入“资深客服”、“足球解说员”等角色设定,以控制情绪、场景和语速等。新模型则在细粒度上进一步跃迁,通过结构化标签,用户可直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记,把控制精度从整段情绪细化到“哪个字后面该倒吸一口气”,适用于需要精确控制细节的叙事、游戏、配音等场景。
面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖中、英、日、韩、德等16 种语言,新增阿拉伯语、越南语、马来语以及菲律宾语。根据CV3-Eval的多语种基准测试,在16 种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在 10 种语言中获得 SOTA,韩语和马来语的领先幅度最大;在 16 种语言的“说话人相似度”评测中,Qwen-Audio-3.0-TTS-Plus 全胜,包揽全部最优,Flash版本包揽了15项第二,其中马来语、西班牙语和阿拉伯语领先幅度最为明显。

模型规模越大、训练数据越杂,方言的发音会不自觉地滑向普通话腔。针对这个痛点,研究团队专门设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等 20种方言。
语音克隆产品往往要求原始参考音频在安静环境下录制,Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,让模型在高噪声、高混响条件下也能过滤干扰、只留音色。面向严肃创作场景,模型拥有开箱即用的精品音色库,并将音频输出从提升24kHz 到 48kHz,相当于视频配音和有声书的品质提升到录音棚、影视配音的规格,单次语音合成可长达 3 分钟。
即日起,两款模型已在阿里云百炼开放调用。
《从“能说话”到“会表达”,阿里发布 Qwen-Audio-3.0-TTS》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
收到现金卡别扫码!骗子冒充抖音寄“诈骗包裹” 官方提醒
快科技7月20日消息,今日,抖音黑板报官微发文提醒,近期仿冒抖音客服的诈骗套路再度升级,诈骗分子通过快递寄送“诈骗包裹”,诱导用户扫码实施诈骗。据介绍,诈骗分子会冒充抖音制... -
京东七鲜升级“冰力”:超200款饮品冰镇配送 三伏天畅饮不等待
进入三伏天,全国多地开启“蒸煮模式”,一瓶刚从冰柜取出的冰啤酒、一杯现调冰饮,成为不少消费者居家放松、亲友小聚时的消暑“搭子”,冰镇酒饮迎来消费高峰。这个夏天,... -
OpenAI高管炮轰Kimi K3:中国开源是减速主义 会抑制资本投入
快科技7月20日消息 ,近日,OpenAI战略未来负责人Dean W. Ball在社交平台发表了一篇题为《Some observations on Kimi》的帖子,对月之暗面最新发布的 Kimi K3模型进行了系统评价。Dean W. Bal... -
千年文明万里闪充 比亚迪马可波罗之路乌兹站圆满收官
近日,比亚迪马可波罗新丝绸之路走进乌兹别克斯坦,以硬核闪充科技激活古道新生,续写东西方文明交融、产业共建的全新篇章。本次乌兹别克斯坦段行程自努库斯始发,一路向东纵贯中亚腹地,相继穿... -
双里程碑!比亚迪巴西工厂迎来第10万辆新能源汽车下线 员工规模突破5500人
当地时间7月16日,比亚迪巴西工厂迎来重要发展里程碑。工厂第10万辆新能源汽车正式下线,本次下线车型为比亚迪海鸥;与此同时,工厂在岗员工规模突破5500人,产能建设与本地化就业同步提速,点亮...






