Qwen-Audio-3.0-TTS发布!从“能说话”到“会表达”
创始人
2026-07-20 18:18:35

刚刚,阿里云发布语音合成大模型Qwen-Audio-3.0-TTS。

在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖及复杂声学鲁棒性方面升级,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获冠军,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。

Qwen-Audio-3.0-TTS支持freestyle自由风格模式,可通过角色设定控制情绪、场景和语速。新版本进一步支持结构化标签,用户可在文本中嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,将控制精度从整段情绪细化到单字级别,适用于叙事、游戏、配音等场景。

Qwen-Audio-3.0-TTS覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语及菲律宾语。根据CV3-Eval多语种基准测试,在16种语言的词/字错误率评测中,模型在10种语言中取得最优成绩,韩语和马来语领先幅度较大。在16种语言的说话人相似度评测中,Plus版本取得全部SOTA。

研究团队设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言。

模型通过真实声学仿真训练,在克隆流程中嵌入语音增强能力,在高噪声、高混响条件下可过滤干扰。音频输出从24kHz提升至48kHz,单次语音合成可长达3分钟,并提供开箱即用的精品音色库。

即日起,两款模型已在阿里云百炼开放调用。

欢迎体验:

Qwen-Audio-3.0-TTS-Plus:

https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china

Qwen-Audio-3.0-TTS-Flash:

https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china

相关内容

热门资讯

应对低利率挑战理财子公司“打新... (来源:经济参考报) 7月20日,长鑫科技中签投资者完成缴款。每个中签号码可认购500股,按8.66...
近3亿元股权转让终止 新华百货... (来源:经济参考报) 日前,银川新华百货商业集团股份有限公司(简称“新华百货”,600785.SH)...
LPR连续十四个月“按兵不动”... (来源:经济参考报) 7月20日,中国人民银行授权全国银行间同业拆借中心公布,2026年7月20日贷...
6月70城房价数据出炉 ...   三湘都市报7月20日讯 近日,国家统计局发布2026年6月份商品住宅销售价格变动情况,70个大中...
兴业500ETF季报解读:净值... 主要财务指标:本期利润近千万 资产净值3.99亿元报告期内(2026年4月1日-6月30日),兴业中...