Qwen-Audio-3.0-TTS 发布:AI 声音开始学会表演

作者:袖梨 2026-07-21

今天我们正式发布语音合成大模型 Qwen-Audio-3.0-TTS,包含面向实时交互的

Flash版本

(首包延时300ms级别)和面向

高质量生成的

Plus版本

。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。


目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获

冠军

Qwen-Audio-3.0-TTS 发布:当 AI 声音开始学会表演Qwen-Audio-3.0-TTS 发布:当 AI 声音开始学会表演

核心升级


细粒度标签控制:精确到呼吸和情绪

Qwen-Audio-3.0-TTS 支持在文本中嵌入

结构化标签

,用户可直接在文本里嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)这类标记,直接对语气、情绪和 breath 类细节进行精准调控。这种方式特别适合需要精确控制非语言细节的叙事、游戏、影视配音等场景。并且配套开箱即用的

精品音色库

,将模型在多语种、多方言、指令控制和细粒度表达上的能力沉淀为可直接调用的音色资源,将陆续上架指令风格音色、20 种方言音色、细粒度控制音色以及14+小语种音色,帮助业务方快速上线不同场景的声音方案。并将音频输出从提升24KHz到48KHz,相当于从电话和普通语音助手的品质提升到录音棚、影视配音的规格,单次语音合成可长达 3 分钟。

Qwen-Audio-3.0-TTS 发布:当 AI 声音开始学会表演

Demo 1

合成文本:

[angry] 你们竟然私自切断了主控系统的能源!知不知道防护罩一旦失效,整艘飞船的人都会化为灰烬?这就是你们所谓的‘为了大局’吗!简直是不可理喻!

参考音频:

合成音频:

Demo 2

指令:

说到一半忍不住扑哧笑出声

合成文本:

你说的这个事啊,我都听过好几遍了,扑哧——还是觉得好笑。

合成音频:

Demo 3

指令:

你是悬疑剧旁白,屏住呼吸把紧张感一层层叠上去

合成文本:

那天夜里下着大雨,林晚一个人坐在书房里。窗外的雷声一阵接一阵,灯光忽明忽暗。她忽然听见楼下传来了脚步声——缓慢、沉重,像是有人在故意压低声响。她屏住呼吸,手指紧紧抓住椅子的扶手。脚步声越来越近,最终停在了书房门口。门把手轻轻地,转动了一下。

合成音频:



自由指令控制:用自然语言定义声音风格

Qwen-Audio-3.0-TTS支持

Free-style自然语言指令控制

。用户可直接用自然语言描述角色、情绪、场景和语速,无需掌握专业声学或标注知识,即可灵活定义情绪、角色、场景、语速等维度,让合成结果与预期高度一致。

Demo

指令:

你是一位年轻女性小学老师,正在课堂上耐心地给一年级学生复述拼音规则。语速很慢,每一个发音都示范一遍,语调上扬带笑意。

合成文本:

我们再来读一次,j、q、x这三个声母后面如果跟着u,那个u上的两点要去掉。你跟老师一起读,j——u——ju。

参考音频:

合成音频:



多语种精准合成能力全面升级

面向全球多语种场景,Qwen-Audio-3.0-TTS-Plus进行了专项优化,覆盖中、英、日、韩、德等

16 种语言

,新增阿拉伯、越南、马来、菲律宾语。在16种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在10种语言中获得SOTA,韩语和马来语的领先幅度最大。根据CV3-Eval的多语种基准测试,

Qwen-Audio-3.0-TTS家族在10种语言中获得SOTA,韩语和马来语的领先幅度最大。

在16种语言的“说话人相似度”评测中,Qwen-Audio-3.0-TTS-Plus

全胜

,包揽全部最优,Flash版本包揽了15项第二,其中马来语、西班牙语和阿拉伯语领先幅度最为明显。

Qwen-Audio-3.0-TTS 发布:当 AI 声音开始学会表演



中文方言合成正宗度显著提升

目前支持广东、重庆、东北、陕西、上海、四川、云南等

20种方言

。通过更高质量的方言数据、更丰富的方言种类覆盖,以及专门的方言强化训练阶段,有效缓解了通用语音强化学习过程中容易出现的

“方言特色弱化”

问题

,让模型在韵律、声调与口语表达上接近母语者,还原了各地语言的真实韵味。

Demo

指令:

输出上海话:屋里向装修真个是烦人,天天敲墙壁,声音响得来!灰尘落得一塌糊涂,真想快点弄清爽。

参考音频:

合成音频:



复杂声学场景鲁棒性

语音克隆产品往往要求原始录音在安静环境下录制,可现实里的参考音频往往有背景杂音。Qwen-Audio-3.0-TTS通过真实声学仿真训练,把语音增强能力原生嵌进了克隆流程,让模型在高噪声、高混响条件下也能过滤干扰、只留音色。

Demo

合成文本:

听到这首歌的时候,突然想起很多年前的夏天。

参考音频:

合成音频:


欢迎体验

Qwen-Audio-3.0-TTS 现已全面开放


Qwen-Audio-3.0-TTS-Plus:

https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china


Qwen-Audio-3.0-TTS-Flash:

https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china


blog:

https://funaudiollm.github.io/qwen-audio-3.0-tts/


Qwen-Audio-3.0-TTS 发布:当 AI 声音开始学会表演

关注我,掌握千问大模型最新动态




相关文章

精彩推荐