7月20日,阿里千问发布了最新的语音合成大模型Qwen-Audio-3.0-TTS,该模型包含两个版本:实时交互的Flash版本和高质量生成的Plus版本。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现了系统性提升,使得合成语音更加接近自然表达。
Qwen-Audio-3.0-TTS支持在文本中嵌入结构化标签,允许用户直接在文本中嵌入如[gasp]、[giggles]、[angry]等标记,以精准调控语气、情绪和呼吸等细节。此外,该模型还配套了精品音色库,将模型的能力沉淀为可直接调用的音色资源,包括指令风格音色、20种方言音色、细粒度控制音色以及14+小语种音色。音频输出质量从24KHz提升至48KHz,单次语音合成时长可达3分钟。
Qwen-Audio-3.0-TTS-Plus在全球多语种场景下进行了专项优化,覆盖中、英、日、韩、德等16种语言,并新增阿拉伯、越南、马来、菲律宾语支持。同时,该模型还支持广东、重庆、东北、陕西、上海、四川、云南等20种方言。Qwen-Audio-3.0-TTS现已全面开放,Plus版本和Flash版本的链接已提供。

