2026年7月20日,阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延时300ms)和高质量生成Plus版。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖及复杂声学鲁棒性上显著提升,支持16种语言、20种方言,并配备精品音色库,音频输出提升至48KHz。