登顶全球第一还降价95%,语音大模型卷到新阶段了?
阿里在2026云栖大会期间发布的新一代语音合成大模型Qwen-Audio-3.1-TTS拿下Artificial Analysis 语音榜全球第一,Elo1177分,支持多语种、方言自然迁移,还能用指令控制情绪和语速。
同时Qwen-Audio全线语音API价格下调,最高降幅95%(ASR 输入单价低至 0.8 元/百万 tokens)。
这性价比对很多做智能语音客服、有声书、播客配音等的小团队和个人开发者来说是大大利好,成本门槛降低了很多。
当然这个模型的影响可能不止于省钱,当语音AI正在从“贵价专用功能”变成像水电煤一样的基础设施时,对行业来说,利好的是应用场景会被快速催熟,比如短剧配音、智能硬件交互、适老化产品,都会有新玩法出现。
榜单分数的竞争终有尽头,真正的较量会转向方言覆盖、情绪表达的自然度,以及实时交互的延迟体验这些“体感”细节上。当语音变成普惠基础设施,你觉得哪个行业或者应用会先被引爆?

