8 月 4 日,腾讯混元发布 Hy ASR 3.0 preview,新一代语音识别模型。
按腾讯公布的数据,中文普通话词错误率 3.34%,英语 2.62%,粤语 3.12%。词错误率越低越准,3% 左右意味着每 100 个词大概错 3 个。
比数字更值得关注的是方向。以前的语音识别逐字听写,听到什么转什么。Hy ASR 3.0 把语音编码器和大语言模型联合训练,转写的同时理解上下文,能处理中英混说、方言、嘈杂环境和悄悄话。
方言覆盖 10 个大方言片区、20 余个二级小片区。普通话识别做到 3% 的产品不少,方言才是真实场景的天花板。老人说四川话、广东人说粤语、车间噪音大,这些场景里很多产品的识别率断崖式下降。
已上线腾讯云 API,元宝首发,WorkBuddy 接入中。
对 AI 硬件来说,语音是核心交互入口。ASR 从「听准字」变成「听懂意思」,意味着用户不再需要字正腔圆、环境安静。
验证条件很简单:在嘈杂环境里用方言对设备说话,看它能不能一次听对。
语音识别腾讯混元 Hy ASR 3.0 preview发布腾讯混元


