听得懂,比听得清更重要
先来做个测试:下面这几句语音,你听写出来,再猜猜识别准确率会是多少?
- 一段带着浓厚方言口音的绕口令;
- 一段中英文夹杂的 rap;
- 一句"期中考试还是期终考试?";
- 还有一句在嘈杂地铁站里说的悄悄话。
如果换作传统的语音识别,这四道题大概率会翻车。但用腾讯混元今天发布的Hy ASR 3.0 preview,结果是——全部精准识别,一个没错。
为什么它这么能打?因为它做的,已经不只是"听清",而是"听懂"。
语音识别的旧范式:逐字转写,单点优化
过去十几年,语音识别(ASR)的核心思路没怎么变过:把声学信号切成一帧帧,逐个对齐到字词上,最后拼出文字。
这套思路的短板很明显。它是"字"级别的,不是"义"级别的。于是:
- 普通话不标准?识别率直线下降;
- 遇到同音词?"致癌物质"和"治癌物质"傻傻分不清;
- 环境一吵?声学特征退化,准确率崩给你看;
- 换个专业术语?"EBITDA""核磁共振氢谱"直接瞎猜。
说白了,传统 ASR 只负责"听到了什么",至于"说的是什么、想表达什么",它不关心。
新范式:先理解语境,再输出文字
Hy ASR 3.0 preview 的升级,本质上是一次思路翻转——先理解你的语境和意图,再把准确的文字直接给你。
它基于腾讯混元最新一代大语言模型 Hy3 的语言理解能力,把高精度语音识别与深度语义理解融合在一起。声学信号只负责"听到",大模型负责"听懂",两者配合,识别从"逐字转写、单点优化"演进为"理解语境、兼容场景、一键直出"。
这套思路带来了四个维度的能力跃升。
通用识别:不再需要标准普通话
以前用语音识别,总得刻意放慢语速、字正腔圆,生怕一点口音就让结果跑偏。
现在不用了。Hy ASR 3.0 preview 的方言识别覆盖粤语、吴语等 10 大方言片区和 20 余个二级小片区,中英夹杂的 rap 也能接住。
数字更有说服力:在开源评测集中,Hy ASR 3.0 preview 的多语种 WER(词错误率)控制在 3% 左右——中文普通话 3.34%、英语 2.62%、粤语 3.12%,整体处于行业领先水平。你可以说得快一点、随意一点,它都能跟得上。
上下文理解:同音词不再是坑
"期中考试"还是"期终考试"?"致癌物质"还是"治癌物质"?
这些同音词,光靠声学信号几乎无法区分,只能靠语义去猜。Hy ASR 3.0 preview 借助 Hy3 的语言理解能力,结合上下文 Context 精准捕捉语境、消除歧义、智能纠错。
在转写难度较高的会议纪要、访谈转写等长音频场景里,这个能力尤其突出——越说越懂你。
行业术语识别:你的专属百事通
金融报告里的"EBITDA"、化学研究里的"核磁共振氢谱"、游戏直播里的"打野蓝开"……每个领域的术语,Hy ASR 3.0 preview 都是行家。
针对企业的特殊场景和定制化需求,它还支持热词注入增强,快速识别品牌产品名称、人名及行业术语,帮企业大幅降低业务接入和持续维护的成本。
复杂场景识别:既能应对高噪,又能听清耳语
真实世界的语音,很少在安静的录音棚里发生。工厂车间、街道、篮球场——这些场景下声学信号的退化是几何级的。
Hy ASR 3.0 preview 面向高噪、耳语、悄悄话等多种声学场景做了专项优化:既能扛住地铁站、KTV 的嘈杂,也能听清咖啡厅、办公室、图书馆里的那些悄悄话。
三重驱动:架构、数据、后训练
这样全面的能力,不可能来自单一模块的补丁式优化。Hy ASR 3.0 preview 的升级,是模型架构、数据 Scaling 与后训练优化共同作用的结果。
- 模型架构:采用兼顾效率与性能的 MoE 架构,基座升级为 Hy3。语音侧,混元团队自研了无监督语音 Encoder,用数千万小时级的无监督语音数据训练,从各种复杂音频中提取高质量的声学表征。一句话总结:Encoder 负责听得好,Hy3 负责理解对。
- 数据 Scaling:团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,并通过多阶段能力注入,让模型具备上下文感知、复杂场景适应和方言识别等能力。
- 后训练优化:围绕通用识别、上下文理解和复杂场景鲁棒性,构建了高质量的 SFT recipe,覆盖上下文 Context、专业名词、不同声学环境以及多样人群语音;再引入多阶段强化学习,针对通用转写准确性、Any-context 上下文能力和复杂长尾场景分别优化,降低模型在复杂声学环境中的误识别和漏识别。
已经上线:元宝、腾讯云同步可用
好消息是,这不是 PPT 发布会上的产品。元宝深度参与了 Hy ASR 3.0 preview 的研发,目前已完成首发上线——按住对话框讲方言、说术语,在嘈杂或耳语场景随口一问,都能听得更准、识别更稳,还能结合上下文自动纠正同音词。WorkBuddy 等产品也在陆续接入。
同时,Hy ASR 3.0 preview 已上线腾讯云官网提供 API 服务,支持智能客服、内容理解、语音搜索等应用场景。每一处需要"把说的话变成文字"的地方,都可以用它让识别更精准高效。
语音识别的下一站
从"逐字转写"到"理解语境",语音识别跨过了一道重要的分水岭。过去我们苛求机器"每个字都听清",现在它开始学着"每个意思都听懂"。
当语音识别开始理解上下文,接下来的想象空间远比想象中大:会议纪要自动归类、方言口音自由交流、嘈杂环境也能精准命令——语音,正在从输入工具变成真正的对话伙伴。
如果你刚好在做语音相关的产品,不妨去腾讯云试一把 Hy ASR 3.0 preview,用真实场景检验"听懂"的力量。