腾讯混元Hy ASR 3.0预览发布:上下文理解的语音识别技术革新
2026-08-04 20:31:07
8月4日消息,今日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 Preview,目前已上线腾讯云官网并对外提供API服务,可应用于智能客服、内容理解、语音搜索等场景。
腾讯元宝深度参与模型共研,并已完成首发接入,用户打开元宝长按说话,即可体验方言识别、上下文智能纠错以及复杂环境稳定转写等能力,相关功能免费开放。
与此同时,WorkBuddy等腾讯产品也在陆续接入。
据腾讯介绍,Hy ASR 3.0 Preview基于新一代大语言模型Hy3的语言理解能力,将高精度语音识别与深度语义理解相结合,在通用识别、上下文感知、复杂场景稳定性和方言覆盖等方面实现升级。
评测数据显示,在开源测试集中,Hy ASR 3.0 Preview的多语种词错误率均控制在3%左右。
其中,中文普通话WER为3.34%,英语WER为2.62%,粤语WER为3.12%。

在自建评测集中,该模型在通用语音、方言、上下文理解、专业词汇以及高噪声、耳语等复杂声学场景中,也保持了较低的词错误率。

从实际使用体验来看,Hy ASR 3.0 Preview重点提升了四项能力。
首先是通用识别准确率进一步提升,可覆盖普通话、方言以及中英文混说等场景,减少错字、漏字和长音频识别偏差。
其次,模型支持结合Context上下文理解用户语境,可对同音词进行智能纠错,降低因上下文缺失导致的语义误判。
针对专业场景,Hy ASR 3.0 Preview支持热词注入增强,可快速识别品牌名称、产品名称、人名和行业术语,减少企业在模型适配和词库维护方面的成本。
此外,腾讯还针对高噪声、耳语和低声说话等场景进行了专项优化,使模型在复杂环境下仍能保持较为稳定的转写效果。
技术层面,Hy ASR 3.0 Preview采用兼顾效率和性能的MoE架构,并将基座模型升级至Hy3,进一步增强语言理解、上下文建模和语义推理能力。
语音侧则采用腾讯自研的无监督语音Encoder,通过数千万小时无监督语音数据进行训练,从复杂音频中提取高质量声学特征。
为进一步提升语音建模和理解能力,混元团队还对语音Encoder与大语言模型进行联合训练,引入数千万小时、多来源语音数据,覆盖多种方言、口音和声学环境,并通过高质量数据管线完成精细化标注。

相关阅读
-
Vscode代码缩进怎么取消?Vscode代码缩进取消方法资讯百科 2026-09-07 13:34:08
-
比特币现金 2026 年价格预测:五月升级引入量子安全与智能合约,能否突破 850 美元?区块链快讯 2026-09-07 13:21:26
-
OPPO Find X10正式发布:全球首发3.2亿镜头,2023年最强影像旗舰金融科技前沿 2026-09-07 13:17:22
-
pycharm怎么设置代码对齐竖线?pycharm设置代码对齐竖线的方法资讯百科 2026-09-07 13:15:43
-
大批NS2用户遭误封现已解封,任天堂需承担责任金融科技前沿 2026-09-07 13:10:35
-
男人驾驶坦克300驶入网红湖泊拍照 官方已约谈教育整改金融科技前沿 2026-09-07 13:04:25
-
ALEO 币是什么?深度解析团队背景、融资机构、代币经济学及未来前景区块链快讯 2026-09-07 13:03:37
-
群联CEO潘健成:即使再建20座厂,NAND闪存需求依然不足,原厂缺口巨大金融科技前沿 2026-09-07 12:57:47
-
使用雷电模拟器卡顿怎么办?雷电模拟器卡顿的解决方法资讯百科 2026-09-07 12:57:13
-
微软确认优化Windows 11:8GB内存也能流畅运行,开机提速新体验金融科技前沿 2026-09-07 12:52:11