腾讯混元Hy ASR 3.0预览发布:上下文理解的语音识别技术革新
2026-08-04 20:31:07
8月4日消息,今日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 Preview,目前已上线腾讯云官网并对外提供API服务,可应用于智能客服、内容理解、语音搜索等场景。
腾讯元宝深度参与模型共研,并已完成首发接入,用户打开元宝长按说话,即可体验方言识别、上下文智能纠错以及复杂环境稳定转写等能力,相关功能免费开放。
与此同时,WorkBuddy等腾讯产品也在陆续接入。
据腾讯介绍,Hy ASR 3.0 Preview基于新一代大语言模型Hy3的语言理解能力,将高精度语音识别与深度语义理解相结合,在通用识别、上下文感知、复杂场景稳定性和方言覆盖等方面实现升级。
评测数据显示,在开源测试集中,Hy ASR 3.0 Preview的多语种词错误率均控制在3%左右。
其中,中文普通话WER为3.34%,英语WER为2.62%,粤语WER为3.12%。

在自建评测集中,该模型在通用语音、方言、上下文理解、专业词汇以及高噪声、耳语等复杂声学场景中,也保持了较低的词错误率。

从实际使用体验来看,Hy ASR 3.0 Preview重点提升了四项能力。
首先是通用识别准确率进一步提升,可覆盖普通话、方言以及中英文混说等场景,减少错字、漏字和长音频识别偏差。
其次,模型支持结合Context上下文理解用户语境,可对同音词进行智能纠错,降低因上下文缺失导致的语义误判。
针对专业场景,Hy ASR 3.0 Preview支持热词注入增强,可快速识别品牌名称、产品名称、人名和行业术语,减少企业在模型适配和词库维护方面的成本。
此外,腾讯还针对高噪声、耳语和低声说话等场景进行了专项优化,使模型在复杂环境下仍能保持较为稳定的转写效果。
技术层面,Hy ASR 3.0 Preview采用兼顾效率和性能的MoE架构,并将基座模型升级至Hy3,进一步增强语言理解、上下文建模和语义推理能力。
语音侧则采用腾讯自研的无监督语音Encoder,通过数千万小时无监督语音数据进行训练,从复杂音频中提取高质量声学特征。
为进一步提升语音建模和理解能力,混元团队还对语音Encoder与大语言模型进行联合训练,引入数千万小时、多来源语音数据,覆盖多种方言、口音和声学环境,并通过高质量数据管线完成精细化标注。

相关阅读
-
酷家乐怎么给墙体安装窗户?酷家乐给墙体安装窗户教程资讯百科 2026-08-04 20:22:24
-
钟美美回应四年留学花费300万:全靠努力,绝不走捷径深度解读 2026-08-04 20:21:02
-
华尔街00后股神发道歉信:450亿美元爆仓后照常举行婚礼,完全失败揭秘金融科技前沿 2026-08-04 20:17:36
-
驱动精灵怎么禁止新闻弹窗?驱动精灵禁止新闻弹窗教程资讯百科 2026-08-04 20:05:01
-
蔚来ES9销售数据曝光:40%用户选择高端油车置换金融科技前沿 2026-08-04 20:04:32
-
迅雷怎么设置迅雷图标?迅雷设置迅雷图标教程资讯百科 2026-08-04 19:46:49
-
福昕PDF编辑器怎么创建表格?福昕PDF编辑器创建表格教程资讯百科 2026-08-04 19:29:18
-
360驱动大师怎么恢复驱动保存位置?360驱动大师恢复驱动保存位置教程资讯百科 2026-08-04 19:10:50
-
福昕PDF编辑器怎么使用邮件发送PDF?福昕PDF编辑器使用邮件发送PDF教程资讯百科 2026-08-04 18:53:05
-
奥迪大灯维修引发争议:保险公司批评车企只换不修整车问题金融科技前沿 2026-08-04 18:36:29