腾讯混元 Hy ASR 3.0 预览版:面向普通话、英语及20种方言的上下文感知语音识别

腾讯混元发布了 Hy ASR 3.0 预览版,这是一款基于 Hy3 语言理解能力构建的新型实时语音识别模型。该模型旨在提升识别准确率,尤其适用于多种语言和方言场景,并充分利用上下文信息来增强语音识别的表现。

发布于 2026年8月5日generalGEO 评分: 0
这张是腾讯混元 Hy ASR 3.0 的预览指南配图,整体为深蓝色科技风格设计,视觉元素包含中央醒目的“Hy ASR 3.0 Preview Guide”标题,标题下方标注了WER、上下文识别、方言、API、Limits等核心模块,左侧有声波与麦克风图标,右侧有带代码图标的API界面、多国语言关联节点图标,还呼应了标题中提及的该ASR模型支持普通话、英语及20种方言,具备上下文感知语音识别能力的核心特性。

腾讯混元 Hy ASR 3.0 预览版:不只是听音,更懂语境的语音识别

引言

腾讯混元发布了 Hy ASR 3.0 预览版,这是一款基于 Hy3 语言理解能力构建的新型实时语音识别模型。

该模型旨在推动自动语音识别超越孤立的声学解码。

传统 ASR 系统主要回答这样一个问题:

哪一串词与这段音频最匹配?

Hy ASR 3.0 增加了第二个问题:

在上下文中,哪种转写最有意义?

当音频包含以下情况时,这一区别至关重要:

  • 同音字词。
  • 地域口音。
  • 方言。
  • 中英混说。
  • 产品名和人名。
  • 背景噪声。
  • 低语或低音量说话。
  • 长句或语义依赖较强的表述。

腾讯表示,该模型将高精度声学系统与 Hy3 的上下文建模和语义推理能力相结合。其目标不是创造性改写用户所说的内容,而是在音频本身存在歧义时,利用语言上下文选择更合理的转写结果。

腾讯报告称,在聚合公开评测集上,普通话词错误率为 3.34%英语为 2.62%粤语为 3.12%

Hy ASR 3.0 预览版现已作为腾讯云实时 WebSocket 引擎提供文档支持,并已集成到腾讯元宝助手中。WorkBuddy 及其他腾讯产品正在逐步接入中。

公开预览版虽已可用,但尚未达到更广泛发布公告中所描述的最终产品形态。其当前的 API 限制对于计划进行生产集成的团队而言值得关注。

已公布的公开基准测试结果

腾讯在多个公开语音数据集上对 Hy ASR 3.0 预览版进行了评估,并与其他 ASR 系统进行了比较。

该公司报告的聚合词错误率如下:

语言或语音变体 Hy ASR 3.0 预览版 WER
普通话 3.34%
英语 2.62%
粤语 3.12%

WER 越低越好。

图片展示了Hy ASR 3.0 Preview在中文、英文、粤语三种语言或方言上的词错误率(WER,%)对比。其中,Hy ASR 3.0 Preview在中文的WER为3.34%,英文为2.62%,粤语为3.12%。还列出了Doubao-Seed-ASR 2.0、Qwen 3 ASR、Qwen-audio-3.0-ASR Flash等其他系统的WER数据。图片下方注释说明数值越低识别越准确,数据来源于开源评测集,列举了各语言或方言的开源数据集名称。

图表注释表明,聚合评估使用了以下数据集:

  • WenetSpeechMeeting。
  • WenetSpeechNet。
  • FLEURS 中文。
  • LibriSpeech clean。
  • LibriSpeech other。
  • FLEURS 英语。
  • MLS 英语。
  • FLEURS 粤语。
  • Common Voice 粤语。

聚合数据有助于进行宽泛比较,但也可能掩盖重要的差异。

模型在不同场景下表现可能有所不同:

  • 朗读语音与自发对话。
  • 近场麦克风与远场麦克风。
  • 干净录音室音频与街道噪音。
  • 短指令与连续讨论。
  • 母语者与带口音语音。
  • 正式普通话与语码切换。

因此,生产团队应使用自己的音频进行测试。

而不是仅从单一标题的WER数字来选择ASR模型。

词错误率衡量的是什么

词错误率通常定义为:

WER =(替换 + 删除 + 插入)/ 参考词数

三种错误类型分别是:

  • 替换: 模型输出了错误的词。
  • 删除: 转写文本中遗漏了某个口语词。
  • 插入: 转写文本中包含了一个未被说出的词。

较低的WER通常表示转写更准确。

然而,WER并不能覆盖所有实际场景中的失败情况。

考虑两个单字错误:

“Ship the order tomorrow”
→ “Ship the order today”

以及:

“The color is navy blue”
→ “The colour is navy blue”

两者可能产生相似的错误计数,但第一个可能改变业务行动,而第二个可能对业务没有任何影响。

对于客户服务、医疗健康、金融、制造和命令接口等领域,团队应同时评估语义影响和WER。

腾讯内部场景评估

腾讯还公布了涵盖四个实际类别的内部评估集结果:

  1. 通用语音识别。
  2. 方言识别。
  3. 上下文理解。
  4. 复杂声学条件,如高噪声和耳语。

报告的结果如下:

内部评估类别 Hy ASR 3.0 Preview WER
通用识别 4.95%
方言识别 9.31%
上下文评估 4.76%
复杂声学条件 6.36%

这张柱状图统计了腾讯混元Hy ASR 3.0 Preview等四个语音识别系统在四类评测集上的词错误率(WER,数值越低识别越准确),评测集包括通用评测集、方言评测集、上下文Context评测集、复杂声学场景(高噪/耳语)评测集。在通用评测集上,该系统WER为4.35%,表现优于另外三个系统;其他评测集中,该系统的WER也均为四类评测中最低,分别为方言评测集的9.31%、上下文评测集的4.25%、复杂声学场景评测集的6.36%。该图展示的内部场景评估结果,对应文档中提及的腾讯公开Hy ASR 3.0 Preview内部评估的四类任务表现。

腾讯表示,Hy ASR 3.0 Preview在所有四个内部类别的对比系统中均实现了最低的WER。

这些结果作为公司报告的产品证据是有用的,但内部测试集并不是中立的公共基准。

在采用之前,组织应该问:

  • 测试包含了哪些口音和方言区域?
  • 音频的噪声水平如何?
  • 标点是如何规范化的?
  • 数字和英文术语在评分前是否进行了标准化?
  • 对比系统是否配置了热词或上下文?
  • 使用了多少条话语样本?
  • 测试是否包含了组织实际使用的麦克风和信道?

四项面向用户的改进

腾讯将实际改进归纳为四个领域。

1. 更准确的通用识别

该模型旨在提升以下场景的识别能力:

  • 标准普通话。
  • 英语。
  • 粤语。
  • 地域方言。
  • 中英混说。
  • 不同说话人和口音。

腾讯还表示,该模型减少了较长话语中的累积错误。

这一说法描述了模型的底层能力。当前腾讯云Preview仍将单次公共API输入限制在60秒内,因此处理会议或录音的应用程序目前必须进行分段。

音频并自行管理跨片段上下文。

分段不佳可能重新引入该模型本应解决的问题。

例如,在任意60秒边界处切割音频可能会切断:

  • 一个人的全名。
  • 一个产品代码。
  • 一句语义延迟的句子。
  • 中英混合短语。
  • 说话者的自我修正。

因此,分段逻辑应尽可能保留句子边界和语音活动边界。

2. 更好的上下文与意图识别

语音中包含许多含混不清的声音。

普通话中有大量同音字。英语中有发音相似的单词和名字。方言发音可能使多个候选转写文本在声学上都看似合理。

传统解码器可能选择局部最大概率的词。

具备上下文感知能力的系统可以评估完整的话语。

例如,用户可能说出一个可被转写为两个不同同音字的短语。附近涉及金融、游戏、医疗或旅行的话题词可以提示哪种含义更有可能。

预期的处理流程可简化为:

音频特征
→ 候选词
→ 句子上下文
→ 语义一致性检查
→ 最终转写文本

这并不意味着模型能以与人类相同的方式真正理解语音。

而是指语言组件利用更宽的上下文窗口和语义概率来改进转写决策。

上下文感知的ASR系统也带来了新的风险:语义过度修正

模型有时可能会将一个不常见但发音正确的短语替换为一个看似更通顺的常见短语。

因此,生产环境评估应包含:

  • 罕见人名。
  • 刻意不寻常的表述。
  • 新产品术语。
  • 领域缩写。
  • 矛盾或令人意外的句子。

目标是利用上下文而不凭空编造从未出现的语音内容。

3. 更轻松适配专业词汇

发布材料中强调了热词增强,适用于:

  • 品牌名称。
  • 产品名称。
  • 人名。
  • 行业术语。
  • 缩写。
  • 内部词汇。

当通用模型对某个罕见词的出现频率不够高时,热词可以发挥重要价值。

示例包括:

专有药品名称
工厂机器型号
客户账号代码
新推出的品牌
技术缩写

腾讯云通用ASR产品已有热词列表API和hotword_id参数。

然而,当前Hy ASR 3.0预览版文档明确说明热词增强尚未对该预览引擎开放

因此,应将公开产品宣传与实际可访问的API状态区分开来:

能力 模型发布说明 当前预览API状态
热词增强 被描述为已支持的能力 列为即将推出
上下文输入 被描述为主要能力 列为即将推出
内部上下文语言建模 核心模型特性 通过模型行为可用

在腾讯云在正式API文档中确认支持之前,企业不应制定依赖外部上下文注入或热词列表的发布计划。

4.

在困难声学条件下更稳定的识别

腾讯表示该模型针对以下情况进行了优化:

  • 高背景噪声。
  • 耳语。
  • 轻声说话。
  • 不同的录音环境。
  • 多种口音。
  • 长尾声学条件。

噪声鲁棒性很重要,因为真实的语音很少像干净的实验室录音那样出现。

客服麦克风可能捕捉到键盘声和旁边同事的声音。

移动助手可能听到交通噪声、风声、音乐声或他人说话声。

会议应用可能接收到来自远处笔记本电脑麦克风的压缩音频。

模型可以提高鲁棒性,但无法恢复从未被捕获的信息。

团队仍应使用:

  • 合适的麦克风。
  • 回声消除。
  • 增益控制。
  • 支持情况下的语音活动检测。
  • 合理的音频压缩。
  • 通道监控。
  • 重试或澄清流程。

ASR质量是一个系统属性,而不仅仅是模型属性。

架构:Hy3加语音编码器

腾讯表示,混元Hy ASR 3.0 Preview结合了三大组件:

  1. 基于Hy3的MoE语言模型基座。
  2. 自研的无监督语音编码器。
  3. 联合预训练和多阶段后训练。

这张图片展示了腾讯混元Hy ASR 3.0 Preview的核心架构与能力升级内容,包含三个核心部分。第一部分是架构升级,以Hy3为基座,结合自研语音Encoder,实现双轮驱动,提升语音理解能力。第二部分是预训练Scaling,通过多源数据联合建模,将语音与语言模型进行联合训练,注入多阶段能力,支持多语言与上下文识别。第三部分是后训练增强,针对复杂音频、任意上下文进行优化,通过多阶段强化学习提升模型能力,最终实现综合能力的全面升级。

Hy3作为语言基座

Hy3提供语言理解组件。

其作用包括:

  • 对句子上下文进行建模。
  • 解析歧义候选项。
  • 理解混合语言结构。
  • 利用语义关系。
  • 提高输出连贯性。

腾讯将该架构描述为一种平衡能力与效率的专家混合(MoE)设计。

公开的ASR文档未披露Hy ASR 3.0 Preview的完整参数量、激活参数量、延迟概况或完整推理架构。

无监督语音编码器

语音编码器将原始音频转换为语言模型可以处理的声学表示。

腾讯表示,该编码器使用了数千万小时的未标注语音进行训练。

无监督或自监督音频训练很有价值,因为手动转写如此规模的语音数据成本高得令人望而却步。

编码器可以从原始音频中学习重复出现的结构,例如:

  • 语音模式。
  • 说话人差异。
  • 口音差异。
  • 背景条件。
  • 时序和韵律。

这种表示的质量会影响后续所有环节。

如果在编码器阶段两个声音被混淆,语言模型就必须更多地依赖上下文来恢复正确的词语。

语音与语言联合预训练

腾讯表示,语音编码器和语言模型使用覆盖以下内容的大规模多源语音数据集进行了联合训练:

  • 方言。
  • 口音。
  • 声学环境。
  • 不同的说话人群。
  • 上下文语言模式。
  • 联合

训练旨在缩小声学识别与语言理解之间的差距。

而不是将语音识别视为:

音频模型完成
→ 语言模型随后清理转录文本

Hy ASR 3.0 被呈现为一个更加集成的过程:

语音表示与语言建模
→ 训练协同工作
→ 输出一个上下文化的转录结果

编码器、解码器、语言模型和强化学习阶段之间的确切内部边界尚未完全公开。

## SFT 与多阶段强化学习

腾讯描述了一种监督微调方案,涵盖:

- 通用转录。
- 任意上下文任务。
- 专业术语。
- 不同声学环境。
- 多样化的说话人群。
- 十大方言区。
- 20多个较小的方言区域。

该公司还报告使用了多阶段强化学习,用于:

- 通用转录准确性。
- 上下文行为。
- 复杂的长尾案例。
- 减少替换和删除错误。

目前没有公开技术论文提供完整的奖励设计、数据配比、训练算力或消融实验结果。

因此,架构声明应被视为产品层面的技术描述,而非可复现的研究规范。

## 当前腾讯云引擎支持的语言和方言

腾讯云文档将当前的 `Hy-ASR-3.0-preview` 引擎描述为支持:

- 普通话。
- 英语。
- 20种中文方言或地域变体。

文档列出的方言列表如下:

| 序号 | 方言或地域变体 |
|-|-|
| 1 | 粤语 |
| 2 | 东北话 |
| 3 | 河南话 |
| 4 | 陕西方言 |
| 5 | 成都话 |
| 6 | 重庆话 |
| 7 | 武汉话 |
| 8 | 贵阳话 |
| 9 | 青岛话 |
| 10 | 济南话 |
| 11 | 长沙话 |
| 12 | 合肥话 |
| 13 | 河北方言 |
| 14 | 昆明话 |
| 15 | 兰州话 |
| 16 | 银川话 |
| 17 | 南昌话 |
| 18 | 北京话 |
| 19 | 四川话 |
| 20 | 天津话 |

商业ASR文档中的方言标签是宽泛的产品类别。

每一类中的真实语音会因城市、年龄、社会背景、语码转换、词汇和说话人而异。

声称支持某种方言不应被理解为对该地区每位说话人都具有相同的准确率。

## 当前预览版可用性

腾讯云于**2026年8月4日**将 Hy ASR 3.0 预览版引擎添加到实时 WebSocket 产品中。

该公共服务目前被描述为内部测试或预览版本。

| 项目 | 当前文档化状态 |
|-|-|
| 产品类型 | 实时语音识别 |
| 接入方式 | 腾讯云 WebSocket API |
| 引擎名称 | `Hy-ASR-3.0-preview` |
| 音频时长 | 每次输入不超过60秒 |
| 音频格式 | 16 kHz 单声道 PCM |
| 包含并发 | 20路并发 |
| 普通话 | 支持 |
| 英语 | 支持 |
| 20种方言 | 支持 |
| 说话人分离 | 预览版不支持 |
| VAD参数支持 | 预览版列为不支持 |
| 词语替换 | 预览版不支持 |

噪声阈值参数 | 预览版不支持 |
| 外部上下文输入 | 即将推出 |
| 唤醒词增强 | 即将推出 |

通用 WebSocket API 参考包含其他引擎使用的参数,包括 VAD 和唤醒词 ID。

Hy ASR 3.0 以引擎专属的预览版说明为准。

共享 API 模式中出现的参数并不保证预览版引擎当前已实现该参数。

## 腾讯云集成基本流程

官方设置分为三个主要阶段。

## 步骤 1:开通腾讯云语音识别服务

打开腾讯云语音识别服务并完成账户开通流程。

官方快速入门文档位于:

```Plaintext
https://cloud.tencent.com/document/product/1093/54362

在启用后付费计费前请先查看计费说明。

腾讯云指出,新账户默认禁用后付费计费,需要手动开启。

步骤 2:创建 API 凭证

创建或获取:

  • AppID
  • SecretID
  • SecretKey

这些凭证用于对 WebSocket 连接请求进行签名。

请将其存储在密钥管理器或受保护的环境变量中。

请勿将长期有效的凭证放置在:

  • 前端 JavaScript 代码中。
  • 移动应用源代码中。
  • 公共代码仓库中。
  • 共享文档中。
  • 客户端可见的 URL 中。

对于浏览器或移动端产品,请在可信的后端创建签名后的连接信息。

步骤 3:连接实时 WebSocket 端点

腾讯云文档中记录的端点格式为:

wss://asr.cloud.tencent.com/asr/v2/<appid>?{request_parameters}

<appid> 替换为腾讯云 AppID。

请求包含签名参数,例如:

  • secretid
  • timestamp
  • expired
  • nonce
  • voice_id
  • engine_model_type

对于 Hy ASR 3.0 预览版,请设置:

engine_model_type=Hy-ASR-3.0-preview

每个 WebSocket 连接需要唯一的 voice_id

如果连接结束或失败,旧的 voice_id 将失效,需要生成新的 voice_id

步骤 4:准备兼容的音频

当前预览版要求:

采样率:16 kHz
声道:单声道
格式:PCM
最大输入时长:60 秒

请测试完整的音频链路,而不仅仅是原始文件。

麦克风 SDK、浏览器媒体 API、电话系统和会议平台可能会在音频到达服务器之前对其进行重采样或压缩。

步骤 5:流式传输音频并读取增量结果

该服务支持实时转写,在音频传输过程中即可返回文本。

应用程序应处理:

  • 部分结果。
  • 最终结果。
  • 连接错误。
  • 身份验证失败。
  • 超时。
  • 重连。
  • 音频时长限制。
  • 重复或修订的文本。

不要假设每个部分识别结果都是最终结果。

实时 ASR 接口可能会在获得更多上下文后修订之前的词句。

用户界面应区分临时文本和已确认文本。

步骤 6:上线前测试

构建具有代表性的评估集,包含:

  • 真实客户音频。
  • 常见口音。
  • 方言。
  • 中英混合。
  • 人名和产品术语。

噪音。

  • 低声细语。
  • 麦克风质量差。
  • 短指令。
  • 完整句子。

同时衡量识别质量和系统行为。

预览引擎定价

腾讯云将 Hy ASR 3.0 预览版归类为大模型 2.0 实时语音识别引擎

当前计费页面列出:

计费选项 当前标价
预付费 60 小时套餐 总计 60 元,即 1.00 元/小时
预付费 1,000 小时套餐 总计 950 元,即 0.95 元/小时
预付费 10,000 小时套餐 总计 9,000 元,即 0.90 元/小时
预付费 100,000 小时套餐 总计 88,000 元,即 0.88 元/小时
预付费 300,000 小时套餐 总计 255,000 元,即 0.85 元/小时
后付费 1.00 元/小时,按日结算

腾讯当前的计费表显示,大模型 2.0 识别没有免费音频额度

包含的 20 路并发是并发配额,而非免费识别时长。

价格可能变动。在发布商业报价或估算长期预算前,请查看实时计费页面。

成本示例

按当前标价的后付费 1.00 元/小时计算:

100 小时成功识别
× 1.00 元/小时
= 100 元

生产预算还应包括:

  • 音频预处理。
  • 网络传输。
  • 后端服务器。
  • 存储。
  • 监控。
  • 人工修正。
  • 重试流量。
  • 下游语言模型处理。

ASR 费用只是完整转写系统的一部分。

元宝与产品集成

腾讯表示,元宝参与了该模型的开发,并且是首个集成该模型的腾讯产品。

用户可以通过元宝中的语音输入体验该功能,该模型旨在改进:

  • 方言识别。
  • 上下文纠错。
  • 困难声学条件下的识别。

腾讯表示,WorkBuddy 等其他产品正在逐步接入。

消费级产品的集成方式可能与腾讯云预览版公开 API 有所不同。

例如,元宝可能使用内部服务、产品特定上下文或尚未向外部开发者开放的部署配置。

不应假设元宝中的体验与公开 API 参数一一对应。

适用场景

Hy ASR 3.0 预览版定位于短时、低延迟的语音交互。

智能客服

潜在用途包括:

  • 坐席实时转写。
  • 语音机器人指令识别。
  • 通话纪要生成。
  • 意图提取。
  • 质检辅助。

预览版目前缺乏说话人分离功能,这可能会限制多方通话的转写,除非有其他组件进行声道或说话人分离。

实时字幕

该引擎可支持以下场景的短时实时字幕:

  • 直播视频。
  • 音频房间。
  • 内部会议。
  • 语音消息。
  • 无障碍界面。

应用应测试部分结果稳定性和标点行为。

语音搜索

上下文感知识别可改善涉及以下内容的搜索:

  • 长句自然语言问题。
  • 产品名称。
  • 中英混说。
  • 区域性发音。

在预览版开放热词注入之前,罕见

目录术语可能仍需要后处理或单独的错误修正层。

语音命令与助手

引擎可以将口语指令转换为文本,用于:

  • AI助手。
  • 企业智能体。
  • 智能设备控制。
  • 工作流命令。

命令系统绝不应仅仅因为某个转写结果看起来置信度很高就执行高影响操作。

对于破坏性或财务类操作,应确认解析出的意图并要求用户明确批准。

内容理解

短音频片段可以在送入以下流程之前进行转写:

  • 摘要生成。
  • 分类。
  • 搜索索引。
  • 内容审核。
  • 知识提取。

下游每一步AI处理的质量都取决于转写结果。

在政策允许的情况下,存储原始音频或置信度证据,以便不确定的输出可以被审查。

当前局限性

预览状态

该产品仍标记为预览版或内部测试版。

界面、定价、限制和支持的功能可能发生变化。

六十秒输入限制

当前公共API不能直接替代长录音的批量转写。

长音频需要分段处理,并可能需要应用层面的上下文层。

仅支持PCM输入

预览版目前要求16 kHz单声道PCM。

许多生产环境使用MP3、AAC、Opus或电话编解码器,需要进行转换。

不支持说话人分离

当前引擎专属文档说明不支持说话人分离。

多说话人转写可能需要单独的音频通道或其他说话人分离服务。

上下文和热词功能尚未公开

根据官方文档,已公布的能力尚未作为可用的预览API功能公开。

公司报告的基准数据

基准图表来自腾讯。

在匹配条件下进行独立评估将增强比较的可信度。

没有完整的技术论文

腾讯对Hy ASR 3.0预览版的架构和训练过程进行了高层级描述,但尚未发布完整可复现的细节。

上下文可能导致过度修正

语言感知解码器可能更倾向于选择常见句子,而忽略不常见但实际正确说出的内容。

测试中必须包含罕见和出人意料的短语。

实用评估清单

1. 构建领域测试集

至少包含数百条具有代表性的话语,而非少量干净的演示样本。

2. 保留原始参考文本

使用明确的规范化策略创建人工核验的参考转写。

决定如何处理:

  • 标点符号。
  • 数字。
  • 英文大小写。
  • 填充词。
  • 重复内容。
  • 繁体中文和简体中文。

3. 测量多项指标

使用:

  • 词错误率或字符错误率。
  • 名称准确率。
  • 数字准确率。
  • 语义错误率。
  • 延迟。
  • 部分结果修订率。
  • 失败率。

4. 分别测试方言

不要将所有方言说话人合并为一个平均值。

按地区和录音条件分别报告结果。

5. 测试上下文歧义

创建声学内容相似但句子上下文改变正确转写结果的成对样本。

6. 测试罕见术语

评估产品名称和

现在先处理术语,待腾讯开放热词支持后重复测试。

7. 测试噪声与耳语场景

使用真实环境录音,而非仅使用数字方式叠加的噪声。

8. 测试分段边界

确认 60 秒的分段实现不会切断重要语句,也不会产生重复文本。

9. 测量端到端延迟

包括以下环节:

采集
+ 上传
+ 识别
+ 结果定稿
+ 下游处理

10. 审查隐私与合规要求

语音录音可能包含个人或敏感信息。

在部署前,应明确数据保留、访问权限、加密、用户同意及删除策略。

Hy ASR 3.0 预览版与传统 ASR 流水线对比

领域 传统流水线 Hy ASR 3.0 方向
主要关注点 声学到文本的准确率 声学识别加上下文语言建模
易混淆同音词 通常依赖局部概率判断 使用更广泛的句子上下文
方言 独立模型或覆盖有限 单一文档化混合引擎,支持 20 种方言
专业词汇 外部热词或自定义模型 已宣布热词能力;预览版支持待开放
复杂语音 声学模型加后处理 语音语言联合训练加后期训练
输出 转写文本 上下文更连贯的转写文本
主要风险 声学替换与漏字 声学错误加可能的语义过度修正

新方法并不消除传统 ASR 工程的需求。

它是在同一个端到端系统上增加了更强的语言层。

常见问题

Hy ASR 3.0 预览版是什么?

Hy ASR 3.0 预览版是腾讯混元基于 Hy3 语言基座和自研语音编码器推出的实时语音识别模型。其设计目标是将声学识别与上下文语言理解相结合。

Hy ASR 3.0 支持哪些语言和方言?

腾讯云文档显示支持中文普通话、英语以及 20 种中文方言或地域变体,包括粤语、东北话、河南话、陕西话、成都话、重庆话、武汉话等。不同说话人和地区的准确率可能有所差异。

公布的 WER(词错误率)是多少?

腾讯公布聚合公共基准测试的 WER 结果为:普通话 3.34%,英语 2.62%,粤语 3.12%。这些是公司基于多个数据集汇总报告的结果,并非独立复现的统一测试结果。

Hy ASR 3.0 可以转写长录音吗?

当前公开预览版每次输入最多接受 60 秒音频。更长的录音需要分段处理,且应用需在各分段之间保留有效上下文。

当前 API 是否支持热词和自定义上下文?

根据腾讯云 2026 年 8 月 4 日的预览版文档,目前尚不支持。发布材料中描述了这些能力,但官方 API 页面显示上下文输入和热词增强功能将在后续开放。

支持哪些音频格式?

当前 Hy ASR 3.0 预览版文档指定支持 16 kHz 单声道 PCM 输入。使用 MP3、AAC、Opus 或其他格式的应用必须在调用前进行音频转换。

将其发送到此引擎。

开发者如何调用 Hy ASR 3.0?

开发者使用腾讯云的实时语音识别 WebSocket API,并将 engine_model_type 设置为 Hy-ASR-3.0-preview。连接必须使用腾讯云凭证进行签名。

Hy ASR 3.0 免费吗?

腾讯云当前的计费页面未列出大模型 2.0 识别的免费音频配额。页面显示预付费套餐起价为 60 小时 1 元人民币/小时,后付费为 1 元人民币/小时,同时包含 20 路并发。

相关工具

  • 腾讯云混元 ASR 预览:Hy ASR 3.0 预览版的官方功能、限制、方言和快速接入文档。
  • 腾讯云实时 ASR WebSocket API:官方端点、认证参数、引擎选择和响应文档。
  • 腾讯云 API Explorer:腾讯官方用于检查 API 和生成 SDK 请求示例的接口。
  • 腾讯云 Python SDK:用于腾讯云 API 和凭证管理的官方 Python SDK。
  • FFmpeg:一个开源音视频工具包,可用于将输入音频转换为兼容的采样率和声道布局。
  • Websocat:一个命令行 WebSocket 客户端,适合在开发期间测试流式端点。

相关链接

总结

腾讯混元的 Hy ASR 3.0 预览版将语音编码器与 Hy3 的语言模型能力相结合,以改善普通话、英语、方言、混合语言、嘈杂环境和上下文相关的转写效果。

腾讯报告称,在聚合公开数据集上,普通话的 WER 为 3.34%,英语为 2.62%,粤语为 3.12%,同时在其内部场景测试中取得了领先结果。这些数字令人期待,但仍需在各机构自身的音频上进行验证。

当前的腾讯云预览版比完整的发布愿景范围更窄。

它支持实时WebSocket识别、16 kHz单声道PCM,以及最长60秒的音频输入。外部上下文注入、热词增强、说话人分离及其他若干功能在该引擎上尚不可用。

关键变化并非语音识别不再聆听声音,而在于语言模型如今协助判断声音最可能表达的含义。