Tencent Hunyuan Hy ASR 3.0 Preview: Reconhecimento de fala sensível ao contexto para mandarim, inglês e 20 dialetos

A Tencent Hunyuan lançou o Hy ASR 3.0 Preview, um novo modelo de reconhecimento de fala em tempo real baseado nas capacidades de compreensão de linguagem do Hy3. O modelo visa melhorar a precisão do reconhecimento, especialmente em cenários multilíngues e de múltiplos dialetos, aproveitando totalmente as informações contextuais para aprimorar o desempenho do reconhecimento de fala.

发布于 2026年8月5日generalGEO 评分: 07 次阅读
Esta é a imagem ilustrativa do guia de preview do Tencent Hunyuan Hy ASR 3.0, com um design tecnológico em azul-escuro. Os elementos visuais incluem o título central em destaque 'Hy ASR 3.0 Preview Guide', abaixo do qual estão indicados os módulos principais como WER, reconhecimento contextual, dialetos, API e Limites. À esquerda, há ícones de ondas sonoras e microfone; à direita, uma interface de API com ícone de código e ícones de nós de idiomas múltiplos interconectados. A imagem também reflete as características principais do modelo ASR mencionadas no título: suporte a mandarim, inglês e 20 dialetos, com capacidade de reconhecimento de fala sensível ao contexto.

Visualização do Hy ASR 3.0 da Tencent: Reconhecimento de voz que não apenas ouve, mas entende o contexto

Introdução

A Tencent anunciou o Hy ASR 3.0 Preview, um novo modelo de reconhecimento de fala em tempo real construído sobre a capacidade de compreensão de linguagem do Hy3.

O modelo foi projetado para levar o reconhecimento automático de fala além da decodificação acústica isolada.

Os sistemas tradicionais de ASR respondem principalmente a uma pergunta:

Qual sequência de palavras corresponde melhor a este áudio?

O Hy ASR 3.0 adiciona uma segunda pergunta:

Qual transcrição faz mais sentido no contexto?

Essa distinção é crucial quando o áudio contém:

  • Palavras homófonas.
  • Sotaques regionais.
  • Dialetos.
  • Mistura de chinês e inglês.
  • Nomes de produtos e pessoas.
  • Ruído de fundo.
  • Sussurros ou fala em volume baixo.
  • Frases longas ou expressões com forte dependência semântica.

A Tencent afirma que o modelo combina um sistema acústico de alta precisão com a modelagem de contexto e o raciocínio semântico do Hy3. O objetivo não é reescrever criativamente o que o usuário disse, mas usar o contexto linguístico para selecionar a transcrição mais plausível quando o áudio em si é ambíguo.

A Tencent relatou uma taxa de erro de palavras (WER) de 3,34% para mandarim, 2,62% para inglês e 3,12% para cantonês em conjuntos de avaliação públicos agregados.

O Hy ASR 3.0 Preview já está disponível com documentação como mecanismo WebSocket em tempo real da Tencent Cloud e foi integrado ao assistente Tencent Yuanbao. O WorkBuddy e outros produtos da Tencent estão sendo integrados gradualmente.

A versão de visualização pública já está disponível, mas ainda não atingiu a forma final do produto descrita no anúncio mais amplo. Suas limitações atuais de API são relevantes para equipes que planejam integrações de produção.

Resultados de benchmarks públicos divulgados

A Tencent avaliou o Hy ASR 3.0 Preview em vários conjuntos de dados públicos de fala e o comparou com outros sistemas de ASR.

As taxas de erro de palavras agregadas relatadas pela empresa são as seguintes:

Idioma ou variante de fala WER do Hy ASR 3.0 Preview
Mandarim 3,34%
Inglês 2,62%
Cantonês 3,12%

Quanto menor o WER, melhor.

A imagem mostra uma comparação das taxas de erro de palavras (WER, %) do Hy ASR 3.0 Preview em três idiomas ou dialetos: chinês, inglês e cantonês. O WER do Hy ASR 3.0 Preview é de 3,34% para o chinês, 2,62% para o inglês e 3,12% para o cantonês. Também são listados dados de WER de outros sistemas, como Doubao-Seed-ASR 2.0, Qwen 3 ASR e Qwen-audio-3.0-ASR Flash. A nota abaixo da imagem explica que valores mais baixos indicam maior precisão de reconhecimento, os dados provêm de conjuntos de avaliação de código aberto e lista os nomes dos conjuntos de dados de código aberto para cada idioma ou dialeto.

As notas do gráfico indicam que a avaliação agregada utilizou os seguintes conjuntos de dados:

  • WenetSpeechMeeting.
  • WenetSpeechNet.
  • FLEURS chinês.
  • LibriSpeech clean.
  • LibriSpeech other.
  • FLEURS inglês.
  • MLS inglês.
  • FLEURS cantonês.
  • Common Voice cantonês.

Os dados agregados são úteis para comparações amplas, mas também podem ocultar diferenças importantes.

O desempenho do modelo pode variar em diferentes cenários:

  • Fala lida versus conversa espontânea.
  • Microfones de campo próximo versus microfones de campo distante.
  • Áudio de estúdio limpo versus ruído de rua.
  • Comandos curtos versus discussões contínuas.
  • Falantes nativos versus fala com sotaque.
  • Mandarim formal versus alternância de código.

Portanto, as equipes de produção devem testar com seu próprio áudio.

Em vez de escolher um modelo de ASR apenas com base no número de WER de um único título.

O que a taxa de erro de palavras mede

A taxa de erro de palavras é normalmente definida como:

WER = (substituições + exclusões + inserções) / número de palavras de referência

Os três tipos de erro são:

  • Substituição: o modelo produziu uma palavra incorreta.
  • Exclusão: uma palavra falada foi omitida na transcrição.
  • Inserção: a transcrição contém uma palavra que não foi dita.

Um WER mais baixo geralmente indica uma transcrição mais precisa.

No entanto, o WER não cobre todas as falhas em cenários do mundo real.

Considere dois erros de uma única palavra:

"Envie o pedido amanhã"
→ "Envie o pedido hoje"

E:

"A cor é azul-marinho"
→ "A cor é azul marinho"

Ambos podem produzir contagens de erro semelhantes, mas o primeiro pode alterar uma ação comercial, enquanto o segundo pode não ter nenhum impacto para o negócio.

Para setores como atendimento ao cliente, saúde, finanças, manufatura e interfaces de comando, as equipes devem avaliar tanto o impacto semântico quanto o WER.

Avaliação de cenários internos da Tencent

A Tencent também divulgou resultados de conjuntos de avaliação internos que abrangem quatro categorias práticas:

  1. Reconhecimento geral de fala.
  2. Reconhecimento de dialetos.
  3. Compreensão de contexto.
  4. Condições acústicas complexas, como alto ruído e sussurros.

Os resultados relatados são os seguintes:

Categoria de avaliação interna WER do Hy ASR 3.0 Preview
Reconhecimento geral 4,95%
Reconhecimento de dialetos 9,31%
Avaliação de contexto 4,76%
Condições acústicas complexas 6,36%

Este gráfico de barras apresenta as taxas de erro de palavras (WER; valores mais baixos indicam reconhecimento mais preciso) de quatro sistemas de reconhecimento de fala, incluindo o Hy ASR 3.0 Preview da Tencent, em quatro categorias de conjunto de avaliação: conjunto de avaliação geral, conjunto de avaliação de dialetos, conjunto de avaliação de contexto e conjunto de avaliação de cenários acústicos complexos (alto ruído/sussurros). No conjunto de avaliação geral, o WER do sistema é de 4,35%, superando os outros três sistemas; nos demais conjuntos de avaliação, o WER do sistema também é o mais baixo entre as quatro categorias, sendo 9,31% no conjunto de dialetos, 4,25% no conjunto de contexto e 6,36% no conjunto de cenários acústicos complexos. Os resultados da avaliação de cenários internos exibidos no gráfico correspondem ao desempenho do Hy ASR 3.0 Preview nas quatro categorias de tarefas da avaliação interna divulgada pela Tencent.

A Tencent afirma que o Hy ASR 3.0 Preview alcançou o menor WER entre os sistemas comparados em todas as quatro categorias internas.

Esses resultados são úteis como evidência de produto relatada pela empresa, mas os conjuntos de testes internos não são benchmarks públicos neutros.

Antes da adoção, as organizações devem perguntar:

  • Quais regiões de sotaque e dialeto foram incluídas nos testes?
  • Qual é o nível de ruído do áudio?
  • Como a pontuação foi normalizada?
  • Números e termos em inglês foram padronizados antes da pontuação?
  • Os sistemas comparados foram configurados com palavras-chave ou contexto?
  • Quantas amostras de fala foram usadas?
  • O teste incluiu os microfones e canais que a organização realmente utiliza?

Quatro melhorias voltadas para o usuário

A Tencent resume as melhorias práticas em quatro áreas.

1. Reconhecimento geral mais preciso

O modelo foi projetado para melhorar o reconhecimento nos seguintes cenários:

  • Mandarim padrão.
  • Inglês.
  • Cantonês.
  • Dialetos regionais.
  • Mistura de chinês e inglês.
  • Diferentes falantes e sotaques.

A Tencent também afirma que o modelo reduz erros cumulativos em enunciados mais longos.

Essa afirmação descreve a capacidade subjacente do modelo. A versão Preview atual da Tencent Cloud ainda limita a entrada pública da API a 60 segundos por chamada; portanto, aplicações que processam reuniões ou gravações precisam segmentar o áudio atualmente.

E gerenciar o contexto entre os segmentos por conta própria.

Uma segmentação inadequada pode reintroduzir os problemas que o modelo foi projetado para resolver.

Por exemplo, cortar o áudio em limites arbitrários de 60 segundos pode interromper:

  • O nome completo de uma pessoa.
  • Um código de produto.
  • Uma frase com resolução semântica tardia.
  • Frases mistas entre chinês e inglês.
  • Autocorreções do falante.

Portanto, a lógica de segmentação deve preservar ao máximo os limites de sentença e os limites de atividade de fala.

2. Melhor contexto e reconhecimento de intenção

A fala contém muitos sons ambíguos.

O mandarim possui um grande número de homófonos. O inglês tem palavras e nomes com pronúncias semelhantes. Sotaques regionais podem fazer com que múltiplas transcrições candidatas pareçam acusticamente plausíveis.

Decodificadores tradicionais podem escolher a palavra com maior probabilidade local.

Sistemas com capacidade de percepção de contexto podem avaliar a fala completa.

Por exemplo, um usuário pode dizer uma frase que pode ser transcrita como dois homófonos diferentes. Palavras relacionadas a finanças, jogos, medicina ou viagens nas proximidades podem indicar qual significado é mais provável.

O fluxo de processamento pretendido pode ser simplificado como:

Características de áudio
→ Palavras candidatas
→ Contexto da sentença
→ Verificação de consistência semântica
→ Texto transcrito final

Isso não significa que o modelo possa realmente compreender a fala da mesma forma que um humano.

Em vez disso, significa que os componentes de linguagem utilizam uma janela de contexto mais ampla e probabilidades semânticas para melhorar as decisões de transcrição.

Sistemas ASR com percepção de contexto também trazem novos riscos: correção semântica excessiva.

O modelo pode, às vezes, substituir uma frase incomum, mas foneticamente correta, por uma frase comum que parece mais fluente.

Portanto, a avaliação em ambiente de produção deve incluir:

  • Nomes próprios raros.
  • Expressões deliberadamente incomuns.
  • Terminologia de novos produtos.
  • Abreviações de domínio.
  • Frases contraditórias ou inesperadas.

O objetivo é usar o contexto sem inventar conteúdo de fala que nunca foi pronunciado.

3. Adaptação mais fácil a vocabulário especializado

Os materiais de divulgação destacam o aprimoramento por palavras-chave, aplicável a:

  • Nomes de marcas.
  • Nomes de produtos.
  • Nomes de pessoas.
  • Termos do setor.
  • Abreviações.
  • Vocabulário interno.

Quando um modelo genérico não tem frequência suficiente de ocorrência para uma palavra rara, as palavras-chave podem agregar valor significativo.

Exemplos incluem:

Nomes de medicamentos patenteados
Modelos de máquinas de fábrica
Códigos de conta de clientes
Marcas recém-lançadas
Abreviações técnicas

O produto ASR genérico da Tencent Cloud já possui API de lista de palavras-chave e o parâmetro hotword_id.

No entanto, a documentação atual do preview do Hy ASR 3.0 declara explicitamente que o aprimoramento por palavras-chave ainda não está disponível para este mecanismo de preview.

Portanto, deve-se distinguir entre as promoções públicas do produto e o status real da API acessível:

Capacidade Notas de lançamento do modelo Status atual da API de preview
Aprimoramento por palavras-chave Descrito como capacidade suportada Listado como "em breve"
Entrada de contexto Descrito como capacidade principal Listado como "em breve"
Modelagem de linguagem contextual interna Característica central do modelo Disponível por meio do comportamento do modelo

Até que a Tencent Cloud confirme o suporte na documentação oficial da API, as empresas não devem planejar lançamentos que dependam de injeção de contexto externo ou listas de palavras-chave.

4. Reconhecimento mais estável em condições acústicas difíceis

A Tencent afirma que o modelo foi otimizado para as seguintes situações:

  • Alto ruído de fundo.
  • Sussurros.
  • Fala em voz baixa.
  • Diferentes ambientes de gravação.
  • Múltiplos sotaques.
  • Condições acústicas de cauda longa.

A robustez ao ruído é importante porque a fala real raramente aparece como gravações limpas de laboratório.

Microfones de atendimento ao cliente podem capturar sons de teclado e colegas falando ao lado.

Assistentes móveis podem ouvir ruído de trânsito, vento, música ou outras pessoas falando.

Aplicativos de reunião podem receber áudio compactado de microfones de laptops distantes.

O modelo pode melhorar a robustez, mas não pode recuperar informações que nunca foram capturadas.

As equipes ainda devem usar:

  • Microfones adequados.
  • Cancelamento de eco.
  • Controle de ganho.
  • Detecção de atividade de fala quando suportada.
  • Compactação de áudio razoável.
  • Monitoramento de canais.
  • Fluxos de repetição ou esclarecimento.

A qualidade do ASR é uma propriedade do sistema, não apenas do modelo.

Arquitetura: Hy3 mais codificador de fala

A Tencent afirma que o Hybrid Hy ASR 3.0 Preview combina três grandes componentes:

  1. Base do modelo de linguagem MoE baseado no Hy3.
  2. Codificador de fala não supervisionado proprietário.
  3. Pré-treinamento conjunto e pós-treinamento em múltiplos estágios.

Esta imagem mostra a arquitetura central e as melhorias de capacidade do Tencent Hybrid Hy ASR 3.0 Preview, contendo três partes principais. A primeira parte é a atualização da arquitetura, usando Hy3 como base, combinada com o Encoder de fala proprietário, alcançando uma condução dupla para melhorar a capacidade de compreensão de fala. A segunda parte é o Scaling de pré-treinamento, por meio de modelagem conjunta de dados de múltiplas fontes, treinando o modelo de fala e linguagem em conjunto, injetando capacidades de múltiplos estágios, suportando reconhecimento multilíngue e contextual. A terceira parte é o aprimoramento de pós-treinamento, otimizado para áudio complexo e contexto arbitrário, por meio de aprendizado por reforço em múltiplos estágios para melhorar a capacidade do modelo, alcançando, em última instância, uma atualização abrangente da capacidade geral.

Hy3 como base de linguagem

O Hy3 fornece o componente de compreensão de linguagem.

Suas funções incluem:

  • Modelar o contexto da sentença.
  • Resolver candidatos ambíguos.
  • Compreender estruturas de linguagem mista.
  • Utilizar relações semânticas.
  • Melhorar a coerência da saída.

A Tencent descreve a arquitetura como um design de Mistura de Especialistas (MoE) que equilibra capacidade e eficiência.

A documentação pública de ASR não divulga o número total de parâmetros, parâmetros ativos, perfil de latência ou arquitetura completa de inferência do Hy ASR 3.0 Preview.

Codificador de fala não supervisionado

O codificador de fala converte o áudio bruto em representações acústicas que o modelo de linguagem pode processar.

A Tencent afirma que o codificador foi treinado com dezenas de milhões de horas de fala não rotulada.

O treinamento de áudio não supervisionado ou autossupervisionado é valioso porque transcrever manualmente dados de fala nessa escala é proibitivamente caro.

O codificador pode aprender estruturas recorrentes a partir do áudio bruto, como:

  • Padrões de fala.
  • Diferenças entre falantes.
  • Variações de sotaque.
  • Condições de fundo.
  • Tempo e prosódia.

A qualidade dessa representação afeta todos os estágios subsequentes.

Se dois sons forem confundidos no estágio do codificador, o modelo de linguagem terá que depender mais do contexto para recuperar as palavras corretas.

Pré-treinamento conjunto de fala e linguagem

A Tencent afirma que o codificador de fala e o modelo de linguagem foram treinados em conjunto usando conjuntos de dados de fala de múltiplas fontes em larga escala, cobrindo:

  • Dialetos.
  • Sotaques.
  • Ambientes acústicos.
  • Diferentes grupos de falantes.
  • Padrões de linguagem contextual.
  • Treinamento

O objetivo é reduzir a lacuna entre o reconhecimento acústico e a compreensão da linguagem.

Em vez de tratar o reconhecimento de fala como:

Modelo de áudio conclui
→ Modelo de linguagem limpa a transcrição depois

O Hy ASR 3.0 é apresentado como um processo mais integrado:

Representação de fala e modelagem de linguagem
→ Treinados para trabalhar juntos
→ Saída de uma transcrição contextualizada

As fronteiras internas exatas entre codificador, decodificador, modelo de linguagem e estágios de aprendizado por reforço não foram totalmente divulgadas.

## SFT e aprendizado por reforço em múltiplos estágios

A Tencent descreve um esquema de ajuste fino supervisionado que cobre:

- Transcrição geral.
- Tarefas de contexto arbitrário.
- Terminologia especializada.
- Diferentes ambientes acústicos.
- Grupos diversificados de falantes.
- Dez principais regiões de dialeto.
- Mais de 20 regiões de dialeto menores.

A empresa também relata o uso de aprendizado por reforço em múltiplos estágios, para:

- Precisão geral de transcrição.
- Comportamento contextual.
- Casos complexos de cauda longa.
- Redução de erros de substituição e exclusão.

Atualmente, não há artigo técnico público fornecendo o design completo de recompensa, proporção de dados, poder computacional de treinamento ou resultados de experimentos de ablação.

Portanto, as declarações de arquitetura devem ser vistas como descrições técnicas no nível do produto, não como especificações de pesquisa reproduzíveis.

## Idiomas e dialetos suportados atualmente pelos mecanismos da Tencent Cloud

A documentação da Tencent Cloud descreve o mecanismo atual `Hy-ASR-3.0-preview` como suportando:

- Mandarim.
- Inglês.
- 20 dialetos chineses ou variantes regionais.

A lista de dialetos documentada é a seguinte:

| Nº | Dialeto ou variante regional |
|-|-|
| 1 | Cantonês |
| 2 | Nordestino |
| 3 | Henanês |
| 4 | Dialeto de Shaanxi |
| 5 | Chengduês |
| 6 | Chongqingnês |
| 7 | Wuhanês |
| 8 | Guiyangnês |
| 9 | Qingdaonês |
| 10 | Jinanês |
| 11 | Changshanês |
| 12 | Hefeinês |
| 13 | Dialeto de Hebei |
| 14 | Kunmingnês |
| 15 | Lanzhounês |
| 16 | Yinchuanês |
| 17 | Nanchangnês |
| 18 | Pequinês |
| 19 | Sichuanês |
| 20 | Tianjinês |

Os rótulos de dialeto na documentação comercial de ASR são categorias amplas de produto.

A fala real dentro de cada categoria varia conforme cidade, idade, contexto social, alternância de código, vocabulário e falante.

Afirmar suporte a um dialeto não deve ser interpretado como precisão idêntica para todos os falantes daquela região.

## Disponibilidade atual da prévia

A Tencent Cloud adicionou o mecanismo de prévia Hy ASR 3.0 ao produto WebSocket em tempo real em **4 de agosto de 2026**.

Este serviço público é atualmente descrito como versão de teste interno ou prévia.

| Item | Status documentado atual |
|-|-|
| Tipo de produto | Reconhecimento de fala em tempo real |
| Método de integração | API WebSocket da Tencent Cloud |
| Nome do mecanismo | `Hy-ASR-3.0-preview` |
| Duração do áudio | Máximo de 60 segundos por entrada |
| Formato de áudio | PCM mono de 16 kHz |
| Concorrência incluída | 20 conexões simultâneas |
| Mandarim | Suportado |
| Inglês | Suportado |
| 20 dialetos | Suportados |
| Separação de falantes | Não suportado na prévia |
| Suporte a parâmetros VAD | Listado como não suportado na prévia |
| Substituição de palavras | Não suportado na prévia |

Parâmetro de limite de ruído | Não suportado na prévia |
| Entrada de contexto externo | Em breve |
| Aprimoramento de palavra de ativação | Em breve |

A referência geral da API WebSocket inclui parâmetros usados por outros mecanismos, incluindo VAD e ID de palavra de ativação.

O Hy ASR 3.0 segue as notas específicas da prévia do mecanismo.

A presença de um parâmetro no modo de API compartilhada não garante que o mecanismo de prévia já implemente esse parâmetro.

## Fluxo básico de integração com a Tencent Cloud

A configuração oficial é dividida em três etapas principais.

## Etapa 1: Ativar o serviço de reconhecimento de fala da Tencent Cloud

Abra o serviço de reconhecimento de fala da Tencent Cloud e conclua o processo de ativação da conta.

A documentação oficial de início rápido está em:

```Plaintext
https://cloud.tencent.com/document/product/1093/54362

Antes de habilitar a cobrança pós-paga, consulte as instruções de faturamento.

A Tencent Cloud informa que novas contas têm a cobrança pós-paga desativada por padrão, sendo necessário ativá-la manualmente.

Etapa 2: Criar credenciais da API

Crie ou obtenha:

  • AppID
  • SecretID
  • SecretKey

Essas credenciais são usadas para assinar as solicitações de conexão WebSocket.

Armazene-as em um gerenciador de segredos ou em variáveis de ambiente protegidas.

Não coloque credenciais de longa duração em:

  • Código JavaScript no front-end.
  • Código-fonte de aplicativos móveis.
  • Repositórios públicos de código.
  • Documentos compartilhados.
  • URLs visíveis ao cliente.

Para produtos em navegador ou mobile, crie as informações de conexão assinadas em um back-end confiável.

Etapa 3: Conectar-se ao endpoint WebSocket em tempo real

O formato do endpoint documentado pela Tencent Cloud é:

wss://asr.cloud.tencent.com/asr/v2/<appid>?{request_parameters}

Substitua <appid> pelo seu AppID da Tencent Cloud.

A solicitação inclui parâmetros de assinatura, como:

  • secretid
  • timestamp
  • expired
  • nonce
  • voice_id
  • engine_model_type

Para a prévia do Hy ASR 3.0, defina:

engine_model_type=Hy-ASR-3.0-preview

Cada conexão WebSocket requer um voice_id exclusivo.

Se a conexão for encerrada ou falhar, o voice_id antigo se torna inválido e um novo deve ser gerado.

Etapa 4: Preparar áudio compatível

A prévia atual exige:

Taxa de amostragem: 16 kHz
Canais: mono
Formato: PCM
Duração máxima de entrada: 60 segundos

Teste todo o fluxo de áudio, não apenas o arquivo bruto.

SDKs de microfone, APIs de mídia do navegador, sistemas telefônicos e plataformas de reunião podem reamostrar ou comprimir o áudio antes de ele chegar ao servidor.

Etapa 5: Transmitir áudio em fluxo contínuo e ler resultados incrementais

O serviço suporta transcrição em tempo real, retornando texto enquanto o áudio é enviado.

O aplicativo deve tratar:

  • Resultados parciais.
  • Resultados finais.
  • Erros de conexão.
  • Falhas de autenticação.
  • Tempos limite.
  • Reconexões.
  • Limites de duração do áudio.
  • Texto duplicado ou revisado.

Não presuma que cada resultado parcial de reconhecimento seja definitivo.

A interface de ASR em tempo real pode revisar palavras anteriores à medida que mais contexto é obtido.

A interface do usuário deve distinguir entre texto provisório e texto confirmado.

Etapa 6: Testes antes do lançamento

Construa um conjunto de avaliação representativo, incluindo:

  • Áudio real de clientes.
  • Sotaques comuns.
  • Dialetos.
  • Mistura de chinês e inglês.
  • Nomes de pessoas e termos de produtos.

Ruído.

  • Sussurros.
  • Má qualidade de microfone.
  • Comandos curtos.
  • Frases completas.

Meça tanto a qualidade do reconhecimento quanto o comportamento do sistema.

Preço do mecanismo de prévia

A Tencent Cloud classifica o Hy ASR 3.0 prévia como mecanismo de reconhecimento de fala em tempo real Grand Model 2.0.

A página de cobrança atual lista:

Opção de cobrança Preço atual
Pacote pré-pago de 60 horas Total de 60 yuan, ou seja, 1,00 yuan/hora
Pacote pré-pago de 1.000 horas Total de 950 yuan, ou seja, 0,95 yuan/hora
Pacote pré-pago de 10.000 horas Total de 9.000 yuan, ou seja, 0,90 yuan/hora
Pacote pré-pago de 100.000 horas Total de 88.000 yuan, ou seja, 0,88 yuan/hora
Pacote pré-pago de 300.000 horas Total de 255.000 yuan, ou seja, 0,85 yuan/hora
Pós-pago 1,00 yuan/hora, cobrado diariamente

A tabela de preços atual da Tencent mostra que o reconhecimento Grand Model 2.0 não possui franquia gratuita de áudio.

Os 20 canais simultâneos incluídos são uma cota de concorrência, não um tempo gratuito de reconhecimento.

Os preços podem mudar. Antes de emitir cotações comerciais ou estimar orçamentos de longo prazo, consulte a página de cobrança em tempo real.

Exemplo de custo

Com base no preço atual pós-pago de 1,00 yuan/hora:

100 horas de reconhecimento bem-sucedido
× 1,00 yuan/hora
= 100 yuan

O orçamento de produção também deve incluir:

  • Pré-processamento de áudio.
  • Transmissão de rede.
  • Servidores de back-end.
  • Armazenamento.
  • Monitoramento.
  • Correção manual.
  • Tráfego de repetição.
  • Processamento downstream com modelos de linguagem.

A taxa de ASR é apenas uma parte do sistema completo de transcrição.

Integração com Yuanbao e produtos

A Tencent afirma que o Yuanbao participou do desenvolvimento deste modelo e foi o primeiro produto da Tencent a integrá-lo.

Os usuários podem experimentar o recurso por meio da entrada de voz no Yuanbao, e o modelo foi projetado para melhorar:

  • Reconhecimento de dialetos.
  • Correção contextual de erros.
  • Reconhecimento em condições acústicas difíceis.

A Tencent informa que outros produtos, como o WorkBuddy, estão sendo gradualmente integrados.

A integração em produtos de consumo pode diferir da API pública da prévia da Tencent Cloud.

Por exemplo, o Yuanbao pode usar serviços internos, contexto específico do produto ou configurações de implantação ainda não abertas a desenvolvedores externos.

Não se deve presumir que a experiência no Yuanbao corresponda um a um aos parâmetros da API pública.

Cenários de aplicação

O Hy ASR 3.0 prévia é voltado para interações de voz curtas e de baixa latência.

Atendimento inteligente ao cliente

Usos potenciais incluem:

  • Transcrição em tempo real para agentes.
  • Reconhecimento de comandos para chatbots de voz.
  • Geração de resumos de chamadas.
  • Extração de intenção.
  • Apoio à garantia de qualidade.

A prévia atualmente não possui separação de falantes, o que pode limitar a transcrição de chamadas multipartitas, a menos que outros componentes façam a separação por canal ou falante.

Legendas em tempo real

O mecanismo pode suportar legendas curtas em tempo real para:

  • Vídeos ao vivo.
  • Salas de áudio.
  • Reuniões internas.
  • Mensagens de voz.
  • Interfaces de acessibilidade.

Os aplicativos devem testar a estabilidade dos resultados parciais e o comportamento de pontuação.

Busca por voz

O reconhecimento sensível ao contexto pode melhorar buscas envolvendo:

  • Perguntas naturais em frases longas.
  • Nomes de produtos.
  • Mistura de chinês e inglês.
  • Pronúncias regionais.

Até que a injeção de palavras personalizadas seja liberada na prévia, termos raros

e de domínio específico podem ainda exigir pós-processamento ou uma camada separada de correção de erros.

Comandos de voz e assistentes

O mecanismo pode converter instruções faladas em texto para:

  • Assistentes de IA.
  • Agentes inteligentes empresariais.

Controle de dispositivos inteligentes.

  • Comandos de fluxo de trabalho.

O sistema de comandos nunca deve executar ações de alto impacto apenas porque um resultado de transcrição parece ter alta confiança.

Para operações destrutivas ou financeiras, deve-se confirmar a intenção interpretada e exigir aprovação explícita do usuário.

Compreensão de conteúdo

Segmentos de áudio curtos podem ser transcritos antes de serem enviados aos seguintes fluxos:

  • Geração de resumos.
  • Classificação.
  • Indexação de busca.
  • Moderação de conteúdo.
  • Extração de conhecimento.

A qualidade de cada etapa do processamento de IA downstream depende do resultado da transcrição.

Quando as políticas permitirem, armazene o áudio original ou as evidências de confiança para que saídas incertas possam ser revisadas.

Limitações atuais

Status de pré-visualização

Este produto ainda está marcado como versão de pré-visualização ou teste interno.

A interface, os preços, as limitações e os recursos suportados podem mudar.

Limite de entrada de sessenta segundos

A API pública atual não pode substituir diretamente a transcrição em lote de gravações longas.

Áudio longo precisa ser processado em segmentos, e pode exigir uma camada de contexto no nível do aplicativo.

Suporte apenas para entrada PCM

A versão de pré-visualização atualmente exige PCM mono de 16 kHz.

Muitos ambientes de produção usam MP3, AAC, Opus ou codecs de telefonia, sendo necessária a conversão.

Sem suporte para separação de falantes

A documentação exclusiva do motor atual afirma que não há suporte para separação de falantes.

A transcrição com múltiplos falantes pode exigir canais de áudio separados ou outros serviços de separação de falantes.

Recursos de contexto e palavras-chave ainda não públicos

De acordo com a documentação oficial, as capacidades anunciadas ainda não foram disponibilizadas como recursos públicos da API de pré-visualização.

Dados de referência relatados pela empresa

Os gráficos de referência vêm da Tencent.

Uma avaliação independente sob condições equivalentes aumentaria a credibilidade da comparação.

Sem artigo técnico completo

A Tencent forneceu uma descrição de alto nível da arquitetura e do processo de treinamento do Hy ASR 3.0 pré-visualização, mas ainda não publicou detalhes completos e reproduzíveis.

O contexto pode causar correção excessiva

O decodificador sensível à linguagem pode favorecer frases comuns e ignorar conteúdos incomuns, mas realmente falados.

Os testes devem incluir frases raras e inesperadas.

Lista de verificação de avaliação prática

1. Construa um conjunto de testes do domínio

Inclua pelo menos centenas de falas representativas, em vez de algumas amostras limpas de demonstração.

2. Preserve o texto de referência original

Crie transcrições de referência verificadas manualmente usando uma estratégia de normalização clara.

Decida como lidar com:

  • Pontuação.
  • Números.
  • Maiúsculas e minúsculas em inglês.
  • Palavras de preenchimento.
  • Conteúdo repetido.
  • Chinês tradicional e chinês simplificado.

3. Meça múltiplas métricas

Use:

  • Taxa de erro de palavras ou taxa de erro de caracteres.
  • Precisão de nomes.
  • Precisão numérica.
  • Taxa de erro semântico.
  • Latência.
  • Taxa de revisão de resultados parciais.
  • Taxa de falhas.

4. Teste os dialetos separadamente

Não combine todos os falantes de dialetos em uma única média.

Relate os resultados separadamente por região e condições de gravação.

5. Teste a ambiguidade contextual

Crie pares de amostras com conteúdo acústico semelhante, mas onde o contexto da frase altera o resultado correto da transcrição.

6. Teste termos raros

Avalie nomes de produtos e

termos técnicos primeiro, e repita o teste depois que a Tencent abrir o suporte a palavras-chave.

7. Teste cenários de ruído e sussurro

Use gravações reais de ambiente, e não apenas ruído sobreposto digitalmente.

8. Teste os limites de segmentação

Confirme se a implementação de segmentação de 60 segundos não corta frases importantes nem gera texto duplicado.

9. Meça a latência de ponta a ponta

Inclua as seguintes etapas:

Captura
+ Upload
+ Reconhecimento
+ Finalização do resultado
+ Processamento downstream

10. Revise os requisitos de privacidade e conformidade

Gravações de voz podem conter informações pessoais ou sensíveis.

Antes da implantação, políticas de retenção de dados, acesso, criptografia, consentimento do usuário e exclusão devem ser definidas.

Comparação entre o Hy ASR 3.0 pré-visualização e o pipeline ASR tradicional

Área Pipeline tradicional Direção do Hy ASR 3.0
Foco principal Precisão de áudio para texto Reconhecimento acústico mais modelagem de linguagem contextual
Homófonos fáceis de confundir Geralmente depende de probabilidades locais Usa contexto de frase mais amplo
Dialetos Modelos independentes ou cobertura limitada Um único motor híbrido documentado, com suporte a 20 dialetos
Vocabulário especializado Palavras-chave externas ou modelos personalizados Capacidade de palavras-chave anunciada; suporte na pré-visualização a ser liberado
Fala complexa Modelo acústico mais pós-processamento Treinamento conjunto de fala e linguagem mais pós-treinamento
Saída Texto transcrito Texto transcrito com contexto mais coeso
Principal risco Substituições acústicas e omissão de caracteres Erros acústicos mais possível correção semântica excessiva

A nova abordagem não elimina as necessidades da engenharia ASR tradicional.

Ela adiciona uma camada de linguagem mais forte sobre o mesmo sistema de ponta a ponta.

Perguntas frequentes

O que é o Hy ASR 3.0 pré-visualização?

O Hy ASR 3.0 pré-visualização é um modelo de reconhecimento de fala em tempo real lançado pela Tencent Hunyuan, baseado na base de linguagem Hy3 e em um codificador de fala proprietário. Seu objetivo de design é combinar reconhecimento acústico com compreensão contextual da linguagem.

Quais idiomas e dialetos o Hy ASR 3.0 suporta?

A documentação do Tencent Cloud mostra suporte a mandarim padrão, inglês e 20 dialetos chineses ou variantes regionais, incluindo cantonês, dialeto do nordeste (dongbeihua), dialeto de Henan, dialeto de Shaanxi, dialeto de Chengdu, dialeto de Chongqing, dialeto de Wuhan, entre outros. A precisão pode variar entre falantes e regiões diferentes.

Qual é o WER (Word Error Rate - Taxa de Erro de Palavras) divulgado?

A Tencent divulgou resultados agregados de WER em benchmarks públicos: mandarim 3,34%, inglês 2,62% e cantonês 3,12%. Esses são resultados relatados pela empresa, agregados a partir de vários conjuntos de dados, e não são resultados de um teste unificado reproduzido de forma independente.

O Hy ASR 3.0 pode transcrever gravações longas?

A pré-visualização pública atual aceita no máximo 60 segundos de áudio por entrada. Gravações mais longas exigem processamento segmentado, e o aplicativo deve preservar contexto efetivo entre os segmentos.

A API atual suporta palavras-chave e contexto personalizado?

De acordo com a documentação de pré-visualização do Tencent Cloud de 4 de agosto de 2026, ainda não há suporte. Essas capacidades são descritas nos materiais de lançamento, mas as páginas oficiais da API mostram que a entrada de contexto e o aprimoramento por palavras-chave serão abertos futuramente.

Quais formatos de áudio são suportados?

A documentação atual do Hy ASR 3.0 pré-visualização especifica suporte a entrada PCM mono de 16 kHz. Aplicativos que usam MP3, AAC, Opus ou outros formatos devem converter o áudio antes de chamar

este mecanismo.

Como os desenvolvedores podem chamar o Hy ASR 3.0?

Os desenvolvedores usam a API WebSocket de reconhecimento de fala em tempo real do Tencent Cloud e definem engine_model_type como Hy-ASR-3.0-preview. A conexão deve ser assinada usando as credenciais do Tencent Cloud.

O Hy ASR 3.0 é gratuito?

A página de precificação atual do Tencent Cloud não lista uma cota gratuita de áudio para o reconhecimento do modelo grande 2.0. A página mostra pacotes pré-pagos a partir de 60 horas com preço de 1 RMB por hora, e pós-pago a 1 RMB por hora, com 20 canais concorrentes incluídos.

Ferramentas relacionadas

  • Pré-visualização do Tencent Cloud Hunyuan ASR: Documentação oficial sobre recursos, limitações, dialetos e integração rápida do Hy ASR 3.0 pré-visualização.
  • API WebSocket de ASR em tempo real do Tencent Cloud: Documentação oficial de endpoints, parâmetros de autenticação, seleção de mecanismos e respostas.
  • API Explorer do Tencent Cloud: Interface oficial da Tencent para verificar APIs e gerar exemplos de solicitações do SDK.
  • SDK Python do Tencent Cloud: SDK Python oficial para APIs e gerenciamento de credenciais do Tencent Cloud.
  • FFmpeg: Um kit de ferramentas de áudio e vídeo de código aberto que pode ser usado para converter áudio de entrada para a taxa de amostragem e o layout de canais compatíveis.
  • Websocat: Um cliente WebSocket de linha de comando, adequado para testar endpoints de streaming durante o desenvolvimento.

Links relacionados

com/document/product/1093/135476): status oficial atual, dialetos suportados, limitações e configuração básica.

Resumo

A pré-visualização do Hy ASR 3.0 da Tencent Hunyuan combina o codificador de fala com as capacidades do modelo de linguagem Hy3 para melhorar a transcrição em mandarim, inglês, dialetos, linguagem mista, ambientes ruidosos e contextos dependentes.

A Tencent relatou uma WER de 3,34% para mandarim, 2,62% para inglês e 3,12% para cantonês em conjuntos de dados públicos agregados, além de obter resultados líderes em seus testes de cenário interno. Esses números são promissores, mas ainda precisam ser validados no áudio de cada organização.

A pré-visualização atual da Tencent Cloud tem um escopo mais limitado do que a visão completa do lançamento.

Ela suporta reconhecimento em tempo real via WebSocket, PCM mono de 16 kHz e entrada de áudio de até 60 segundos. Injeção de contexto externo, aprimoramento por palavras-chave, diarização de falantes e vários outros recursos ainda não estão disponíveis neste mecanismo.

A mudança fundamental não é que o reconhecimento de fala deixou de ouvir a voz, mas sim que o modelo de linguagem agora auxilia a determinar o que a voz mais provavelmente significa.