Tencent Hunyuan Hy ASR 3.0 Preview: Reconhecimento de fala sensível ao contexto para mandarim, inglês e 20 dialetos
A Tencent Hunyuan lançou o Hy ASR 3.0 Preview, um novo modelo de reconhecimento de fala em tempo real baseado nas capacidades de compreensão de linguagem do Hy3. O modelo visa melhorar a precisão do reconhecimento, especialmente em cenários multilíngues e de múltiplos dialetos, aproveitando totalmente as informações contextuais para aprimorar o desempenho do reconhecimento de fala.

Visualização do Hy ASR 3.0 da Tencent: Reconhecimento de voz que não apenas ouve, mas entende o contexto
Introdução
A Tencent anunciou o Hy ASR 3.0 Preview, um novo modelo de reconhecimento de fala em tempo real construído sobre a capacidade de compreensão de linguagem do Hy3.
O modelo foi projetado para levar o reconhecimento automático de fala além da decodificação acústica isolada.
Os sistemas tradicionais de ASR respondem principalmente a uma pergunta:
Qual sequência de palavras corresponde melhor a este áudio?
O Hy ASR 3.0 adiciona uma segunda pergunta:
Qual transcrição faz mais sentido no contexto?
Essa distinção é crucial quando o áudio contém:
- Palavras homófonas.
- Sotaques regionais.
- Dialetos.
- Mistura de chinês e inglês.
- Nomes de produtos e pessoas.
- Ruído de fundo.
- Sussurros ou fala em volume baixo.
- Frases longas ou expressões com forte dependência semântica.
A Tencent afirma que o modelo combina um sistema acústico de alta precisão com a modelagem de contexto e o raciocínio semântico do Hy3. O objetivo não é reescrever criativamente o que o usuário disse, mas usar o contexto linguístico para selecionar a transcrição mais plausível quando o áudio em si é ambíguo.
A Tencent relatou uma taxa de erro de palavras (WER) de 3,34% para mandarim, 2,62% para inglês e 3,12% para cantonês em conjuntos de avaliação públicos agregados.
O Hy ASR 3.0 Preview já está disponível com documentação como mecanismo WebSocket em tempo real da Tencent Cloud e foi integrado ao assistente Tencent Yuanbao. O WorkBuddy e outros produtos da Tencent estão sendo integrados gradualmente.
A versão de visualização pública já está disponível, mas ainda não atingiu a forma final do produto descrita no anúncio mais amplo. Suas limitações atuais de API são relevantes para equipes que planejam integrações de produção.
Resultados de benchmarks públicos divulgados
A Tencent avaliou o Hy ASR 3.0 Preview em vários conjuntos de dados públicos de fala e o comparou com outros sistemas de ASR.
As taxas de erro de palavras agregadas relatadas pela empresa são as seguintes:
| Idioma ou variante de fala | WER do Hy ASR 3.0 Preview |
|---|---|
| Mandarim | 3,34% |
| Inglês | 2,62% |
| Cantonês | 3,12% |
Quanto menor o WER, melhor.

As notas do gráfico indicam que a avaliação agregada utilizou os seguintes conjuntos de dados:
- WenetSpeechMeeting.
- WenetSpeechNet.
- FLEURS chinês.
- LibriSpeech clean.
- LibriSpeech other.
- FLEURS inglês.
- MLS inglês.
- FLEURS cantonês.
- Common Voice cantonês.
Os dados agregados são úteis para comparações amplas, mas também podem ocultar diferenças importantes.
O desempenho do modelo pode variar em diferentes cenários:
- Fala lida versus conversa espontânea.
- Microfones de campo próximo versus microfones de campo distante.
- Áudio de estúdio limpo versus ruído de rua.
- Comandos curtos versus discussões contínuas.
- Falantes nativos versus fala com sotaque.
- Mandarim formal versus alternância de código.
Portanto, as equipes de produção devem testar com seu próprio áudio.
Em vez de escolher um modelo de ASR apenas com base no número de WER de um único título.
O que a taxa de erro de palavras mede
A taxa de erro de palavras é normalmente definida como:
WER = (substituições + exclusões + inserções) / número de palavras de referência
Os três tipos de erro são:
- Substituição: o modelo produziu uma palavra incorreta.
- Exclusão: uma palavra falada foi omitida na transcrição.
- Inserção: a transcrição contém uma palavra que não foi dita.
Um WER mais baixo geralmente indica uma transcrição mais precisa.
No entanto, o WER não cobre todas as falhas em cenários do mundo real.
Considere dois erros de uma única palavra:
"Envie o pedido amanhã"
→ "Envie o pedido hoje"
E:
"A cor é azul-marinho"
→ "A cor é azul marinho"
Ambos podem produzir contagens de erro semelhantes, mas o primeiro pode alterar uma ação comercial, enquanto o segundo pode não ter nenhum impacto para o negócio.
Para setores como atendimento ao cliente, saúde, finanças, manufatura e interfaces de comando, as equipes devem avaliar tanto o impacto semântico quanto o WER.
Avaliação de cenários internos da Tencent
A Tencent também divulgou resultados de conjuntos de avaliação internos que abrangem quatro categorias práticas:
- Reconhecimento geral de fala.
- Reconhecimento de dialetos.
- Compreensão de contexto.
- Condições acústicas complexas, como alto ruído e sussurros.
Os resultados relatados são os seguintes:
| Categoria de avaliação interna | WER do Hy ASR 3.0 Preview |
|---|---|
| Reconhecimento geral | 4,95% |
| Reconhecimento de dialetos | 9,31% |
| Avaliação de contexto | 4,76% |
| Condições acústicas complexas | 6,36% |

A Tencent afirma que o Hy ASR 3.0 Preview alcançou o menor WER entre os sistemas comparados em todas as quatro categorias internas.
Esses resultados são úteis como evidência de produto relatada pela empresa, mas os conjuntos de testes internos não são benchmarks públicos neutros.
Antes da adoção, as organizações devem perguntar:
- Quais regiões de sotaque e dialeto foram incluídas nos testes?
- Qual é o nível de ruído do áudio?
- Como a pontuação foi normalizada?
- Números e termos em inglês foram padronizados antes da pontuação?
- Os sistemas comparados foram configurados com palavras-chave ou contexto?
- Quantas amostras de fala foram usadas?
- O teste incluiu os microfones e canais que a organização realmente utiliza?
Quatro melhorias voltadas para o usuário
A Tencent resume as melhorias práticas em quatro áreas.
1. Reconhecimento geral mais preciso
O modelo foi projetado para melhorar o reconhecimento nos seguintes cenários:
- Mandarim padrão.
- Inglês.
- Cantonês.
- Dialetos regionais.
- Mistura de chinês e inglês.
- Diferentes falantes e sotaques.
A Tencent também afirma que o modelo reduz erros cumulativos em enunciados mais longos.
Essa afirmação descreve a capacidade subjacente do modelo. A versão Preview atual da Tencent Cloud ainda limita a entrada pública da API a 60 segundos por chamada; portanto, aplicações que processam reuniões ou gravações precisam segmentar o áudio atualmente.
E gerenciar o contexto entre os segmentos por conta própria.
Uma segmentação inadequada pode reintroduzir os problemas que o modelo foi projetado para resolver.
Por exemplo, cortar o áudio em limites arbitrários de 60 segundos pode interromper:
- O nome completo de uma pessoa.
- Um código de produto.
- Uma frase com resolução semântica tardia.
- Frases mistas entre chinês e inglês.
- Autocorreções do falante.
Portanto, a lógica de segmentação deve preservar ao máximo os limites de sentença e os limites de atividade de fala.
2. Melhor contexto e reconhecimento de intenção
A fala contém muitos sons ambíguos.
O mandarim possui um grande número de homófonos. O inglês tem palavras e nomes com pronúncias semelhantes. Sotaques regionais podem fazer com que múltiplas transcrições candidatas pareçam acusticamente plausíveis.
Decodificadores tradicionais podem escolher a palavra com maior probabilidade local.
Sistemas com capacidade de percepção de contexto podem avaliar a fala completa.
Por exemplo, um usuário pode dizer uma frase que pode ser transcrita como dois homófonos diferentes. Palavras relacionadas a finanças, jogos, medicina ou viagens nas proximidades podem indicar qual significado é mais provável.
O fluxo de processamento pretendido pode ser simplificado como:
Características de áudio
→ Palavras candidatas
→ Contexto da sentença
→ Verificação de consistência semântica
→ Texto transcrito final
Isso não significa que o modelo possa realmente compreender a fala da mesma forma que um humano.
Em vez disso, significa que os componentes de linguagem utilizam uma janela de contexto mais ampla e probabilidades semânticas para melhorar as decisões de transcrição.
Sistemas ASR com percepção de contexto também trazem novos riscos: correção semântica excessiva.
O modelo pode, às vezes, substituir uma frase incomum, mas foneticamente correta, por uma frase comum que parece mais fluente.
Portanto, a avaliação em ambiente de produção deve incluir:
- Nomes próprios raros.
- Expressões deliberadamente incomuns.
- Terminologia de novos produtos.
- Abreviações de domínio.
- Frases contraditórias ou inesperadas.
O objetivo é usar o contexto sem inventar conteúdo de fala que nunca foi pronunciado.
3. Adaptação mais fácil a vocabulário especializado
Os materiais de divulgação destacam o aprimoramento por palavras-chave, aplicável a:
- Nomes de marcas.
- Nomes de produtos.
- Nomes de pessoas.
- Termos do setor.
- Abreviações.
- Vocabulário interno.
Quando um modelo genérico não tem frequência suficiente de ocorrência para uma palavra rara, as palavras-chave podem agregar valor significativo.
Exemplos incluem:
Nomes de medicamentos patenteados
Modelos de máquinas de fábrica
Códigos de conta de clientes
Marcas recém-lançadas
Abreviações técnicas
O produto ASR genérico da Tencent Cloud já possui API de lista de palavras-chave e o parâmetro hotword_id.
No entanto, a documentação atual do preview do Hy ASR 3.0 declara explicitamente que o aprimoramento por palavras-chave ainda não está disponível para este mecanismo de preview.
Portanto, deve-se distinguir entre as promoções públicas do produto e o status real da API acessível:
| Capacidade | Notas de lançamento do modelo | Status atual da API de preview |
|---|---|---|
| Aprimoramento por palavras-chave | Descrito como capacidade suportada | Listado como "em breve" |
| Entrada de contexto | Descrito como capacidade principal | Listado como "em breve" |
| Modelagem de linguagem contextual interna | Característica central do modelo | Disponível por meio do comportamento do modelo |
Até que a Tencent Cloud confirme o suporte na documentação oficial da API, as empresas não devem planejar lançamentos que dependam de injeção de contexto externo ou listas de palavras-chave.
4. Reconhecimento mais estável em condições acústicas difíceis
A Tencent afirma que o modelo foi otimizado para as seguintes situações:
- Alto ruído de fundo.
- Sussurros.
- Fala em voz baixa.
- Diferentes ambientes de gravação.
- Múltiplos sotaques.
- Condições acústicas de cauda longa.
A robustez ao ruído é importante porque a fala real raramente aparece como gravações limpas de laboratório.
Microfones de atendimento ao cliente podem capturar sons de teclado e colegas falando ao lado.
Assistentes móveis podem ouvir ruído de trânsito, vento, música ou outras pessoas falando.
Aplicativos de reunião podem receber áudio compactado de microfones de laptops distantes.
O modelo pode melhorar a robustez, mas não pode recuperar informações que nunca foram capturadas.
As equipes ainda devem usar:
- Microfones adequados.
- Cancelamento de eco.
- Controle de ganho.
- Detecção de atividade de fala quando suportada.
- Compactação de áudio razoável.
- Monitoramento de canais.
- Fluxos de repetição ou esclarecimento.
A qualidade do ASR é uma propriedade do sistema, não apenas do modelo.
Arquitetura: Hy3 mais codificador de fala
A Tencent afirma que o Hybrid Hy ASR 3.0 Preview combina três grandes componentes:
- Base do modelo de linguagem MoE baseado no Hy3.
- Codificador de fala não supervisionado proprietário.
- Pré-treinamento conjunto e pós-treinamento em múltiplos estágios.

Hy3 como base de linguagem
O Hy3 fornece o componente de compreensão de linguagem.
Suas funções incluem:
- Modelar o contexto da sentença.
- Resolver candidatos ambíguos.
- Compreender estruturas de linguagem mista.
- Utilizar relações semânticas.
- Melhorar a coerência da saída.
A Tencent descreve a arquitetura como um design de Mistura de Especialistas (MoE) que equilibra capacidade e eficiência.
A documentação pública de ASR não divulga o número total de parâmetros, parâmetros ativos, perfil de latência ou arquitetura completa de inferência do Hy ASR 3.0 Preview.
Codificador de fala não supervisionado
O codificador de fala converte o áudio bruto em representações acústicas que o modelo de linguagem pode processar.
A Tencent afirma que o codificador foi treinado com dezenas de milhões de horas de fala não rotulada.
O treinamento de áudio não supervisionado ou autossupervisionado é valioso porque transcrever manualmente dados de fala nessa escala é proibitivamente caro.
O codificador pode aprender estruturas recorrentes a partir do áudio bruto, como:
- Padrões de fala.
- Diferenças entre falantes.
- Variações de sotaque.
- Condições de fundo.
- Tempo e prosódia.
A qualidade dessa representação afeta todos os estágios subsequentes.
Se dois sons forem confundidos no estágio do codificador, o modelo de linguagem terá que depender mais do contexto para recuperar as palavras corretas.
Pré-treinamento conjunto de fala e linguagem
A Tencent afirma que o codificador de fala e o modelo de linguagem foram treinados em conjunto usando conjuntos de dados de fala de múltiplas fontes em larga escala, cobrindo:
- Dialetos.
- Sotaques.
- Ambientes acústicos.
- Diferentes grupos de falantes.
- Padrões de linguagem contextual.
- Treinamento
O objetivo é reduzir a lacuna entre o reconhecimento acústico e a compreensão da linguagem.
Em vez de tratar o reconhecimento de fala como:
Modelo de áudio conclui
→ Modelo de linguagem limpa a transcrição depois
O Hy ASR 3.0 é apresentado como um processo mais integrado:
Representação de fala e modelagem de linguagem
→ Treinados para trabalhar juntos
→ Saída de uma transcrição contextualizada
As fronteiras internas exatas entre codificador, decodificador, modelo de linguagem e estágios de aprendizado por reforço não foram totalmente divulgadas.
## SFT e aprendizado por reforço em múltiplos estágios
A Tencent descreve um esquema de ajuste fino supervisionado que cobre:
- Transcrição geral.
- Tarefas de contexto arbitrário.
- Terminologia especializada.
- Diferentes ambientes acústicos.
- Grupos diversificados de falantes.
- Dez principais regiões de dialeto.
- Mais de 20 regiões de dialeto menores.
A empresa também relata o uso de aprendizado por reforço em múltiplos estágios, para:
- Precisão geral de transcrição.
- Comportamento contextual.
- Casos complexos de cauda longa.
- Redução de erros de substituição e exclusão.
Atualmente, não há artigo técnico público fornecendo o design completo de recompensa, proporção de dados, poder computacional de treinamento ou resultados de experimentos de ablação.
Portanto, as declarações de arquitetura devem ser vistas como descrições técnicas no nível do produto, não como especificações de pesquisa reproduzíveis.
## Idiomas e dialetos suportados atualmente pelos mecanismos da Tencent Cloud
A documentação da Tencent Cloud descreve o mecanismo atual `Hy-ASR-3.0-preview` como suportando:
- Mandarim.
- Inglês.
- 20 dialetos chineses ou variantes regionais.
A lista de dialetos documentada é a seguinte:
| Nº | Dialeto ou variante regional |
|-|-|
| 1 | Cantonês |
| 2 | Nordestino |
| 3 | Henanês |
| 4 | Dialeto de Shaanxi |
| 5 | Chengduês |
| 6 | Chongqingnês |
| 7 | Wuhanês |
| 8 | Guiyangnês |
| 9 | Qingdaonês |
| 10 | Jinanês |
| 11 | Changshanês |
| 12 | Hefeinês |
| 13 | Dialeto de Hebei |
| 14 | Kunmingnês |
| 15 | Lanzhounês |
| 16 | Yinchuanês |
| 17 | Nanchangnês |
| 18 | Pequinês |
| 19 | Sichuanês |
| 20 | Tianjinês |
Os rótulos de dialeto na documentação comercial de ASR são categorias amplas de produto.
A fala real dentro de cada categoria varia conforme cidade, idade, contexto social, alternância de código, vocabulário e falante.
Afirmar suporte a um dialeto não deve ser interpretado como precisão idêntica para todos os falantes daquela região.
## Disponibilidade atual da prévia
A Tencent Cloud adicionou o mecanismo de prévia Hy ASR 3.0 ao produto WebSocket em tempo real em **4 de agosto de 2026**.
Este serviço público é atualmente descrito como versão de teste interno ou prévia.
| Item | Status documentado atual |
|-|-|
| Tipo de produto | Reconhecimento de fala em tempo real |
| Método de integração | API WebSocket da Tencent Cloud |
| Nome do mecanismo | `Hy-ASR-3.0-preview` |
| Duração do áudio | Máximo de 60 segundos por entrada |
| Formato de áudio | PCM mono de 16 kHz |
| Concorrência incluída | 20 conexões simultâneas |
| Mandarim | Suportado |
| Inglês | Suportado |
| 20 dialetos | Suportados |
| Separação de falantes | Não suportado na prévia |
| Suporte a parâmetros VAD | Listado como não suportado na prévia |
| Substituição de palavras | Não suportado na prévia |
Parâmetro de limite de ruído | Não suportado na prévia |
| Entrada de contexto externo | Em breve |
| Aprimoramento de palavra de ativação | Em breve |
A referência geral da API WebSocket inclui parâmetros usados por outros mecanismos, incluindo VAD e ID de palavra de ativação.
O Hy ASR 3.0 segue as notas específicas da prévia do mecanismo.
A presença de um parâmetro no modo de API compartilhada não garante que o mecanismo de prévia já implemente esse parâmetro.
## Fluxo básico de integração com a Tencent Cloud
A configuração oficial é dividida em três etapas principais.
## Etapa 1: Ativar o serviço de reconhecimento de fala da Tencent Cloud
Abra o serviço de reconhecimento de fala da Tencent Cloud e conclua o processo de ativação da conta.
A documentação oficial de início rápido está em:
```Plaintext
https://cloud.tencent.com/document/product/1093/54362
Antes de habilitar a cobrança pós-paga, consulte as instruções de faturamento.
A Tencent Cloud informa que novas contas têm a cobrança pós-paga desativada por padrão, sendo necessário ativá-la manualmente.
Etapa 2: Criar credenciais da API
Crie ou obtenha:
AppIDSecretIDSecretKey
Essas credenciais são usadas para assinar as solicitações de conexão WebSocket.
Armazene-as em um gerenciador de segredos ou em variáveis de ambiente protegidas.
Não coloque credenciais de longa duração em:
- Código JavaScript no front-end.
- Código-fonte de aplicativos móveis.
- Repositórios públicos de código.
- Documentos compartilhados.
- URLs visíveis ao cliente.
Para produtos em navegador ou mobile, crie as informações de conexão assinadas em um back-end confiável.
Etapa 3: Conectar-se ao endpoint WebSocket em tempo real
O formato do endpoint documentado pela Tencent Cloud é:
wss://asr.cloud.tencent.com/asr/v2/<appid>?{request_parameters}
Substitua <appid> pelo seu AppID da Tencent Cloud.
A solicitação inclui parâmetros de assinatura, como:
secretidtimestampexpirednoncevoice_idengine_model_type
Para a prévia do Hy ASR 3.0, defina:
engine_model_type=Hy-ASR-3.0-preview
Cada conexão WebSocket requer um voice_id exclusivo.
Se a conexão for encerrada ou falhar, o voice_id antigo se torna inválido e um novo deve ser gerado.
Etapa 4: Preparar áudio compatível
A prévia atual exige:
Taxa de amostragem: 16 kHz
Canais: mono
Formato: PCM
Duração máxima de entrada: 60 segundos
Teste todo o fluxo de áudio, não apenas o arquivo bruto.
SDKs de microfone, APIs de mídia do navegador, sistemas telefônicos e plataformas de reunião podem reamostrar ou comprimir o áudio antes de ele chegar ao servidor.
Etapa 5: Transmitir áudio em fluxo contínuo e ler resultados incrementais
O serviço suporta transcrição em tempo real, retornando texto enquanto o áudio é enviado.
O aplicativo deve tratar:
- Resultados parciais.
- Resultados finais.
- Erros de conexão.
- Falhas de autenticação.
- Tempos limite.
- Reconexões.
- Limites de duração do áudio.
- Texto duplicado ou revisado.
Não presuma que cada resultado parcial de reconhecimento seja definitivo.
A interface de ASR em tempo real pode revisar palavras anteriores à medida que mais contexto é obtido.
A interface do usuário deve distinguir entre texto provisório e texto confirmado.
Etapa 6: Testes antes do lançamento
Construa um conjunto de avaliação representativo, incluindo:
- Áudio real de clientes.
- Sotaques comuns.
- Dialetos.
- Mistura de chinês e inglês.
- Nomes de pessoas e termos de produtos.
Ruído.
- Sussurros.
- Má qualidade de microfone.
- Comandos curtos.
- Frases completas.
Meça tanto a qualidade do reconhecimento quanto o comportamento do sistema.
Preço do mecanismo de prévia
A Tencent Cloud classifica o Hy ASR 3.0 prévia como mecanismo de reconhecimento de fala em tempo real Grand Model 2.0.
A página de cobrança atual lista:
| Opção de cobrança | Preço atual |
|---|---|
| Pacote pré-pago de 60 horas | Total de 60 yuan, ou seja, 1,00 yuan/hora |
| Pacote pré-pago de 1.000 horas | Total de 950 yuan, ou seja, 0,95 yuan/hora |
| Pacote pré-pago de 10.000 horas | Total de 9.000 yuan, ou seja, 0,90 yuan/hora |
| Pacote pré-pago de 100.000 horas | Total de 88.000 yuan, ou seja, 0,88 yuan/hora |
| Pacote pré-pago de 300.000 horas | Total de 255.000 yuan, ou seja, 0,85 yuan/hora |
| Pós-pago | 1,00 yuan/hora, cobrado diariamente |
A tabela de preços atual da Tencent mostra que o reconhecimento Grand Model 2.0 não possui franquia gratuita de áudio.
Os 20 canais simultâneos incluídos são uma cota de concorrência, não um tempo gratuito de reconhecimento.
Os preços podem mudar. Antes de emitir cotações comerciais ou estimar orçamentos de longo prazo, consulte a página de cobrança em tempo real.
Exemplo de custo
Com base no preço atual pós-pago de 1,00 yuan/hora:
100 horas de reconhecimento bem-sucedido
× 1,00 yuan/hora
= 100 yuan
O orçamento de produção também deve incluir:
- Pré-processamento de áudio.
- Transmissão de rede.
- Servidores de back-end.
- Armazenamento.
- Monitoramento.
- Correção manual.
- Tráfego de repetição.
- Processamento downstream com modelos de linguagem.
A taxa de ASR é apenas uma parte do sistema completo de transcrição.
Integração com Yuanbao e produtos
A Tencent afirma que o Yuanbao participou do desenvolvimento deste modelo e foi o primeiro produto da Tencent a integrá-lo.
Os usuários podem experimentar o recurso por meio da entrada de voz no Yuanbao, e o modelo foi projetado para melhorar:
- Reconhecimento de dialetos.
- Correção contextual de erros.
- Reconhecimento em condições acústicas difíceis.
A Tencent informa que outros produtos, como o WorkBuddy, estão sendo gradualmente integrados.
A integração em produtos de consumo pode diferir da API pública da prévia da Tencent Cloud.
Por exemplo, o Yuanbao pode usar serviços internos, contexto específico do produto ou configurações de implantação ainda não abertas a desenvolvedores externos.
Não se deve presumir que a experiência no Yuanbao corresponda um a um aos parâmetros da API pública.
Cenários de aplicação
O Hy ASR 3.0 prévia é voltado para interações de voz curtas e de baixa latência.
Atendimento inteligente ao cliente
Usos potenciais incluem:
- Transcrição em tempo real para agentes.
- Reconhecimento de comandos para chatbots de voz.
- Geração de resumos de chamadas.
- Extração de intenção.
- Apoio à garantia de qualidade.
A prévia atualmente não possui separação de falantes, o que pode limitar a transcrição de chamadas multipartitas, a menos que outros componentes façam a separação por canal ou falante.
Legendas em tempo real
O mecanismo pode suportar legendas curtas em tempo real para:
- Vídeos ao vivo.
- Salas de áudio.
- Reuniões internas.
- Mensagens de voz.
- Interfaces de acessibilidade.
Os aplicativos devem testar a estabilidade dos resultados parciais e o comportamento de pontuação.
Busca por voz
O reconhecimento sensível ao contexto pode melhorar buscas envolvendo:
- Perguntas naturais em frases longas.
- Nomes de produtos.
- Mistura de chinês e inglês.
- Pronúncias regionais.
Até que a injeção de palavras personalizadas seja liberada na prévia, termos raros
e de domínio específico podem ainda exigir pós-processamento ou uma camada separada de correção de erros.
Comandos de voz e assistentes
O mecanismo pode converter instruções faladas em texto para:
- Assistentes de IA.
- Agentes inteligentes empresariais.
Controle de dispositivos inteligentes.
- Comandos de fluxo de trabalho.
O sistema de comandos nunca deve executar ações de alto impacto apenas porque um resultado de transcrição parece ter alta confiança.
Para operações destrutivas ou financeiras, deve-se confirmar a intenção interpretada e exigir aprovação explícita do usuário.
Compreensão de conteúdo
Segmentos de áudio curtos podem ser transcritos antes de serem enviados aos seguintes fluxos:
- Geração de resumos.
- Classificação.
- Indexação de busca.
- Moderação de conteúdo.
- Extração de conhecimento.
A qualidade de cada etapa do processamento de IA downstream depende do resultado da transcrição.
Quando as políticas permitirem, armazene o áudio original ou as evidências de confiança para que saídas incertas possam ser revisadas.
Limitações atuais
Status de pré-visualização
Este produto ainda está marcado como versão de pré-visualização ou teste interno.
A interface, os preços, as limitações e os recursos suportados podem mudar.
Limite de entrada de sessenta segundos
A API pública atual não pode substituir diretamente a transcrição em lote de gravações longas.
Áudio longo precisa ser processado em segmentos, e pode exigir uma camada de contexto no nível do aplicativo.
Suporte apenas para entrada PCM
A versão de pré-visualização atualmente exige PCM mono de 16 kHz.
Muitos ambientes de produção usam MP3, AAC, Opus ou codecs de telefonia, sendo necessária a conversão.
Sem suporte para separação de falantes
A documentação exclusiva do motor atual afirma que não há suporte para separação de falantes.
A transcrição com múltiplos falantes pode exigir canais de áudio separados ou outros serviços de separação de falantes.
Recursos de contexto e palavras-chave ainda não públicos
De acordo com a documentação oficial, as capacidades anunciadas ainda não foram disponibilizadas como recursos públicos da API de pré-visualização.
Dados de referência relatados pela empresa
Os gráficos de referência vêm da Tencent.
Uma avaliação independente sob condições equivalentes aumentaria a credibilidade da comparação.
Sem artigo técnico completo
A Tencent forneceu uma descrição de alto nível da arquitetura e do processo de treinamento do Hy ASR 3.0 pré-visualização, mas ainda não publicou detalhes completos e reproduzíveis.
O contexto pode causar correção excessiva
O decodificador sensível à linguagem pode favorecer frases comuns e ignorar conteúdos incomuns, mas realmente falados.
Os testes devem incluir frases raras e inesperadas.
Lista de verificação de avaliação prática
1. Construa um conjunto de testes do domínio
Inclua pelo menos centenas de falas representativas, em vez de algumas amostras limpas de demonstração.
2. Preserve o texto de referência original
Crie transcrições de referência verificadas manualmente usando uma estratégia de normalização clara.
Decida como lidar com:
- Pontuação.
- Números.
- Maiúsculas e minúsculas em inglês.
- Palavras de preenchimento.
- Conteúdo repetido.
- Chinês tradicional e chinês simplificado.
3. Meça múltiplas métricas
Use:
- Taxa de erro de palavras ou taxa de erro de caracteres.
- Precisão de nomes.
- Precisão numérica.
- Taxa de erro semântico.
- Latência.
- Taxa de revisão de resultados parciais.
- Taxa de falhas.
4. Teste os dialetos separadamente
Não combine todos os falantes de dialetos em uma única média.
Relate os resultados separadamente por região e condições de gravação.
5. Teste a ambiguidade contextual
Crie pares de amostras com conteúdo acústico semelhante, mas onde o contexto da frase altera o resultado correto da transcrição.
6. Teste termos raros
Avalie nomes de produtos e
termos técnicos primeiro, e repita o teste depois que a Tencent abrir o suporte a palavras-chave.
7. Teste cenários de ruído e sussurro
Use gravações reais de ambiente, e não apenas ruído sobreposto digitalmente.
8. Teste os limites de segmentação
Confirme se a implementação de segmentação de 60 segundos não corta frases importantes nem gera texto duplicado.
9. Meça a latência de ponta a ponta
Inclua as seguintes etapas:
Captura
+ Upload
+ Reconhecimento
+ Finalização do resultado
+ Processamento downstream
10. Revise os requisitos de privacidade e conformidade
Gravações de voz podem conter informações pessoais ou sensíveis.
Antes da implantação, políticas de retenção de dados, acesso, criptografia, consentimento do usuário e exclusão devem ser definidas.
Comparação entre o Hy ASR 3.0 pré-visualização e o pipeline ASR tradicional
| Área | Pipeline tradicional | Direção do Hy ASR 3.0 |
|---|---|---|
| Foco principal | Precisão de áudio para texto | Reconhecimento acústico mais modelagem de linguagem contextual |
| Homófonos fáceis de confundir | Geralmente depende de probabilidades locais | Usa contexto de frase mais amplo |
| Dialetos | Modelos independentes ou cobertura limitada | Um único motor híbrido documentado, com suporte a 20 dialetos |
| Vocabulário especializado | Palavras-chave externas ou modelos personalizados | Capacidade de palavras-chave anunciada; suporte na pré-visualização a ser liberado |
| Fala complexa | Modelo acústico mais pós-processamento | Treinamento conjunto de fala e linguagem mais pós-treinamento |
| Saída | Texto transcrito | Texto transcrito com contexto mais coeso |
| Principal risco | Substituições acústicas e omissão de caracteres | Erros acústicos mais possível correção semântica excessiva |
A nova abordagem não elimina as necessidades da engenharia ASR tradicional.
Ela adiciona uma camada de linguagem mais forte sobre o mesmo sistema de ponta a ponta.
Perguntas frequentes
O que é o Hy ASR 3.0 pré-visualização?
O Hy ASR 3.0 pré-visualização é um modelo de reconhecimento de fala em tempo real lançado pela Tencent Hunyuan, baseado na base de linguagem Hy3 e em um codificador de fala proprietário. Seu objetivo de design é combinar reconhecimento acústico com compreensão contextual da linguagem.
Quais idiomas e dialetos o Hy ASR 3.0 suporta?
A documentação do Tencent Cloud mostra suporte a mandarim padrão, inglês e 20 dialetos chineses ou variantes regionais, incluindo cantonês, dialeto do nordeste (dongbeihua), dialeto de Henan, dialeto de Shaanxi, dialeto de Chengdu, dialeto de Chongqing, dialeto de Wuhan, entre outros. A precisão pode variar entre falantes e regiões diferentes.
Qual é o WER (Word Error Rate - Taxa de Erro de Palavras) divulgado?
A Tencent divulgou resultados agregados de WER em benchmarks públicos: mandarim 3,34%, inglês 2,62% e cantonês 3,12%. Esses são resultados relatados pela empresa, agregados a partir de vários conjuntos de dados, e não são resultados de um teste unificado reproduzido de forma independente.
O Hy ASR 3.0 pode transcrever gravações longas?
A pré-visualização pública atual aceita no máximo 60 segundos de áudio por entrada. Gravações mais longas exigem processamento segmentado, e o aplicativo deve preservar contexto efetivo entre os segmentos.
A API atual suporta palavras-chave e contexto personalizado?
De acordo com a documentação de pré-visualização do Tencent Cloud de 4 de agosto de 2026, ainda não há suporte. Essas capacidades são descritas nos materiais de lançamento, mas as páginas oficiais da API mostram que a entrada de contexto e o aprimoramento por palavras-chave serão abertos futuramente.
Quais formatos de áudio são suportados?
A documentação atual do Hy ASR 3.0 pré-visualização especifica suporte a entrada PCM mono de 16 kHz. Aplicativos que usam MP3, AAC, Opus ou outros formatos devem converter o áudio antes de chamar
este mecanismo.
Como os desenvolvedores podem chamar o Hy ASR 3.0?
Os desenvolvedores usam a API WebSocket de reconhecimento de fala em tempo real do Tencent Cloud e definem engine_model_type como Hy-ASR-3.0-preview. A conexão deve ser assinada usando as credenciais do Tencent Cloud.
O Hy ASR 3.0 é gratuito?
A página de precificação atual do Tencent Cloud não lista uma cota gratuita de áudio para o reconhecimento do modelo grande 2.0. A página mostra pacotes pré-pagos a partir de 60 horas com preço de 1 RMB por hora, e pós-pago a 1 RMB por hora, com 20 canais concorrentes incluídos.
Ferramentas relacionadas
- Pré-visualização do Tencent Cloud Hunyuan ASR: Documentação oficial sobre recursos, limitações, dialetos e integração rápida do Hy ASR 3.0 pré-visualização.
- API WebSocket de ASR em tempo real do Tencent Cloud: Documentação oficial de endpoints, parâmetros de autenticação, seleção de mecanismos e respostas.
- API Explorer do Tencent Cloud: Interface oficial da Tencent para verificar APIs e gerar exemplos de solicitações do SDK.
- SDK Python do Tencent Cloud: SDK Python oficial para APIs e gerenciamento de credenciais do Tencent Cloud.
- FFmpeg: Um kit de ferramentas de áudio e vídeo de código aberto que pode ser usado para converter áudio de entrada para a taxa de amostragem e o layout de canais compatíveis.
- Websocat: Um cliente WebSocket de linha de comando, adequado para testar endpoints de streaming durante o desenvolvimento.
Links relacionados
- [Documentação de pré-visualização do Hunyuan ASR](https://cloud.tencent.
com/document/product/1093/135476): status oficial atual, dialetos suportados, limitações e configuração básica.
- API de reconhecimento de fala em tempo real: referência do formato do endpoint WebSocket e parâmetros de solicitação.
- Guia de início rápido da API do servidor em um minuto: guia oficial da Tencent Cloud para ativação do serviço e credenciais.
- Preços do ASR da Tencent Cloud: informações atuais sobre pré-pago, pós-pago, concorrência e cota gratuita.
- Atualizações do produto ASR da Tencent Cloud: registro oficial de lançamentos, mostrando que o mecanismo de pré-visualização Hy ASR 3.0 foi adicionado em 4 de agosto de 2026.
- API de palavras-chave da Tencent Cloud: API oficial de lista de palavras-chave para ASR geral; o suporte na versão de pré-visualização do Hy ASR 3.0 ainda está marcado como em breve.
- Tencent Hunyuan: portal oficial do modelo Hunyuan e dos produtos.
Resumo
A pré-visualização do Hy ASR 3.0 da Tencent Hunyuan combina o codificador de fala com as capacidades do modelo de linguagem Hy3 para melhorar a transcrição em mandarim, inglês, dialetos, linguagem mista, ambientes ruidosos e contextos dependentes.
A Tencent relatou uma WER de 3,34% para mandarim, 2,62% para inglês e 3,12% para cantonês em conjuntos de dados públicos agregados, além de obter resultados líderes em seus testes de cenário interno. Esses números são promissores, mas ainda precisam ser validados no áudio de cada organização.
A pré-visualização atual da Tencent Cloud tem um escopo mais limitado do que a visão completa do lançamento.
Ela suporta reconhecimento em tempo real via WebSocket, PCM mono de 16 kHz e entrada de áudio de até 60 segundos. Injeção de contexto externo, aprimoramento por palavras-chave, diarização de falantes e vários outros recursos ainda não estão disponíveis neste mecanismo.
A mudança fundamental não é que o reconhecimento de fala deixou de ouvir a voz, mas sim que o modelo de linguagem agora auxilia a determinar o que a voz mais provavelmente significa.