Tencent Hunyuan Hy ASR 3.0 Vista previa: reconocimiento de voz consciente del contexto para mandarín, inglés y 20 dialectos
Tencent Hunyuan ha lanzado la vista previa de Hy ASR 3.0, un nuevo modelo de reconocimiento de voz en tiempo real basado en las capacidades de comprensión del lenguaje de Hy3. Este modelo está diseñado para mejorar la precisión del reconocimiento, especialmente en escenarios multilingües y de múltiples dialectos, aprovechando plenamente la información del contexto para potenciar el rendimiento del reconocimiento de voz.

Vista previa de Tencent Hunyuan Hy ASR 3.0: Reconocimiento de voz que no solo escucha, sino que comprende el contexto
Introducción
Tencent Hunyuan ha lanzado la vista previa de Hy ASR 3.0, un nuevo modelo de reconocimiento de voz en tiempo real basado en la capacidad de comprensión lingüística de Hy3.
Este modelo está diseñado para llevar el reconocimiento automático del habla más allá de la decodificación acústica aislada.
Los sistemas ASR tradicionales responden principalmente a esta pregunta:
¿Qué secuencia de palabras coincide mejor con este audio?
Hy ASR 3.0 añade una segunda pregunta:
En contexto, ¿qué transcripción tiene más sentido?
Esta distinción es fundamental cuando el audio incluye:
- Homófonos.
- Acentos regionales.
- Dialectos.
- Mezcla de chino e inglés.
- Nombres de productos y personas.
- Ruido de fondo.
- Susurros o voz a bajo volumen.
- Frases largas o expresiones con alta dependencia semántica.
Tencent afirma que el modelo combina un sistema acústico de alta precisión con las capacidades de modelado contextual y razonamiento semántico de Hy3. Su objetivo no es reescribir creativamente lo que dice el usuario, sino utilizar el contexto lingüístico para seleccionar la transcripción más razonable cuando el audio en sí es ambiguo.
Tencent informa que, en conjuntos de evaluación públicos agregados, la tasa de error de palabra en mandarín es del 3,34 %, en inglés del 2,62 % y en cantonés del 3,12 %.
La vista previa de Hy ASR 3.0 ya está disponible con documentación como motor WebSocket en tiempo real de Tencent Cloud y se ha integrado en el asistente Tencent Yuanbao. WorkBuddy y otros productos de Tencent están integrándolo de forma progresiva.
Aunque la vista previa pública ya está disponible, aún no alcanza la forma final del producto descrita en anuncios de lanzamiento más amplios. Sus limitaciones actuales de API son relevantes para los equipos que planean integraciones de producción.
Resultados de benchmarks públicos publicados
Tencent evaluó la vista previa de Hy ASR 3.0 en múltiples conjuntos de datos de voz públicos y la comparó con otros sistemas ASR.
Las tasas de error de palabra agregadas reportadas por la compañía son las siguientes:
| Idioma o variante de habla | WER de Hy ASR 3.0 Vista previa |
|---|---|
| Mandarín | 3,34 % |
| Inglés | 2,62 % |
| Cantonés | 3,12 % |
Cuanto menor sea el WER, mejor.

Las notas del gráfico indican que la evaluación agregada utilizó los siguientes conjuntos de datos:
- WenetSpeechMeeting.
- WenetSpeechNet.
- FLEURS chino.
- LibriSpeech clean.
- LibriSpeech other.
- FLEURS inglés.
- MLS inglés.
- FLEURS cantonés.
- Common Voice cantonés.
Los datos agregados son útiles para comparaciones amplias, pero también pueden ocultar diferencias importantes.
El rendimiento del modelo puede variar en diferentes escenarios:
- Voz leída frente a conversación espontánea.
- Micrófono de campo cercano frente a micrófono de campo lejano.
- Audio limpio de estudio frente a ruido callejero.
- Instrucciones cortas frente a discusiones continuas.
- Hablantes nativos frente a voz con acento.
- Mandarín formal frente a cambio de código.
Por lo tanto, los equipos de producción deben probar con su propio audio.
En lugar de elegir un modelo ASR basándose únicamente en un único número de WER.
Qué mide la tasa de error de palabra
La tasa de error de palabra se define generalmente como:
WER = (sustituciones + eliminaciones + inserciones) / número de palabras de referencia
Los tres tipos de error son:
- Sustitución: el modelo genera una palabra incorrecta.
- Eliminación: se omite una palabra hablada en la transcripción.
- Inserción: la transcripción incluye una palabra que no fue pronunciada.
Un WER más bajo generalmente indica una transcripción más precisa.
Sin embargo, el WER no cubre todos los casos de fallo en escenarios reales.
Consideremos dos errores de una sola palabra:
"Ship the order tomorrow"
→ "Ship the order today"
Y:
"The color is navy blue"
→ "The colour is navy blue"
Ambos pueden producir conteos de error similares, pero el primero podría cambiar una acción empresarial, mientras que el segundo podría no tener ningún impacto en el negocio.
Para sectores como servicio al cliente, salud, finanzas, manufactura e interfaces de comandos, los equipos deben evaluar tanto el impacto semántico como el WER.
Evaluación de escenarios internos de Tencent
Tencent también publicó resultados de conjuntos de evaluación internos que cubren cuatro categorías prácticas:
- Reconocimiento de voz general.
- Reconocimiento de dialectos.
- Comprensión contextual.
- Condiciones acústicas complejas, como alto ruido y susurros.
Los resultados reportados son los siguientes:
| Categoría de evaluación interna | WER de Hy ASR 3.0 Vista previa |
|---|---|
| Reconocimiento general | 4,95 % |
| Reconocimiento de dialectos | 9,31 % |
| Evaluación contextual | 4,76 % |
| Condiciones acústicas complejas | 6,36 % |

Tencent afirma que Hy ASR 3.0 Preview logró el WER más bajo en las cuatro categorías internas en comparación con otros sistemas.
Estos resultados son útiles como evidencia del producto reportada por la empresa, pero los conjuntos de prueba internos no son benchmarks públicos neutrales.
Antes de adoptar el modelo, las organizaciones deberían preguntarse:
- ¿Qué regiones de acentos y dialectos se incluyeron en las pruebas?
- ¿Cuál es el nivel de ruido del audio?
- ¿Cómo se normalizó la puntuación?
- ¿Se estandarizaron los números y los términos en inglés antes de la puntuación?
- ¿Los sistemas comparados estaban configurados con palabras calientes o contexto?
- ¿Cuántas muestras de habla se utilizaron?
- ¿Las pruebas incluyeron los micrófonos y canales que la organización realmente utiliza?
Cuatro mejoras orientadas al usuario
Tencent agrupa las mejoras prácticas en cuatro áreas.
1. Reconocimiento general más preciso
El modelo está diseñado para mejorar el reconocimiento en los siguientes escenarios:
- Mandarín estándar.
- Inglés.
- Cantonés.
- Dialectos regionales.
- Mezcla de chino e inglés.
- Diferentes hablantes y acentos.
Tencent también afirma que el modelo reduce los errores acumulativos en frases más largas.
Esta afirmación describe la capacidad subyacente del modelo. Actualmente, la vista previa de Tencent Cloud sigue limitando la entrada individual de la API pública a 60 segundos, por lo que las aplicaciones que procesan reuniones o grabaciones deben segmentar el audio por ahora.
Y gestionar el contexto entre segmentos por sí mismas.
Una segmentación deficiente puede reintroducir los problemas que el modelo pretende resolver.
Por ejemplo, cortar el audio en límites arbitrarios de 60 segundos puede interrumpir:
- El nombre completo de una persona.
- Un código de producto.
- Una frase con resolución semántica retardada.
- Expresiones mixtas chino-inglés.
- Las autocorrecciones del hablante.
Por lo tanto, la lógica de segmentación debe preservar en la medida de lo posible los límites de las oraciones y los límites de actividad de voz.
2. Mejor contexto y reconocimiento de intenciones
El habla contiene muchos sonidos ambiguos.
El mandarín tiene una gran cantidad de homófonos. El inglés tiene palabras y nombres con pronunciaciones similares. Los acentos dialectales pueden hacer que múltiples transcripciones candidatas parezcan acústicamente plausibles.
Los decodificadores tradicionales pueden elegir la palabra con mayor probabilidad local.
Los sistemas con capacidad de comprensión contextual pueden evaluar el enunciado completo.
Por ejemplo, un usuario podría pronunciar una frase que puede transcribirse como dos homófonos diferentes. Las palabras temáticas cercanas relacionadas con finanzas, juegos, medicina o viajes pueden indicar cuál significado es más probable.
El flujo de procesamiento previsto se puede simplificar como:
Características de audio
→ Palabras candidatas
→ Contexto de la oración
→ Verificación de coherencia semántica
→ Texto de transcripción final
Esto no significa que el modelo pueda comprender verdaderamente el habla de la misma manera que los humanos.
Más bien, significa que los componentes lingüísticos utilizan una ventana de contexto más amplia y probabilidades semánticas para mejorar las decisiones de transcripción.
Los sistemas ASR con conciencia contextual también introducen un nuevo riesgo: sobrecorrección semántica.
A veces, el modelo puede reemplazar una frase poco común pero fonéticamente correcta por una frase común que parece más fluida.
Por lo tanto, la evaluación en entornos de producción debe incluir:
- Nombres de personas poco comunes.
- Expresiones deliberadamente inusuales.
- Terminología de productos nuevos.
- Abreviaturas de dominios específicos.
- Oraciones contradictorias o sorprendentes.
El objetivo es utilizar el contexto sin inventar contenido de voz que nunca apareció.
3. Adaptación más sencilla a vocabulario especializado
Los materiales de publicación destacan la mejora con palabras calientes (hotwords), aplicable a:
- Nombres de marcas.
- Nombres de productos.
- Nombres de personas.
- Terminología de la industria.
- Abreviaturas.
- Vocabulario interno.
Cuando el modelo general no ve con suficiente frecuencia una palabra poco común, las palabras calientes pueden aportar un valor importante.
Ejemplos incluyen:
Nombres de medicamentos patentados
Modelos de maquinaria de fábrica
Códigos de cuentas de clientes
Marcas recién lanzadas
Abreviaturas técnicas
El producto ASR general de Tencent Cloud ya cuenta con una API de listas de palabras calientes y el parámetro hotword_id.
Sin embargo, la documentación actual del avance de Hy ASR 3.0 indica claramente que la mejora con palabras calientes aún no está disponible para este motor en vista previa.
Por lo tanto, se debe distinguir entre el marketing público del producto y el estado real de la API accesible:
| Capacidad | Notas de publicación del modelo | Estado actual de la API en vista previa |
|---|---|---|
| Mejora con palabras calientes | Descrita como capacidad compatible | Indicada como próximamente disponible |
| Entrada de contexto | Descrita como capacidad principal | Indicada como próximamente disponible |
| Modelado de lenguaje con contexto interno | Característica central del modelo | Disponible mediante el comportamiento del modelo |
Hasta que Tencent Cloud confirme el soporte en la documentación oficial de la API, las empresas no deberían planificar lanzamientos que dependan de la inyección de contexto externo o de listas de palabras calientes.
4. Reconocimiento más estable en condiciones acústicas difíciles
Tencent afirma que el modelo está optimizado para las siguientes situaciones:
- Alto ruido de fondo.
- Susurros.
- Habla en voz baja.
- Diferentes entornos de grabación.
- Múltiples acentos.
- Condiciones acústicas de cola larga.
La robustez frente al ruido es importante porque el habla real rara vez se presenta como grabaciones de laboratorio limpias.
Los micrófonos de atención al cliente pueden captar el sonido del teclado y las voces de compañeros cercanos.
Los asistentes móviles pueden escuchar ruido de tráfico, viento, música o voces de otras personas.
Las aplicaciones de reuniones pueden recibir audio comprimido de micrófonos de portátiles ubicados a distancia.
El modelo puede mejorar la robustez, pero no puede recuperar información que nunca fue capturada.
Los equipos aún deben utilizar:
- Micrófonos adecuados.
- Cancelación de eco.
- Control de ganancia.
- Detección de actividad de voz cuando esté disponible.
- Compresión de audio razonable.
- Monitoreo de canales.
- Procesos de reintento o aclaración.
La calidad del ASR es una propiedad del sistema, no solo del modelo.
Arquitectura: Hy3 más codificador de voz
Tencent afirma que Hunyuan Hy ASR 3.0 Preview combina tres componentes principales:
- Una base de modelo de lenguaje MoE basada en Hy3.
- Un codificador de voz no supervisado de desarrollo propio.
- Preentrenamiento conjunto y postentrenamiento en múltiples etapas.

Hy3 como base de lenguaje
Hy3 proporciona el componente de comprensión del lenguaje.
Sus funciones incluyen:
- Modelar el contexto de las oraciones.
- Resolver candidatos ambiguos.
- Comprender estructuras de lenguaje mixto.
- Aprovechar las relaciones semánticas.
- Mejorar la coherencia de la salida.
Tencent describe esta arquitectura como un diseño de mezcla de expertos (MoE) que equilibra capacidad y eficiencia.
La documentación pública de ASR no revela el número total de parámetros, los parámetros activos, el perfil de latencia ni la arquitectura completa de inferencia de Hy ASR 3.0 Preview.
Codificador de voz no supervisado
El codificador de voz convierte el audio sin procesar en representaciones acústicas que el modelo de lenguaje puede procesar.
Tencent indica que este codificador fue entrenado con decenas de millones de horas de voz sin etiquetar.
El entrenamiento de audio no supervisado o autosupervisado es valioso porque transcribir manualmente datos de voz a esa escala tendría un costo prohibitivo.
El codificador puede aprender estructuras recurrentes a partir del audio sin procesar, como:
- Patrones de habla.
- Diferencias entre hablantes.
- Variaciones de acento.
- Condiciones de fondo.
- Tiempo y prosodia.
La calidad de esta representación afecta a todas las etapas posteriores.
Si dos sonidos se confunden en la etapa del codificador, el modelo de lenguaje debe depender más del contexto para recuperar las palabras correctas.
Preentrenamiento conjunto de voz y lenguaje
Tencent afirma que el codificador de voz y el modelo de lenguaje fueron entrenados conjuntamente utilizando un conjunto de datos de voz a gran escala de múltiples fuentes que cubre:
- Dialectos.
- Acentos.
- Entornos acústicos.
- Diferentes grupos de hablantes.
- Patrones de lenguaje contextual.
- Entrenamiento
conjunto diseñado para reducir la brecha entre el reconocimiento acústico y la comprensión del lenguaje.
En lugar de tratar el reconocimiento de voz como:
El modelo de audio termina
→ El modelo de lenguaje luego limpia la transcripción
Hy ASR 3.0 se presenta como un proceso más integrado:
Representación de voz y modelado de lenguaje
→ Entrenamiento trabajando en conjunto
→ Produce una transcripción contextualizada
Los límites internos exactos entre el codificador, el decodificador, el modelo de lenguaje y las etapas de aprendizaje por refuerzo no se han divulgado completamente.
## SFT y aprendizaje por refuerzo en múltiples etapas
Tencent describe un esquema de ajuste fino supervisado que cubre:
- Transcripción general.
- Tareas de contexto arbitrario.
- Terminología especializada.
- Diferentes entornos acústicos.
- Grupos de hablantes diversos.
- Diez grandes regiones dialectales.
- Más de 20 regiones dialectales más pequeñas.
La compañía también informa el uso de aprendizaje por refuerzo en múltiples etapas para:
- Precisión general de transcripción.
- Comportamiento contextual.
- Casos complejos de cola larga.
- Reducción de errores de sustitución y eliminación.
Actualmente no existe un documento técnico público que proporcione el diseño completo de las recompensas, la proporción de datos, la potencia computacional de entrenamiento ni los resultados de estudios de ablación.
Por lo tanto, las declaraciones de arquitectura deben considerarse como descripciones técnicas a nivel de producto, no como especificaciones de investigación reproducibles.
## Idiomas y dialectos compatibles actualmente con el motor de Tencent Cloud
La documentación de Tencent Cloud describe el motor actual `Hy-ASR-3.0-preview` como compatible con:
- Mandarín.
- Inglés.
- 20 dialectos chinos o variantes regionales.
La lista de dialectos documentada es la siguiente:
| N.º | Dialecto o variante regional |
|-|-|
| 1 | Cantonés |
| 2 | Dongbei (noreste) |
| 3 | Henan |
| 4 | Shaanxi |
| 5 | Chengdu |
| 6 | Chongqing |
| 7 | Wuhan |
| 8 | Guiyang |
| 9 | Qingdao |
| 10 | Jinan |
| 11 | Changsha |
| 12 | Hefei |
| 13 | Hebei |
| 14 | Kunming |
| 15 | Lanzhou |
| 16 | Yinchuan |
| 17 | Nanchang |
| 18 | Pekinés |
| 19 | Sichuanés |
| 20 | Tianjin |
Las etiquetas de dialectos en la documentación comercial de ASR son categorías amplias de producto.
El habla real dentro de cada categoría varía según la ciudad, la edad, el trasfondo social, el cambio de código, el vocabulario y el hablante.
Afirmar que se admite un dialecto no debe interpretarse como que la precisión es la misma para todos los hablantes de esa región.
## Disponibilidad actual de la versión de vista previa
Tencent Cloud añadió el motor de la versión de vista previa de Hy ASR 3.0 al producto WebSocket en tiempo real el **4 de agosto de 2026**.
Este servicio público se describe actualmente como una versión de prueba interna o de vista previa.
| Elemento | Estado documentado actual |
|-|-|
| Tipo de producto | Reconocimiento de voz en tiempo real |
| Método de integración | API WebSocket de Tencent Cloud |
| Nombre del motor | `Hy-ASR-3.0-preview` |
| Duración de audio | Máximo de 60 segundos por entrada |
| Formato de audio | PCM mono de 16 kHz |
| Concurrencia incluida | 20 vías de concurrencia |
| Mandarín | Compatible |
| Inglés | Compatible |
| 20 dialectos | Compatible |
| Separación de hablantes | No compatible en la versión de vista previa |
| Compatibilidad con parámetros VAD | Se indica como no compatible en la versión de vista previa |
| Sustitución de palabras | No compatible en la versión de vista previa |
Parámetro de umbral de ruido | No compatible en la versión de vista previa |
| Entrada de contexto externo | Próximamente |
| Mejora de palabra de activación | Próximamente |
La referencia general de la API WebSocket incluye parámetros utilizados por otros motores, incluidos VAD e ID de palabra de activación.
Hy ASR 3.0 se rige por la descripción específica de la versión de vista previa del motor.
La aparición de un parámetro en el modo de API compartida no garantiza que el motor de vista previa lo haya implementado actualmente.
## Flujo básico de integración con Tencent Cloud
La configuración oficial se divide en tres etapas principales.
## Paso 1: Activar el servicio de reconocimiento de voz de Tencent Cloud
Abra el servicio de reconocimiento de voz de Tencent Cloud y complete el proceso de activación de la cuenta.
La documentación oficial de inicio rápido se encuentra en:
```Plaintext
https://cloud.tencent.com/document/product/1093/54362
Antes de habilitar la facturación de pago por uso, consulte primero las instrucciones de facturación.
Tencent Cloud indica que las cuentas nuevas tienen la facturación de pago por uso deshabilitada por defecto y debe activarse manualmente.
Paso 2: Crear credenciales de API
Cree u obtenga:
AppIDSecretIDSecretKey
Estas credenciales se utilizan para firmar las solicitudes de conexión WebSocket.
Guárdelas en un administrador de secretos o en variables de entorno protegidas.
No coloque credenciales de larga duración en:
- Código JavaScript del frontend.
- Código fuente de aplicaciones móviles.
- Repositorios públicos de código.
- Documentos compartidos.
- URL visibles para el cliente.
Para productos de navegador o móviles, cree la información de conexión firmada en un backend de confianza.
Paso 3: Conectarse al endpoint WebSocket en tiempo real
El formato del endpoint documentado en la documentación de Tencent Cloud es:
wss://asr.cloud.tencent.com/asr/v2/<appid>?{request_parameters}
Reemplace <appid> con el AppID de Tencent Cloud.
La solicitud incluye parámetros de firma, como:
secretidtimestampexpirednoncevoice_idengine_model_type
Para la versión de vista previa de Hy ASR 3.0, establezca:
engine_model_type=Hy-ASR-3.0-preview
Cada conexión WebSocket requiere un voice_id único.
Si la conexión finaliza o falla, el voice_id anterior deja de ser válido y es necesario generar uno nuevo.
Paso 4: Preparar audio compatible
La versión de vista previa actual requiere:
Frecuencia de muestreo: 16 kHz
Canales: mono
Formato: PCM
Duración máxima de entrada: 60 segundos
Pruebe toda la cadena de audio, no solo el archivo original.
Los SDK de micrófono, las API de medios del navegador, los sistemas telefónicos y las plataformas de conferencias pueden remuestrear o comprimir el audio antes de que llegue al servidor.
Paso 5: Transmitir audio y leer resultados incrementales
El servicio admite transcripción en tiempo real, devolviendo texto mientras se transmite el audio.
La aplicación debe manejar:
- Resultados parciales.
- Resultados finales.
- Errores de conexión.
- Fallos de autenticación.
- Tiempos de espera.
- Reconexiones.
- Límites de duración de audio.
- Texto duplicado o corregido.
No asuma que cada resultado parcial es el resultado final.
La interfaz de ASR en tiempo real puede revisar palabras anteriores después de obtener más contexto.
La interfaz de usuario debe distinguir entre texto temporal y texto confirmado.
Paso 6: Pruebas antes del lanzamiento
Construya un conjunto de evaluación representativo que incluya:
- Audio real de clientes.
- Acentos comunes.
- Dialectos.
- Mezcla de chino e inglés.
- Nombres de personas y terminología de productos.
Ruido.
- Susurros.
- Mala calidad de micrófono.
- Instrucciones cortas.
- Frases completas.
Mida tanto la calidad del reconocimiento como el comportamiento del sistema.
Precio del motor de vista previa
Tencent Cloud clasifica la versión de vista previa de Hy ASR 3.0 como motor de reconocimiento de voz en tiempo real de modelo grande 2.0.
La página de facturación actual enumera:
| Opción de facturación | Precio actual |
|---|---|
| Paquete prepago de 60 horas | Total de 60 yuanes, es decir, 1,00 yuan/hora |
| Paquete prepago de 1.000 horas | Total de 950 yuanes, es decir, 0,95 yuan/hora |
| Paquete prepago de 10.000 horas | Total de 9.000 yuanes, es decir, 0,90 yuan/hora |
| Paquete prepago de 100.000 horas | Total de 88.000 yuanes, es decir, 0,88 yuan/hora |
| Paquete prepago de 300.000 horas | Total de 255.000 yuanes, es decir, 0,85 yuan/hora |
| Pago por uso | 1,00 yuan/hora, liquidación diaria |
La tabla de facturación actual de Tencent muestra que el reconocimiento del modelo grande 2.0 no incluye cuota de audio gratuita.
Las 20 vías de concurrencia incluidas son una cuota de concurrencia, no tiempo de reconocimiento gratuito.
Los precios pueden variar. Antes de emitir cotizaciones comerciales o estimar presupuestos a largo plazo, consulte la página de facturación en tiempo real.
Ejemplo de coste
Según el precio actual de pago por uso de 1,00 yuan/hora:
100 horas de reconocimiento exitoso
× 1,00 yuan/hora
= 100 yuanes
El presupuesto de producción también debe incluir:
- Preprocesamiento de audio.
- Transmisión de red.
- Servidores backend.
- Almacenamiento.
- Monitoreo.
- Corrección manual.
- Tráfico de reintentos.
- Procesamiento posterior con modelos de lenguaje.
La tarifa de ASR es solo una parte del sistema completo de transcripción.
Yuanbao e integración de producto
Tencent afirma que Yuanbao participó en el desarrollo de este modelo y es el primer producto de Tencent en integrarlo.
Los usuarios pueden probar esta función mediante la entrada de voz en Yuanbao. El modelo está diseñado para mejorar:
- Reconocimiento de dialectos.
- Corrección contextual de errores.
- Reconocimiento en condiciones acústicas difíciles.
Tencent indica que otros productos como WorkBuddy están integrándose gradualmente.
El método de integración en productos de consumo puede diferir de la API pública de la versión de vista previa de Tencent Cloud.
Por ejemplo, Yuanbao puede utilizar servicios internos, contexto específico del producto o configuraciones de despliegue aún no abiertas a desarrolladores externos.
No debe asumirse que la experiencia en Yuanbao corresponde uno a uno con los parámetros de la API pública.
Escenarios de aplicación
La versión de vista previa de Hy ASR 3.0 está orientada a interacciones de voz de baja latencia y corta duración.
Atención al cliente inteligente
Los usos potenciales incluyen:
- Transcripción en tiempo real para agentes.
- Reconocimiento de instrucciones para robots de voz.
- Generación de resúmenes de llamadas.
- Extracción de intenciones.
- Asistencia para control de calidad.
La versión de vista previa carece actualmente de separación de hablantes, lo que puede limitar la transcripción de llamadas multiparte, salvo que otros componentes realicen la separación de canales o hablantes.
Subtítulos en tiempo real
El motor puede admitir subtítulos en tiempo real de corta duración en los siguientes escenarios:
- Transmisiones de video en vivo.
- Salas de audio.
- Reuniones internas.
- Mensajes de voz.
- Interfaces de accesibilidad.
Las aplicaciones deben probar la estabilidad de los resultados parciales y el comportamiento de la puntuación.
Búsqueda por voz
El reconocimiento consciente del contexto puede mejorar las búsquedas que implican:
- Preguntas en lenguaje natural de frases largas.
- Nombres de productos.
- Mezcla de chino e inglés.
- Pronunciaciones regionales.
Hasta que la versión de vista previa permita la inyección de palabras clave, los términos poco comunes
pueden requerir posprocesamiento o una capa separada de corrección de errores.
Comandos de voz y asistentes
El motor puede convertir instrucciones habladas en texto para:
- Asistentes de IA.
- Agentes inteligentes empresariales.
Control de dispositivos inteligentes.
- Comandos de flujo de trabajo.
El sistema de comandos nunca debe ejecutar acciones de alto impacto únicamente porque un resultado de transcripción parezca tener alta confianza.
Para operaciones destructivas o financieras, se debe confirmar la intención interpretada y solicitar la aprobación explícita del usuario.
Comprensión del contenido
Los clips de audio cortos pueden transcribirse antes de enviarse a los siguientes procesos:
- Generación de resúmenes.
- Clasificación.
- Índice de búsqueda.
- Moderación de contenido.
- Extracción de conocimiento.
La calidad del procesamiento de IA en cada paso posterior depende del resultado de la transcripción.
Cuando las políticas lo permitan, almacene el audio original o la evidencia de confianza para que las salidas inciertas puedan revisarse.
Limitaciones actuales
Estado de vista previa
Este producto todavía está marcado como versión preliminar o beta interna.
La interfaz, los precios, las limitaciones y las funciones admitidas pueden cambiar.
Límite de entrada de sesenta segundos
La API pública actual no puede reemplazar directamente la transcripción por lotes de grabaciones largas.
El audio largo debe procesarse en segmentos y puede requerir una capa de contexto a nivel de aplicación.
Solo admite entrada PCM
La versión preliminar actualmente requiere PCM mono de 16 kHz.
Muchos entornos de producción usan MP3, AAC, Opus o códecs telefónicos, que requieren conversión.
No admite separación de hablantes
La documentación exclusiva del motor actual indica que no se admite la separación de hablantes.
La transcripción con múltiples hablantes puede requerir canales de audio separados u otro servicio de separación de hablantes.
Las funciones de contexto y palabras clave aún no son públicas
Según la documentación oficial, las capacidades anunciadas aún no se han publicado como funciones disponibles en la API de vista previa.
Datos de referencia reportados por la empresa
Los gráficos de referencia provienen de Tencent.
Una evaluación independiente en condiciones equivalentes mejoraría la credibilidad de la comparación.
No hay un artículo técnico completo
Tencent ha proporcionado una descripción de alto nivel de la arquitectura y el proceso de entrenamiento de Hy ASR 3.0 en vista previa, pero aún no ha publicado detalles completos y reproducibles.
El contexto puede causar una corrección excesiva
El decodificador consciente del lenguaje puede preferir oraciones comunes e ignorar contenido poco común pero realmente pronunciado.
Las pruebas deben incluir frases raras e inesperadas.
Lista de verificación de evaluación práctica
1. Construir un conjunto de pruebas del dominio
Incluya al menos cientos de declaraciones representativas, no solo unas pocas muestras de demostración limpias.
2. Conservar el texto de referencia original
Cree transcripciones de referencia verificadas manualmente con una estrategia de normalización clara.
Decida cómo manejar:
- Signos de puntuación.
- Números.
- Mayúsculas y minúsculas en inglés.
- Palabras de relleno.
- Contenido repetido.
- Chino tradicional y simplificado.
3. Medir múltiples métricas
Utilice:
- Tasa de error de palabras o tasa de error de caracteres.
- Precisión de nombres.
- Precisión de números.
- Tasa de error semántico.
- Latencia.
- Tasa de revisión de resultados parciales.
- Tasa de fallos.
4. Probar los dialectos por separado
No combine todos los hablantes de dialectos en un solo promedio.
Reporte los resultados por región y condiciones de grabación.
5. Probar la ambigüedad contextual
Cree pares de muestras con contenido acústico similar pero donde el contexto de la oración cambie el resultado correcto de la transcripción.
6. Probar términos poco comunes
Evalúe los nombres de productos y
Ahora primero maneje la terminología, y repita las pruebas una vez que Tencent abra el soporte de palabras clave.
7. Probar escenarios de ruido y susurros
Use grabaciones de entornos reales, no solo ruido superpuesto digitalmente.
8. Probar los límites de segmentación
Confirme que la implementación de segmentación de 60 segundos no corte oraciones importantes ni produzca texto duplicado.
9. Medir la latencia de extremo a extremo
Incluya las siguientes etapas:
Captura
+ Carga
+ Reconocimiento
+ Finalización del resultado
+ Procesamiento posterior
10. Revisar los requisitos de privacidad y cumplimiento
Las grabaciones de voz pueden contener información personal o sensible.
Antes del despliegue, deben definirse claramente las políticas de retención de datos, acceso, cifrado, consentimiento del usuario y eliminación.
Comparación entre Hy ASR 3.0 en vista previa y el pipeline tradicional de ASR
| Área | Pipeline tradicional | Dirección de Hy ASR 3.0 |
|---|---|---|
| Enfoque principal | Precisión de acústica a texto | Reconocimiento acústico más modelado de lenguaje contextual |
| Homófonos confusos | Generalmente depende de probabilidades locales | Usa un contexto de oración más amplio |
| Dialectos | Modelos independientes o cobertura limitada | Un único motor híbrido documentado con soporte para 20 dialectos |
| Vocabulario especializado | Palabras clave externas o modelos personalizados | Capacidad de palabras clave anunciada; soporte en vista previa pendiente |
| Voz compleja | Modelo acústico más posprocesamiento | Entrenamiento conjunto de voz y lenguaje más entrenamiento posterior |
| Salida | Texto transcrito | Texto transcrito con contexto más coherente |
| Riesgo principal | Sustituciones acústicas y omisiones | Errores acústicos más posible corrección semántica excesiva |
El nuevo método no elimina la necesidad de la ingeniería tradicional de ASR.
Es una capa de lenguaje más fuerte añadida sobre el mismo sistema de extremo a extremo.
Preguntas frecuentes
¿Qué es Hy ASR 3.0 en vista previa?
Hy ASR 3.0 en vista previa es un modelo de reconocimiento de voz en tiempo real lanzado por Tencent Hunyuan basado en la base lingüística Hy3 y un codificador de voz propio. Su objetivo de diseño es combinar el reconocimiento acústico con la comprensión del lenguaje contextual.
¿Qué idiomas y dialectos admite Hy ASR 3.0?
La documentación de Tencent Cloud indica soporte para mandarín estándar, inglés y 20 dialectos o variantes regionales del chino, incluidos cantonés, dialecto del noreste, henanés, shaanxi, chengdu, chongqing, wuhan, entre otros. La precisión puede variar según el hablante y la región.
¿Cuál es la WER (tasa de error de palabras) publicada?
Tencent publicó resultados de WER agregados en benchmarks públicos: mandarín 3.34%, inglés 2.62% y cantonés 3.12%. Estos son resultados reportados por la empresa basados en la agregación de múltiples conjuntos de datos, no resultados de una prueba unificada replicada de forma independiente.
¿Hy ASR 3.0 puede transcribir grabaciones largas?
La vista previa pública actual acepta hasta 60 segundos de audio por entrada. Las grabaciones más largas requieren procesamiento por segmentos, y la aplicación debe mantener un contexto válido entre segmentos.
¿La API actual admite palabras clave y contexto personalizado?
Según la documentación de vista previa de Tencent Cloud del 4 de agosto de 2026, actualmente no. Las capacidades están descritas en los materiales de lanzamiento, pero las páginas oficiales de la API indican que la entrada de contexto y la mejora de palabras clave se abrirán más adelante.
¿Qué formatos de audio se admiten?
La documentación actual de Hy ASR 3.0 en vista previa especifica soporte para entrada PCM mono de 16 kHz. Las aplicaciones que usan MP3, AAC, Opus u otros formatos deben convertir el audio antes de la llamada.
Envíe esto a este motor.
¿Cómo pueden los desarrolladores llamar a Hy ASR 3.0?
Los desarrolladores usan la API WebSocket de reconocimiento de voz en tiempo real de Tencent Cloud y configuran engine_model_type como Hy-ASR-3.0-preview. La conexión debe estar firmada con las credenciales de Tencent Cloud.
¿Hy ASR 3.0 es gratuito?
La página de precios actual de Tencent Cloud no lista una cuota gratuita de audio para el reconocimiento del modelo grande 2.0. La página muestra planes prepagados desde 1 yuan RMB por hora por 60 horas, y pospago a 1 yuan RMB por hora, con 20 canales concurrentes incluidos.
Herramientas relacionadas
- Vista previa ASR de Hunyuan en Tencent Cloud: Documentación oficial de funciones, limitaciones, dialectos y acceso rápido para Hy ASR 3.0 en vista previa.
- API WebSocket de ASR en tiempo real de Tencent Cloud: Documentación oficial de endpoints, parámetros de autenticación, selección de motor y respuestas.
- API Explorer de Tencent Cloud: Interfaz oficial de Tencent para revisar APIs y generar ejemplos de solicitudes de SDK.
- SDK de Python de Tencent Cloud: SDK oficial de Python para APIs y gestión de credenciales de Tencent Cloud.
- FFmpeg: Un kit de herramientas de audio y video de código abierto que puede usarse para convertir el audio de entrada a la tasa de muestreo y disposición de canales compatible.
- Websocat: Un cliente WebSocket de línea de comandos, adecuado para probar endpoints de transmisión durante el desarrollo.
Enlaces relacionados
- [Documentación de vista previa de Hunyuan ASR](https://cloud.tencent.
com/document/product/1093/135476): estado oficial actual, dialectos compatibles, limitaciones y configuración básica.
- API de reconocimiento de voz en tiempo real: referencia del formato de endpoint WebSocket y parámetros de solicitud.
- Guía de inicio rápido de la API de servidor en un minuto: guía oficial de Tencent Cloud para la activación del servicio y las credenciales.
- Facturación de ASR de Tencent Cloud: información actual sobre prepago, pospago, concurrencia y cuotas gratuitas.
- Actualizaciones del producto ASR de Tencent Cloud: registro oficial de versiones que muestra el motor de vista previa Hy ASR 3.0 añadido el 4 de agosto de 2026.
- API de palabras calientes de Tencent Cloud: API oficial de lista de palabras calientes para ASR general; el soporte de la vista previa de Hy ASR 3.0 sigue marcado como próximamente disponible.
- Tencent Hunyuan: portal oficial de modelos y productos de Hunyuan.
Resumen
La vista previa de Hy ASR 3.0 de Tencent Hunyuan combina el codificador de voz con las capacidades del modelo de lenguaje Hy3 para mejorar la transcripción en mandarín, inglés, dialectos, idiomas mixtos, entornos ruidosos y contextos relacionados.
Tencent informa una WER del 3,34% en mandarín, 2,62% en inglés y 3,12% en cantonés en conjuntos de datos públicos agregados, al tiempo que obtiene resultados líderes en sus pruebas internas de escenarios. Estas cifras son prometedoras, pero aún deben validarse con el audio de cada institución.
La vista previa actual de Tencent Cloud tiene un alcance más limitado que la visión completa del lanzamiento.
Admite reconocimiento WebSocket en tiempo real, audio PCM mono de 16 kHz y entradas de audio de hasta 60 segundos. La inyección de contexto externo, el refuerzo de palabras calientes, la separación de hablantes y otras funciones aún no están disponibles en este motor.
El cambio clave no es que el reconocimiento de voz deje de escuchar el sonido, sino que el modelo de lenguaje ahora ayuda a determinar el significado más probable de lo que se escucha.