Tencent Hunyuan Hy ASR 3.0 Anteprima: Riconoscimento vocale sensibile al contesto per mandarino, inglese e 20 dialetti

Tencent Hunyuan ha rilasciato la versione di anteprima di Hy ASR 3.0, un nuovo modello di riconoscimento vocale in tempo reale basato sulle capacità di comprensione linguistica di Hy3. Il modello è progettato per migliorare l'accuratezza del riconoscimento, particolarmente in scenari multilingue e multidialettali, sfruttando pienamente le informazioni contestuali per potenziare le prestazioni del riconoscimento vocale.

发布于 2026年8月5日generalGEO 评分: 02 次阅读
Questa è l'immagine di accompagnamento della guida di anteprima di Tencent Hunyuan Hy ASR 3.0, con uno stile tecnologico blu scuro. Gli elementi visivi includono un titolo centrale ben visibile 'Hy ASR 3.0 Preview Guide', sotto il quale sono indicati i moduli principali come WER, riconoscimento contestuale, dialetti, API e limiti. A sinistra sono presenti icone di onde sonore e microfono, a destra un'interfaccia API con icone di codice, icone di nodi collegati a più lingue, che richiamano anche le caratteristiche principali menzionate nel titolo: il modello ASR supporta mandarino, inglese e 20 dialetti, con capacità di riconoscimento vocale sensibile al contesto.

Anteprima Hy ASR 3.0 di Tencent Mixen: riconoscimento vocale che non si limita ad ascoltare, ma comprende il contesto

Introduzione

Tencent Mixen ha rilasciato l'anteprima di Hy ASR 3.0, un nuovo modello di riconoscimento vocale in tempo reale basato sulle capacità di comprensione linguistica di Hy3.

Il modello è progettato per spingere il riconoscimento automatico del parlato oltre il semplice decoding acustico isolato.

I sistemi ASR tradizionali rispondono principalmente a questa domanda:

Quale sequenza di parole corrisponde meglio a questo audio?

Hy ASR 3.0 aggiunge una seconda domanda:

Nel contesto, quale trascrizione ha più senso?

Questa distinzione è cruciale quando l'audio contiene:

  • Omofoni.
  • Accenti regionali.
  • Dialetti.
  • Mescolanza di cinese e inglese.
  • Nomi di prodotti e persone.
  • Rumore di fondo.
  • Sussurri o voci a basso volume.
  • Frasi lunghe o espressioni con forte dipendenza semantica.

Tencent afferma che il modello combina un sistema acustico ad alta precisione con le capacità di modellazione contestuale e ragionamento semantico di Hy3. L'obiettivo non è riscrivere creativamente ciò che l'utente dice, ma utilizzare il contesto linguistico per selezionare la trascrizione più plausibile quando l'audio stesso è ambiguo.

Tencent riporta un tasso di errore sulle parole (WER) del 3,34% per il mandarino, del 2,62% per l'inglese e del 3,12% per il cantonese su set di valutazione pubblici aggregati.

L'anteprima di Hy ASR 3.0 è ora disponibile con documentazione come motore WebSocket in tempo reale su Tencent Cloud ed è stata integrata nell'assistente Tencent Yuanbao. WorkBuddy e altri prodotti Tencent lo stanno progressivamente adottando.

L'anteprima pubblica è disponibile, ma non rappresenta ancora la forma definitiva del prodotto descritta negli annunci più ampi. Gli attuali limiti API meritano attenzione per i team che pianificano integrazioni in produzione.

Risultati benchmark pubblici pubblicati

Tencent ha valutato l'anteprima di Hy ASR 3.0 su diversi set di dati vocali pubblici, confrontandola con altri sistemi ASR.

I tassi di errore aggregati riportati dall'azienda sono:

Lingua o variante WER Hy ASR 3.0 Anteprima
Mandarino 3,34%
Inglese 2,62%
Cantonese 3,12%

Un WER più basso è migliore.

L'immagine mostra un confronto del tasso di errore sulle parole (WER, %) di Hy ASR 3.0 Preview in tre lingue o dialetti: cinese, inglese e cantonese. Hy ASR 3.0 Preview ottiene un WER del 3,34% in cinese, del 2,62% in inglese e del 3,12% in cantonese. Sono elencati anche i dati WER di altri sistemi come Doubao-Seed-ASR 2.0, Qwen 3 ASR e Qwen-audio-3.0-ASR Flash. La didascalia sottostante indica che valori più bassi corrispondono a una maggiore precisione di riconoscimento, i dati provengono da set di valutazione open source e vengono elencati i nomi dei set di dati open source per ciascuna lingua o dialetto.

La didascalia del grafico indica che la valutazione aggregata ha utilizzato i seguenti set di dati:

  • WenetSpeechMeeting.
  • WenetSpeechNet.
  • FLEURS cinese.
  • LibriSpeech clean.
  • LibriSpeech other.
  • FLEURS inglese.
  • MLS inglese.
  • FLEURS cantonese.
  • Common Voice cantonese.

I dati aggregati sono utili per confronti ampi, ma possono anche nascondere differenze importanti.

Le prestazioni del modello possono variare in diversi scenari:

  • Parlato letto vs. conversazione spontanea.
  • Microfono ravvicinato vs. microfono distante.
  • Audio da studio pulito vs. rumore stradale.
  • Comandi brevi vs. discussioni continue.
  • Madrelingua vs. parlato con accento.
  • Mandarino formale vs. code-switching.

Pertanto, i team di produzione dovrebbero testare con il proprio audio.

Non scegliere un modello ASR basandosi esclusivamente su un singolo numero WER.

Cosa misura il tasso di errore sulle parole

Il tasso di errore sulle parole è generalmente definito come:

WER = (Sostituzioni + Cancellazioni + Inserzioni) / Numero di parole di riferimento

I tre tipi di errore sono:

  • Sostituzione: il modello ha prodotto una parola errata.
  • Cancellazione: una parola parlata è stata omessa nella trascrizione.
  • Inserzione: la trascrizione contiene una parola che non è stata pronunciata.

Un WER più basso indica generalmente una trascrizione più accurata.

Tuttavia, il WER non copre tutti i possibili scenari di errore nella pratica.

Consideriamo due errori su una singola parola:

"Ship the order tomorrow"
→ "Ship the order today"

E:

"The color is navy blue"
→ "The colour is navy blue"

Entrambi possono produrre un conteggio di errori simile, ma il primo potrebbe cambiare un'azione aziendale, mentre il secondo potrebbe non avere alcun impatto.

Per i settori del servizio clienti, della sanità, della finanza, della produzione e delle interfacce a comando vocale, i team dovrebbero valutare sia l'impatto semantico che il WER.

Valutazioni su scenari interni Tencent

Tencent ha inoltre pubblicato i risultati di set di valutazione interni che coprono quattro categorie pratiche:

  1. Riconoscimento vocale generale.
  2. Riconoscimento di dialetti.
  3. Comprensione contestuale.
  4. Condizioni acustiche complesse, come rumore elevato e sussurri.

I risultati riportati sono:

Categoria di valutazione interna WER Hy ASR 3.0 Anteprima
Riconoscimento generale 4,95%
Riconoscimento dialetti 9,31%
Valutazione contestuale 4,76%
Condizioni acustiche complesse 6,36%

Questo grafico a barre riporta il tasso di errore sulle parole (WER, valori più bassi indicano maggiore precisione) di quattro sistemi di riconoscimento vocale, tra cui Tencent Mixen Hy ASR 3.0 Preview, su quattro categorie di set di valutazione: set generale, set dialettale, set contestuale (Context) e set di scenari acustici complessi (rumore elevato/sussurri). Sul set generale, questo sistema ha un WER del 4,35%, superando gli altri tre sistemi; anche negli altri set, il WER di questo sistema è il più basso tra le quattro categorie di valutazione, rispettivamente 9,31% per il set dialettale, 4,25% per il set contestuale e 6,36% per il set di scenari acustici complessi. Questa figura mostra i risultati della valutazione su scenari interni, corrispondenti alle prestazioni su quattro categorie di compiti della valutazione interna pubblica di Hy ASR 3.0 Preview di Tencent.

Tencent afferma che Hy ASR 3.0 Preview ha ottenuto il WER più basso in tutte e quattro le categorie interne rispetto ai sistemi di confronto.

Questi risultati sono utili come prova del prodotto riportata dall'azienda, ma i set di test interni non sono benchmark pubblici neutrali.

Prima dell'adozione, le organizzazioni dovrebbero chiedersi:

  • Quali regioni con accenti e dialetti sono state incluse nei test?
  • Qual è il livello di rumore dell'audio?
  • Come è stata normalizzata la punteggiatura?
  • Numeri e termini inglesi sono stati standardizzati prima della valutazione?
  • I sistemi di confronto sono stati configurati con parole chiave o contesto?
  • Quanti campioni di enunciati sono stati utilizzati?
  • I test includono i microfoni e i canali effettivamente utilizzati dall'organizzazione?

Quattro miglioramenti orientati all'utente

Tencent ha raggruppato i miglioramenti concreti in quattro aree.

1. Riconoscimento generale più accurato

Il modello mira a migliorare il riconoscimento nei seguenti scenari:

  • Mandarino standard.
  • Inglese.
  • Cantonese.
  • Dialetti regionali.
  • Mescolanza di cinese e inglese.
  • Diversi parlanti e accenti.

Tencent afferma inoltre che il modello riduce gli errori cumulativi nelle frasi più lunghe.

Questa affermazione descrive le capacità di base del modello. Tuttavia, l'attuale anteprima su Tencent Cloud limita ancora l'input API pubblico singolo a 60 secondi, quindi le applicazioni che elaborano riunioni o registrazioni devono attualmente segmentare

l'audio e gestire autonomamente il contesto tra i segmenti.

Una segmentazione inadeguata può reintrodurre i problemi che il modello stesso dovrebbe risolvere.

Ad esempio, tagliare l'audio a confini arbitrari di 60 secondi può interrompere:

  • Il nome completo di una persona.
  • Un codice prodotto.
  • Una frase con ritardo semantico.
  • Espressioni miste cinese-inglese.
  • Le autocorrezioni del parlante.

Pertanto, la logica di segmentazione dovrebbe preservare il più possibile i confini delle frasi e i confini dell'attività vocale.

2. Migliore contesto e riconoscimento delle intenzioni

Il parlato contiene molti suoni ambigui.

Il mandarino ha un gran numero di omofoni. L'inglese ha parole e nomi dalla pronuncia simile. Le pronunce dialettali possono rendere acusticamente plausibili più trascrizioni candidate.

I decoder tradizionali possono selezionare la parola con la massima probabilità locale.

I sistemi con consapevolezza contestuale possono valutare l'intera espressione.

Ad esempio, un utente potrebbe pronunciare una frase che può essere trascritta in due omofoni diversi. Le parole tematiche vicine relative a finanza, giochi, medicina o viaggi possono suggerire quale significato sia più probabile.

Il flusso di elaborazione previsto può essere semplificato come:

Caratteristiche audio
→ Parole candidate
→ Contesto della frase
→ Verifica della coerenza semantica
→ Trascrizione finale

Ciò non significa che il modello possa comprendere veramente il parlato allo stesso modo degli esseri umani.

Significa piuttosto che i componenti linguistici utilizzano una finestra contestuale più ampia e probabilità semantiche per migliorare le decisioni di trascrizione.

I sistemi ASR con consapevolezza contestuale introducono anche un nuovo rischio: ipercorrezione semantica.

Il modello potrebbe talvolta sostituire una frase insolita ma foneticamente corretta con una frase comune che appare più fluida.

Pertanto, la valutazione in produzione dovrebbe includere:

  • Nomi propri rari.
  • Espressioni deliberatamente inusuali.
  • Terminologia di nuovi prodotti.
  • Abbreviazioni di settore.
  • Frasi contraddittorie o sorprendenti.

L'obiettivo è utilizzare il contesto senza inventare contenuti vocali che non sono mai apparsi.

3. Adattamento più semplice al vocabolario specialistico

Il materiale di rilascio ha evidenziato il potenziamento con hotword, applicabile a:

  • Nomi di marchi.
  • Nomi di prodotti.
  • Nomi di persone.
  • Termini di settore.
  • Abbreviazioni.
  • Vocabolario interno.

Quando il modello generico non incontra abbastanza frequentemente una parola rara, le hotword possono apportare un valore significativo.

Gli esempi includono:

Nomi di farmaci proprietari
Modelli di macchinari di fabbrica
Codici account cliente
Marchi di nuova introduzione
Abbreviazioni tecniche

Il prodotto ASR generico di Tencent Cloud dispone già di API per elenchi di hotword e del parametro hotword_id.

Tuttavia, l'attuale documentazione dell'anteprima Hy ASR 3.0 specifica chiaramente che il potenziamento con hotword non è ancora disponibile per questo motore in anteprima.

Pertanto, la promozione pubblica del prodotto dovrebbe essere distinta dallo stato effettivo delle API accessibili:

Capacità Note di rilascio del modello Stato API anteprima attuale
Potenziamento con hotword Descritta come capacità supportata Elencata come in arrivo
Inserimento contestuale Descritta come capacità principale Elencata come in arrivo
Modellazione linguistica contestuale interna Caratteristica centrale del modello Disponibile tramite il comportamento del modello

Fino a quando Tencent Cloud non confermerà il supporto nella documentazione API ufficiale, le aziende non dovrebbero pianificare rilasci che dipendono dall'inserimento di contesto esterno o da elenchi di hotword.

4. Riconoscimento più stabile in condizioni acustiche difficili

Tencent ha dichiarato che il modello è ottimizzato per:

  • Elevato rumore di fondo.
  • Sussurri.
  • Voce bassa.
  • Diversi ambienti di registrazione.
  • Molteplici accenti.
  • Condizioni acustiche a coda lunga.

La robustezza al rumore è importante perché il parlato reale raramente si presenta come registrazioni pulite in laboratorio.

I microfoni del servizio clienti possono catturare il suono della tastiera e le voci dei colleghi vicini.

Gli assistenti mobili possono sentire rumore del traffico, vento, musica o altre persone che parlano.

Le applicazioni per riunioni possono ricevere audio compresso da microfoni di laptop distanti.

Il modello può migliorare la robustezza, ma non può recuperare informazioni mai catturate.

I team dovrebbero comunque utilizzare:

  • Microfoni adeguati.
  • Cancellazione dell'eco.
  • Controllo del guadagno.
  • Rilevamento dell'attività vocale ove supportato.
  • Compressione audio ragionevole.
  • Monitoraggio dei canali.
  • Procedure di ripetizione o chiarimento.

La qualità ASR è una proprietà del sistema, non solo del modello.

Architettura: encoder vocale plus Hy3

Tencent ha dichiarato che Hunyuan Hy ASR 3.0 Preview combina tre componenti principali:

  1. Una base modello linguistico MoE basata su Hy3.
  2. Un encoder vocale non supervisionato proprietario.
  3. Pre-addestramento congiunto e post-addestramento multistadio.

Questa immagine mostra l'architettura centrale e i contenuti di aggiornamento delle capacità di Tencent Hunyuan Hy ASR 3.0 Preview, includendo tre parti principali. La prima parte è l'aggiornamento dell'architettura, basata su Hy3, combinata con l'encoder vocale proprietario, realizzando una doppia trazione per migliorare la capacità di comprensione vocale. La seconda parte è lo scaling del pre-addestramento, attraverso la modellazione congiunta di dati multi-sorgente, addestrando congiuntamente voce e modello linguistico, iniettando capacità multistadio e supportando il riconoscimento multilingue e contestuale. La terza parte è il potenziamento post-addestramento, ottimizzato per audio complessi e contesti arbitrari, migliorando le capacità del modello attraverso l'apprendimento per rinforzo multistadio, raggiungendo infine un aggiornamento completo delle capacità complessive.

Hy3 come base linguistica

Hy3 fornisce i componenti di comprensione linguistica.

Le sue funzioni includono:

  • Modellare il contesto della frase.
  • Risolvere candidati ambigui.
  • Comprendere strutture linguistiche miste.
  • Sfruttare le relazioni semantiche.
  • Migliorare la coerenza dell'output.

Tencent descrive questa architettura come un design a miscela di esperti (MoE) che bilancia capacità ed efficienza.

La documentazione ASR pubblica non rivela il numero totale di parametri, i parametri attivi, il profilo di latenza o l'architettura di inferenza completa di Hy ASR 3.0 Preview.

Encoder vocale non supervisionato

L'encoder vocale converte l'audio grezzo in rappresentazioni acustiche che il modello linguistico può elaborare.

Tencent ha dichiarato che l'encoder è stato addestrato utilizzando decine di milioni di ore di parlato non etichettato.

L'addestramento audio non supervisionato o auto-supervisionato è prezioso perché la trascrizione manuale di dati vocali su questa scala sarebbe proibitivamente costosa.

L'encoder può apprendere strutture ricorrenti dall'audio grezzo, come:

  • Schemi vocali.
  • Differenze tra parlanti.
  • Variazioni di accento.
  • Condizioni di fondo.
  • Tempi e prosodia.

La qualità di questa rappresentazione influenza tutte le fasi successive.

Se due suoni vengono confusi nella fase dell'encoder, il modello linguistico deve fare maggiore affidamento sul contesto per recuperare le parole corrette.

Pre-addestramento congiunto di voce e linguaggio

Tencent ha dichiarato che l'encoder vocale e il modello linguistico sono stati addestrati congiuntamente utilizzando set di dati vocali multi-sorgente su larga scala che coprono:

  • Dialetti.
  • Accenti.
  • Ambienti acustici.
  • Diverse popolazioni di parlanti.
  • Schemi linguistici contestuali.
  • Addestramento

congiunto progettato per ridurre il divario tra riconoscimento acustico e comprensione linguistica.

Invece di trattare il riconoscimento vocale come:

Il modello audio completa
→ Il modello linguistico successivamente pulisce la trascrizione

Hy ASR 3.0 è presentato come un processo più integrato:

Rappresentazione vocale e modellazione linguistica
→ Addestrati per lavorare insieme
→ Producono una trascrizione contestualizzata

I confini interni esatti tra encoder, decoder, modello linguistico e fasi di apprendimento per rinforzo non sono stati completamente divulgati.

## SFT e apprendimento per rinforzo multistadio

Tencent descrive uno schema di fine-tuning supervisionato che copre:

- Trascrizione generale.
- Attività contestuali arbitrarie.
- Terminologia specialistica.
- Diversi ambienti acustici.
- Popolazioni di parlanti diversificate.
- Dieci principali aree dialettali.
- Più di 20 aree dialettali minori.

L'azienda riporta anche l'uso di apprendimento per rinforzo multistadio per:

- Accuratezza della trascrizione generale.
- Comportamento contestuale.
- Casi complessi a coda lunga.
- Riduzione degli errori di sostituzione e cancellazione.

Attualmente non esiste un documento tecnico pubblico che fornisca la progettazione completa delle ricompense, il bilanciamento dei dati, la potenza di calcolo dell'addestramento o i risultati degli studi di ablazione.

Pertanto, le dichiarazioni sull'architettura dovrebbero essere considerate descrizioni tecniche a livello di prodotto, non specifiche di ricerca riproducibili.

## Lingue e dialetti attualmente supportati dal motore Tencent Cloud

La documentazione Tencent Cloud descrive l'attuale motore `Hy-ASR-3.0-preview` come supporto per:

- Mandarino.
- Inglese.
- 20 dialetti o varianti regionali cinesi.

L'elenco dei dialetti fornito dalla documentazione è il seguente:

| N. | Dialetto o variante regionale |
|-|-|
| 1 | Cantonese |
| 2 | Dialetto del nord-est |
| 3 | Dialetto dello Henan |
| 4 | Dialetto dello Shaanxi |
| 5 | Chengdu |
| 6 | Chongqing |
| 7 | Wuhan |
| 8 | Guiyang |
| 9 | Qingdao |
| 10 | Jinan |
| 11 | Changsha |
| 12 | Hefei |
| 13 | Dialetto dello Hebei |
| 14 | Kunming |
| 15 | Lanzhou |
| 16 | Yinchuan |
| 17 | Nanchang |
| 18 | Pechinese |
| 19 | Sichuanese |
| 20 | Tientsinese |

Le etichette dialettali nella documentazione ASR commerciale sono ampie categorie di prodotto.

Il parlato reale all'interno di ciascuna categoria varia in base a città, età, contesto sociale, commutazione di codice, vocabolario e parlante.

Affermare che una determinata varietà linguistica sia supportata non deve essere interpretato come garanzia di uguale accuratezza per ogni parlante in quella regione.

## Disponibilità attuale dell'anteprima

Tencent Cloud ha aggiunto il motore Hy ASR 3.0 in versione anteprima al prodotto WebSocket in tempo reale in data **4 agosto 2026**.

Questo servizio pubblico è attualmente descritto come una versione di test interno o anteprima.

| Elemento | Stato documentato attuale |
|-|-|
| Tipo di prodotto | Riconoscimento vocale in tempo reale |
| Modalità di accesso | API WebSocket di Tencent Cloud |
| Nome del motore | `Hy-ASR-3.0-preview` |
| Durata audio | Non più di 60 secondi per input |
| Formato audio | PCM mono 16 kHz |
| Concorrenza inclusa | 20 canali concorrenti |
| Mandarino | Supportato |
| Inglese | Supportato |
| 20 dialetti | Supportati |
| Separazione dei parlanti | Non supportata nell'anteprima |
| Supporto parametri VAD | Elencato come non supportato nell'anteprima |
| Sostituzione parole | Non supportata nell'anteprima |

Parametro soglia rumore | Non supportato nell'anteprima |
| Input contestuale esterno | In arrivo |
| Potenziamento parole chiave di attivazione | In arrivo |

Il riferimento API WebSocket generico include parametri utilizzati da altri motori, inclusi VAD e ID parole chiave di attivazione.

Hy ASR 3.0 fa riferimento alle note specifiche dell'anteprima del motore.

La presenza di un parametro nel modello API condiviso non garantisce che il motore in anteprima lo abbia già implementato.

## Flusso di base dell'integrazione Tencent Cloud

La configurazione ufficiale è suddivisa in tre fasi principali.

## Passaggio 1: Attivare il servizio di riconoscimento vocale Tencent Cloud

Aprire il servizio di riconoscimento vocale Tencent Cloud e completare la procedura di attivazione dell'account.

La documentazione ufficiale di avvio rapido si trova qui:

```Plaintext
https://cloud.tencent.com/document/product/1093/54362

Prima di abilitare la fatturazione post-pagamento, consultare le note sulla fatturazione.

Tencent Cloud segnala che per i nuovi account la fatturazione post-pagamento è disabilitata per impostazione predefinita e deve essere attivata manualmente.

Passaggio 2: Creare le credenziali API

Creare o ottenere:

  • AppID
  • SecretID
  • SecretKey

Queste credenziali vengono utilizzate per firmare le richieste di connessione WebSocket.

Conservarle in un gestore di segreti o in variabili d'ambiente protette.

Non inserire credenziali valide a lungo termine in:

  • Codice JavaScript frontend.
  • Codice sorgente di app mobili.
  • Repository di codice pubblici.
  • Documenti condivisi.
  • URL visibili al client.

Per i prodotti browser o mobile, creare le informazioni di connessione firmate in un backend attendibile.

Passaggio 3: Connettersi all'endpoint WebSocket in tempo reale

Il formato dell'endpoint documentato nella documentazione Tencent Cloud è:

wss://asr.cloud.tencent.com/asr/v2/<appid>?{request_parameters}

Sostituire <appid> con l'AppID Tencent Cloud.

La richiesta include parametri di firma, ad esempio:

  • secretid
  • timestamp
  • expired
  • nonce
  • voice_id
  • engine_model_type

Per l'anteprima Hy ASR 3.0, impostare:

engine_model_type=Hy-ASR-3.0-preview

Ogni connessione WebSocket richiede un voice_id univoco.

Se la connessione termina o fallisce, il vecchio voice_id non è più valido ed è necessario generarne uno nuovo.

Passaggio 4: Preparare audio compatibile

L'anteprima attuale richiede:

Frequenza di campionamento: 16 kHz
Canali: mono
Formato: PCM
Durata massima input: 60 secondi

Testare l'intera catena audio, non solo il file originale.

Gli SDK per microfoni, le API multimediali del browser, i sistemi telefonici e le piattaforme di conferenza potrebbero ricampionare o comprimere l'audio prima che raggiunga il server.

Passaggio 5: Trasmettere l'audio e leggere i risultati incrementali

Il servizio supporta la trascrizione in tempo reale, restituendo testo mentre l'audio viene trasmesso.

L'applicazione deve gestire:

  • Risultati parziali.
  • Risultati finali.
  • Errori di connessione.
  • Errori di autenticazione.
  • Timeout.
  • Riconnessioni.
  • Limiti di durata audio.
  • Testo duplicato o corretto.

Non presupporre che ogni risultato di riconoscimento parziale sia definitivo.

L'interfaccia ASR in tempo reale può rivedere parole precedenti man mano che riceve più contesto.

L'interfaccia utente deve distinguere tra testo provvisorio e testo confermato.

Passaggio 6: Test pre-rilascio

Costruire un set di valutazione rappresentativo che includa:

  • Audio reale dei clienti.
  • Accenti comuni.
  • Dialetti.
  • Miscela cinese-inglese.
  • Nomi di persone e terminologia di prodotto.

Rumore.

  • Bisbigli.
  • Qualità microfono scadente.
  • Comandi brevi.
  • Frasi complete.

Misurare sia la qualità del riconoscimento che il comportamento del sistema.

Prezzi del motore in anteprima

Tencent Cloud classifica Hy ASR 3.0 in anteprima come motore di riconoscimento vocale in tempo reale Large Model 2.0.

La pagina di fatturazione attuale elenca:

Opzione di fatturazione Prezzo attuale
Pacchetto prepagato 60 ore Totale 60 yuan, ovvero 1,00 yuan/ora
Pacchetto prepagato 1.000 ore Totale 950 yuan, ovvero 0,95 yuan/ora
Pacchetto prepagato 10.000 ore Totale 9.000 yuan, ovvero 0,90 yuan/ora
Pacchetto prepagato 100.000 ore Totale 88.000 yuan, ovvero 0,88 yuan/ora
Pacchetto prepagato 300.000 ore Totale 255.000 yuan, ovvero 0,85 yuan/ora
Post-pagamento 1,00 yuan/ora, saldo giornaliero

La tabella tariffaria attuale di Tencent mostra che il riconoscimento Large Model 2.0 non prevede alcuna quota audio gratuita.

I 20 canali concorrenti inclusi rappresentano una quota di concorrenza, non minuti di riconoscimento gratuiti.

I prezzi possono variare. Prima di pubblicare offerte commerciali o stimare budget a lungo termine, consultare la pagina di fatturazione in tempo reale.

Esempio di costo

In base alla tariffa post-pagamento attuale di 1,00 yuan/ora:

100 ore di riconoscimento riuscito
× 1,00 yuan/ora
= 100 yuan

Il budget di produzione dovrebbe includere anche:

  • Preprocessing audio.
  • Trasferimento di rete.
  • Server backend.
  • Archiviazione.
  • Monitoraggio.
  • Correzione manuale.
  • Traffico di nuovi tentativi.
  • Elaborazione downstream del modello linguistico.

Il costo ASR è solo una parte del sistema di trascrizione completo.

Integrazione con Yuanbao e prodotti

Tencent dichiara che Yuanbao ha partecipato allo sviluppo del modello ed è stato il primo prodotto Tencent a integrarlo.

Gli utenti possono provare la funzionalità tramite l'input vocale in Yuanbao; il modello è progettato per migliorare:

  • Riconoscimento dei dialetti.
  • Correzione contestuale degli errori.
  • Riconoscimento in condizioni acustiche difficili.

Tencent dichiara che altri prodotti come WorkBuddy stanno gradualmente integrando la funzionalità.

La modalità di integrazione nei prodotti consumer potrebbe differire dall'API pubblica dell'anteprima Tencent Cloud.

Ad esempio, Yuanbao potrebbe utilizzare servizi interni, contesto specifico del prodotto o configurazioni di distribuzione non ancora aperte agli sviluppatori esterni.

Non si deve presupporre che l'esperienza in Yuanbao corrisponda uno a uno con i parametri dell'API pubblica.

Scenari applicativi

L'anteprima Hy ASR 3.0 è pensata per interazioni vocali brevi e a bassa latenza.

Assistenza clienti intelligente

Gli usi potenziali includono:

  • Trascrizione in tempo reale per agenti.
  • Riconoscimento dei comandi per bot vocali.
  • Generazione di verbali delle chiamate.
  • Estrazione delle intenzioni.
  • Supporto al controllo qualità.

L'anteprima attuale non dispone della separazione dei parlanti, il che potrebbe limitare la trascrizione di chiamate multi-parte a meno che altri componenti non gestiscano la separazione dei canali o dei parlanti.

Sottotitoli in tempo reale

Il motore può supportare sottotitoli in tempo reale di breve durata per:

  • Video in live streaming.
  • Stanze audio.
  • Riunioni interne.
  • Messaggi vocali.
  • Interfacce accessibili.

Le applicazioni dovrebbero testare la stabilità dei risultati parziali e il comportamento della punteggiatura.

Ricerca vocale

Il riconoscimento sensibile al contesto può migliorare le ricerche che coinvolgono:

  • Domande in linguaggio naturale con frasi lunghe.
  • Nomi di prodotti.
  • Miscela cinese-inglese.
  • Pronunce regionali.

Fino a quando l'anteprima non aprirà l'iniezione di parole calde, i termini rari o di settore potrebbero ancora richiedere post-elaborazione o un livello separato di correzione degli errori.

Comandi vocali e assistenti

Il motore può convertire istruzioni parlate in testo per:

  • Assistenti IA.
  • Agenti intelligenti aziendali.

Controllo dei dispositivi intelligenti.

  • Comandi del flusso di lavoro.

Il sistema di comandi non dovrebbe mai eseguire azioni ad alto impatto solo perché un risultato di trascrizione sembra avere un'alta confidenza.

Per operazioni distruttive o finanziarie, è necessario confermare l'intento parsato e richiedere l'approvazione esplicita dell'utente.

Comprensione del contenuto

Brevi clip audio possono essere trascritte prima di essere inviate ai seguenti flussi:

  • Generazione di riepiloghi.
  • Classificazione.
  • Indicizzazione per la ricerca.
  • Moderazione dei contenuti.
  • Estrazione di conoscenza.

La qualità di ogni fase di elaborazione AI a valle dipende dal risultato della trascrizione.

Quando le policy lo consentono, archiviare l'audio originale o le prove di confidenza, così che gli output incerti possano essere revisionati.

Limitazioni attuali

Stato di anteprima

Il prodotto è ancora contrassegnato come anteprima o versione beta interna.

Interfaccia, prezzi, limitazioni e funzionalità supportate possono cambiare.

Limite di input di sessanta secondi

L'attuale API pubblica non può sostituire direttamente la trascrizione batch di registrazioni lunghe.

L'audio lungo deve essere segmentato e potrebbe richiedere un livello di contesto applicativo.

Supporto solo per input PCM

La versione di anteprima attualmente richiede PCM mono a 16 kHz.

Molti ambienti di produzione utilizzano MP3, AAC, Opus o codec telefonici, che richiedono conversione.

Nessun supporto per la separazione dei parlanti

La documentazione esclusiva del motore attuale afferma che la separazione dei parlanti non è supportata.

La trascrizione multi-parlante potrebbe richiedere canali audio separati o altri servizi di separazione dei parlanti.

Funzionalità di contesto e hotword non ancora pubbliche

Secondo la documentazione ufficiale, le capacità annunciate non sono ancora state rese disponibili come funzionalità API di anteprima utilizzabili.

Dati benchmark riportati dall'azienda

I grafici di benchmark provengono da Tencent.

Una valutazione indipendente in condizioni corrispondenti aumenterebbe la credibilità del confronto.

Nessun documento tecnico completo

Tencent ha fornito una descrizione di alto livello dell'architettura e del processo di addestramento di Hy ASR 3.0 in anteprima, ma non ha ancora pubblicato dettagli completi e riproducibili.

Il contesto potrebbe causare una correzione eccessiva

Il decodificatore linguistico potrebbe preferire frasi comuni, ignorando contenuti pronunciati correttamente ma insoliti.

I test devono includere frasi rare e inaspettate.

Checklist di valutazione pratica

1. Costruire un set di test di dominio

Includere almeno diverse centinaia di enunciati rappresentativi, non solo un piccolo numero di campioni dimostrativi puliti.

2. Conservare il testo di riferimento originale

Creare trascrizioni di riferimento verificate manualmente utilizzando una strategia di normalizzazione chiara.

Decidere come gestire:

  • Punteggiatura.
  • Numeri.
  • Maiuscole/minuscole in inglese.
  • Parole di riempimento.
  • Contenuti ripetuti.
  • Cinese tradizionale e semplificato.

3. Misurare più metriche

Utilizzare:

  • Tasso di errore di parola o tasso di errore di carattere.
  • Accuratezza dei nomi.
  • Accuratezza dei numeri.
  • Tasso di errore semantico.
  • Latenza.
  • Tasso di revisione dei risultati parziali.
  • Tasso di fallimento.

4. Testare i dialetti separatamente

Non aggregare tutti i parlanti di dialetti in un'unica media.

Riportare i risultati separatamente per regione e condizioni di registrazione.

5. Testare l'ambiguità contestuale

Creare coppie di campioni con contenuto acustico simile ma con contesto frasale che cambia il risultato corretto della trascrizione.

6. Testare termini rari

Valutare i nomi dei prodotti e

Per ora, gestire i termini; ripetere i test dopo che Tencent avrà aperto il supporto per le hotword.

7. Testare scenari con rumore e sussurri

Utilizzare registrazioni ambientali reali, non solo rumore aggiunto digitalmente.

8. Testare i confini di segmentazione

Confermare che l'implementazione di segmentazione di 60 secondi non interrompa frasi importanti né generi testo duplicato.

9. Misurare la latenza end-to-end

Includere le seguenti fasi:

Acquisizione
+ Caricamento
+ Riconoscimento
+ Finalizzazione del risultato
+ Elaborazione a valle

10. Revisionare i requisiti di privacy e conformità

Le registrazioni vocali possono contenere informazioni personali o sensibili.

Prima della distribuzione, è necessario definire chiaramente le politiche di conservazione dei dati, controllo degli accessi, crittografia, consenso dell'utente e cancellazione.

Confronto tra Hy ASR 3.0 in anteprima e pipeline ASR tradizionale

Dominio Pipeline tradizionale Direzione Hy ASR 3.0
Focus principale Accuratezza da acustica a testo Riconoscimento acustico più modellazione linguistica contestuale
Omofoni facilmente confondibili Solitamente si basa su probabilità locali Utilizza un contesto frasale più ampio
Dialetti Modelli separati o copertura limitata Un unico motore ibrido documentato con supporto per 20 dialetti
Vocabolario specializzato Hotword esterne o modelli personalizzati Capacità hotword annunciate; supporto in anteprima da aprire
Voce complessa Modello acustico più post-elaborazione Addestramento congiunto voce-linguaggio più addestramento successivo
Output Testo trascritto Testo trascritto con contesto più coerente
Rischio principale Sostituzioni acustiche e omissioni Errori acustici più possibile correzione semantica eccessiva

Il nuovo approccio non elimina la necessità dell'ingegneria ASR tradizionale.

Aggiunge un livello linguistico più forte sullo stesso sistema end-to-end.

Domande frequenti

Cos'è Hy ASR 3.0 in anteprima?

Hy ASR 3.0 in anteprima è un modello di riconoscimento vocale in tempo reale lanciato da Tencent Hunyuan basato sulla base linguistica Hy3 e su un codificatore vocale proprietario. Il suo obiettivo di progettazione è combinare il riconoscimento acustico con la comprensione linguistica contestuale.

Quali lingue e dialetti supporta Hy ASR 3.0?

La documentazione Tencent Cloud indica il supporto per il cinese mandarino, l'inglese e 20 dialetti o varianti regionali cinesi, inclusi cantonese, dialetto del nord-est, henanese, shaanxi, chengdu, chongqing, wuhan, ecc. L'accuratezza può variare tra parlanti e regioni diverse.

Qual è il WER (tasso di errore di parola) pubblicato?

Tencent ha pubblicato risultati WER aggregati su benchmark pubblici: mandarino 3,34%, inglese 2,62%, cantonese 3,12%. Questi sono risultati riportati dall'azienda su più dataset aggregati, non risultati di test unificati riprodotti in modo indipendente.

Hy ASR 3.0 può trascrivere registrazioni lunghe?

L'attuale anteprima pubblica accetta al massimo 60 secondi di audio per input. Registrazioni più lunghe richiedono elaborazione segmentata e l'applicazione deve mantenere un contesto valido tra i segmenti.

L'API attuale supporta hotword e contesto personalizzato?

Secondo la documentazione di anteprima di Tencent Cloud del 4 agosto 2026, attualmente non è supportato. I materiali di rilascio descrivono queste capacità, ma la pagina API ufficiale indica che l'input contestuale e il potenziamento hotword saranno aperti in seguito.

Quali formati audio sono supportati?

La documentazione attuale di Hy ASR 3.0 in anteprima specifica il supporto per input PCM mono a 16 kHz. Le applicazioni che utilizzano MP3, AAC, Opus o altri formati devono convertire l'audio prima della chiamata.

Inviarlo a questo motore.

Come possono gli sviluppatori chiamare Hy ASR 3.0?

Gli sviluppatori utilizzano l'API WebSocket di riconoscimento vocale in tempo reale di Tencent Cloud e impostano engine_model_type su Hy-ASR-3.0-preview. La connessione deve essere firmata con le credenziali Tencent Cloud.

Hy ASR 3.0 è gratuito?

L'attuale pagina dei prezzi di Tencent Cloud non elenca una quota audio gratuita per il riconoscimento del modello grande 2.0. La pagina mostra piani prepagati a partire da 60 ore a 1 RMB/ora e post-pagati a 1 RMB/ora, con 20 sessioni concorrenti incluse.

Strumenti correlati

  • Anteprima ASR Hunyuan di Tencent Cloud: documentazione ufficiale su funzionalità, limitazioni, dialetti e accesso rapido di Hy ASR 3.0 in anteprima.
  • API WebSocket ASR in tempo reale di Tencent Cloud: documentazione ufficiale su endpoint, parametri di autenticazione, selezione del motore e risposte.
  • API Explorer di Tencent Cloud: interfaccia ufficiale di Tencent per controllare le API e generare esempi di richieste SDK.
  • SDK Python di Tencent Cloud: SDK Python ufficiale per API e gestione delle credenziali Tencent Cloud.
  • FFmpeg: toolkit open source per audio e video, utile per convertire l'audio in ingresso al formato di campionamento e layout dei canali compatibile.
  • Websocat: client WebSocket da riga di comando, adatto per testare endpoint in streaming durante lo sviluppo.

Link correlati

com/document/product/1093/135476): stato ufficiale attuale, dialetti supportati, limitazioni e configurazione di base.

Riepilogo

La versione di anteprima Hy ASR 3.0 di Tencent Hunyuan combina l'encoder vocale con le capacità del modello linguistico Hy3 per migliorare la trascrizione di mandarino, inglese, dialetti, lingue miste, ambienti rumorosi e contesti correlati.

Tencent riporta un WER del 3,34% per il mandarino, del 2,62% per l'inglese e del 3,12% per il cantonese su dataset pubblici aggregati, ottenendo risultati leader nei propri test su scenari interni. Questi numeri sono promettenti, ma devono ancora essere verificati sui file audio delle singole organizzazioni.

L'attuale anteprima di Tencent Cloud ha una portata più limitata rispetto alla visione completa del rilascio.

Supporta il riconoscimento WebSocket in tempo reale, audio PCM mono a 16 kHz e input audio fino a 60 secondi. Iniezione di contesto esterno, potenziamento con parole calde, separazione dei parlanti e altre funzionalità non sono ancora disponibili su questo motore.

Il cambiamento fondamentale non è che il riconoscimento vocale non ascolti più il suono, ma che il modello linguistico ora aiuta a determinare il significato più probabile di ciò che viene detto.

腾讯混元 Hy ASR 3.0 预览版:面向普通话、英语及20种方言的上下文感知语音识别