Grok Voice Think Fast 2.0: Modelo de agente de voz mais rápido e preciso da xAI

Grok Voice Think Fast 2.0: Modelo de agente de voz mais rápido e preciso da xAI. Guia do Grok Voice Think Fast 2.0: benchmarks, preços, precisão e migração. O Grok Voice Think Fast 2.0 da xAI melhora o raciocínio de voz, precisão de transcrição, desempenho de agente e latência. Confira benchmarks, preços, resultados com Starlink e detalhes da migração em 5 de agosto. Grok Voice Think Fast 2.0, agente de voz da xAI, API Grok Voice, IA de voz para voz, modelo de agente de voz, preços do Grok Voice, benchmark de voz com IA, transcrição

发布于 2026年7月30日generalGEO 评分: 06 次阅读
Grok Voice Think Fast 2.0: Modelo de agente de voz mais rápido e preciso da xAI

Grok Voice Think Fast 2.0: o modelo de agente de voz mais rápido e preciso da xAI

Introdução

A xAI lançou o Grok Voice Think Fast 2.0, seu modelo de voz para voz de próxima geração para o desenvolvimento de agentes de voz em tempo real.

A nova versão foca nos quatro aspectos mais importantes para sistemas de voz em produção: nível de inteligência, precisão da transcrição, comportamento em diálogo e chamadas confiáveis de ferramentas. A xAI afirma que, na maioria dos casos, aplicações existentes podem migrar para o novo modelo sem reescrever prompts.

O Think Fast 2.0 tem o preço de US$ 0,08 por minuto de áudio. Os desenvolvedores podem usar o nome do modelo com versão grok-voice-think-fast-2.0, enquanto o alias grok-voice-latest está programado para mudar da versão 1.0 para a 2.0 em 5 de agosto de 2026.

O modelo é projetado para cargas de trabalho reais de agentes de voz, como suporte ao cliente, vendas, automação de chamadas e fluxos de trabalho empresariais com várias etapas – cenários nos quais o agente deve entender a fala, raciocinar, chamar ferramentas e responder rapidamente para manter o fluxo natural da conversa.

Grok Voice Think Fast 2.0 melhora em todos os principais benchmarks de voz

A xAI publicou resultados de benchmarks da Artificial Analysis, comparando o Think Fast 2.0 com seu antecessor, o GPT-Realtime-2.1 da OpenAI e o Gemini 3.1 Flash do Google.

Imagem de um tweet da SpaceX AI sobre o Grok Voice Think Fast 2.0. O conteúdo mostra que o modelo é a próxima geração de modelo de voz, com inteligência, precisão de transcrição e capacidade de diálogo aprimoradas. A tabela compara o Grok Voice Think Fast 2.0, Think Fast 1.0, GPT-Realtime-2.1 (High) e Gemini 3.1 Flash (High) em vários aspectos, como Índice de Qualidade de Voz AA, Raciocínio de Voz, Dinâmica de Diálogo, Desempenho de Agente e Velocidade, com o Grok Voice Think Fast 2.0 se destacando em vários indicadores, como Índice de Qualidade de Voz AA de 82,9% e velocidade de 0,70 segundos. A imagem se alinha com o conteúdo de comparação de desempenho do Grok Voice Think Fast 2.0 no documento.

Os resultados relatados são os seguintes:

Benchmark Grok Voice Think Fast 2.0 Think Fast 1.0 GPT-Realtime-2.1 High Gemini 3.1 Flash High
Índice de Qualidade de Voz AA 82,9% 75,7% 79,1% 69,5%
Big Bench Áudio 97,2% 97,1% 96,0% 96,6%
Teste Full-Duplex 95,1% 77,8% 95,7% 74,3%
Teste τ-Voz 56,5% 52,1% 45,7% 37,7%
Tempo de primeira resposta de áudio 0,70s 1,25s 2,98s

Comparado ao Think Fast 1.0, o Índice de Qualidade de Voz geral da Artificial Analysis foi de 75,7% para 82,9%.

As mudanças práticas mais significativas estão na dinâmica do diálogo, desempenho do agente e latência de resposta.

Raciocínio de Voz

No teste Big Bench Áudio, o Think Fast 2.0 obteve 97,2%, apenas ligeiramente acima dos 97,1% da geração anterior.

Isso indica que esta versão não busca um salto expressivo na capacidade bruta de raciocínio de voz. Em vez disso, a maior parte da melhoria está no comportamento do modelo durante conversas em tempo real.

Dinâmica de Diálogo

O Think Fast 2.0 alcançou 95,1% no teste Full-Duplex, contra 77,8% do Think Fast 1.0.

O teste Full-Duplex avalia comportamentos como: timing de fala, lidar com pausas, responder a interrupções, reconhecer sinais de feedback e manter a troca natural de turnos.

O GPT-Realtime-2.1 High pontuou ligeiramente mais alto no teste individual, com 95,7%, portanto o modelo da xAI não lidera em todas as categorias.

Desempenho de Agente

No teste τ-Voz, mais focado em avaliar se o agente de voz consegue concluir tarefas reais, o Think Fast 2.0 obteve 56,5%.

Esse resultado é superior aos 52,1% do Think Fast 1.0, 45,7% do GPT-Realtime-2.1 High e 37,7% do Gemini 3.1 Flash High.

Esta métrica é particularmente importante para agentes de atendimento ao cliente e vendas, pois apenas um áudio de conversa de alta qualidade não é suficiente. O sistema também precisa seguir instruções corretamente, usar ferramentas, coletar informações e concluir fluxos de trabalho.

Primeira resposta de áudio mais rápida

A xAI relata um tempo de primeira resposta de áudio de 0,70 segundos, abaixo dos 1,25 segundos do Think Fast 1.0.

A latência mais baixa reduz o silêncio constrangedor entre o momento em que o usuário termina de falar e o início da resposta da IA.

A Artificial Analysis atualmente classifica o Think Fast 2.0 como um dos sistemas de voz para voz com resposta mais rápida já medidos, embora não seja o modelo mais rápido em toda a classificação.

Precisão de transcrição aprimorada em 24 idiomas

A xAI também testou o Think Fast 2.0 usando milhares de amostras curtas de fala em 24 idiomas.

De acordo com a empresa, em sua avaliação, a precisão de transcrição do novo modelo é cerca de 1,5 a 2,0 vezes maior que a do Deepgram Nova 3 e do ElevenLabs Scribe v2, e cerca de 1,4 vezes maior que a do Grok Voice Think Fast 1.0. A xAI

Também indica que, em certos ambientes ruidosos e com compressão telefónica, a diferença pode aumentar para cerca de 10 vezes.

Estes dados provêm das próprias avaliações de transcrição da xAI, e não de tabelas de referência de análises de inteligência artificial. Esta distinção é importante porque as comparações de referência e os testes de transcrição medem métricas diferentes e provêm de contextos de avaliação distintos.

A ênfase no áudio ruidoso tem um grande significado para agentes de voz em ambientes de produção. As chamadas reais incluem frequentemente compressão de rede móvel, microfones de baixa qualidade, ruído de estrada ou de escritório, sotaques, fala rápida, interrupções, frases incompletas, nomes, endereços e detalhes de contas.

O modelo raciocina enquanto fala

Uma das escolhas de design mais peculiares do Grok Voice Think Fast é o raciocínio paralelo.

xAI

O modelo pode continuar a raciocinar enquanto fala, em vez de completar todo o raciocínio antes de gerar áudio. Este design visa reduzir o compromisso entre inteligência e latência.

O Think Fast 2.0 também utiliza menos tokens de raciocínio do que a geração anterior. A xAI reporta as seguintes utilizações relativas medianas de tokens de raciocínio:

Modelo Tokens de raciocínio relativos por resposta
Grok Voice Think Fast 2.0 0.4×
Grok Voice Think Fast 1.0 1.0×

A empresa afirma que isto acelera a invocação de ferramentas, permitindo que estas sejam executadas antes de o assistente inteligente terminar a primeira frase.

Por exemplo, um assistente de apoio ao cliente pode começar por dizer "Deixe-me verificar isso para si..." enquanto, em segundo plano, invoca a ferramenta de consulta de conta. Quando a introdução falada terminar, o resultado da ferramenta pode já estar disponível para a próxima parte da resposta.

Aprendizagem por reforço torna o diálogo mais conciso

A xAI afirma que o Think Fast 2.0, através de uma extensa aprendizagem por reforço, se tornou mais parecido com um operador humano prático em conversas reais.

O modelo é encorajado a usar frases mais curtas, fazer apenas uma pergunta de cada vez, evitar palavras de enchimento desnecessárias, manter o foco da conversa e não expor complexidades desnecessárias ao guiar o utilizador por processos complexos.

Isto pode parecer uma pequena alteração, mas as interfaces de voz toleram muito menos respostas longas do que o chat de texto. Respostas longas podem ser aceitáveis no ecrã, mas ouvi-las durante uma chamada é frustrante.

Uso de ferramentas é parte central da API de Voz

Atualmente, a API de voz para voz da xAI suporta diretamente vários tipos de ferramentas em sessões de voz:

  • file_search
  • web_search
  • x_search
  • Ferramentas MCP remotas
  • Funções personalizadas

Isto permite que os assistentes de voz vão além de simples perguntas e respostas.

Dependendo das permissões fornecidas pela aplicação, o assistente inteligente pode compreender o pedido do interlocutor, pesquisar documentos aprovados, consultar informações de conta, invocar APIs de negócio, executar ações permitidas e explicar os resultados por voz.

Para ambientes de produção, as aplicações ainda precisam de definir limites de permissão rigorosos. Mesmo que o modelo tenha capacidade para invocar ferramentas sensíveis, não lhe deve ser concedido acesso diretamente.

Starlink está a testar A/B o Think Fast 2.0

O Grok Voice já é utilizado nos fluxos de trabalho de vendas e apoio ao cliente baseados em chamadas telefónicas da Starlink.

A xAI afirma que já realizou testes A/B do Think Fast 2.0 na linha telefónica da Starlink através do +1 888 GO STARLINK.

A empresa reporta melhorias significativas tanto na taxa de conversão de vendas como na taxa de resolução de problemas de apoio ao cliente.

A xAI não divulgou as percentagens específicas de melhoria dos testes A/B do Think Fast 2.0 no seu anúncio.

Isto não deve ser confundido com dados públicos anteriores relativos à implementação original do Think Fast 1.0. A xAI reportou então uma taxa de conversão de vendas de 20% e uma taxa de resolução autónoma de problemas de apoio ao cliente de 70%. O anúncio da versão 2.0 indica apenas que a nova versão melhorou os resultados existentes da Starlink.

Preços: 0,08 dólares por minuto

A página oficial de preços da xAI lista:

Modelo de Voz Preço de Áudio
grok-voice-think-fast-1.0 0,05 USD/minuto
grok-voice-think-fast-2.0 0,08 USD/minuto

Assim, o custo de áudio do Think Fast 2.0 é de 4,80 dólares por hora,

com base nas tarifas já publicadas da API.

A entrada de texto da API de voz para voz é faturada separadamente, a 0,004 dólares.

Ferramentas adicionais do lado do servidor também podem gerar custos independentes. Por exemplo, a xAI atualmente precifica a pesquisa na web, pesquisa X e execução de código a 5 dólares por cada 1000 invocações de ferramenta.

Portanto, os programadores devem calcular o custo total com base no fluxo de trabalho completo, e não apenas multiplicar a tarifa de áudio.

grok-voice-latest Mudará para a Versão 2.0 em 5 de agosto de 2026

Os programadores que já utilizam a API Grok Voice precisam de estar atentos ao alias do modelo.

A documentação atual indica:

grok-voice-latest

Aponta para:

grok-voice-think-fast-1.0

Até 5 de agosto de 2026.

Em 5 de agosto de 2026, este alias mudará automaticamente para:

grok-voice-think-fast-2.0

As aplicações que usam grok-voice-latest receberão a atualização sem qualquer alteração.

No entanto, as equipas que necessitam de comportamento estável devem fixar explicitamente a versão.

Para permanecer na versão 1.0:

grok-voice-think-fast-1.0

Para adotar o novo modelo imediatamente:

grok-voice-think-fast-2.0

A fixação da versão é particularmente importante para sistemas de produção com fluxos de trabalho regulamentados, linhas de base de avaliação fixas ou necessidades de gestão de mudanças.

Os prompts existentes geralmente não precisam de ser alterados

A xAI afirma que o Think Fast 2.0 foi concebido para melhorar a maioria das aplicações existentes sem necessidade de modificar os prompts.

Isto torna a migração relativamente simples, mas as equipas de produção ainda devem realizar testes de regressão.

As atualizações do modelo de voz podem afetar a duração das respostas, o timing, a alternância de turnos, a frequência de invocação de ferramentas, perguntas de esclarecimento, mecanismos de escalonamento, transcrição, pronúncia e recolha de dados estruturados.

Um processo de migração razoável é:

  1. Fixar o modelo 1.0 existente.
  2. Executar os mesmos diálogos de teste no modelo 2.0.
  3. Comparar a taxa de sucesso das tarefas e o uso de ferramentas.
  4. Testar com áudio ruidoso e de qualidade telefónica.
  5. Verificar o tratamento de interrupções.
  6. Rever a latência.
  7. Medir o custo por tarefa concluída.
  8. Migrar gradualmente o tráfego de produção.

Minimizar a Conexão Grok Voice

O relatório original do AIBase não incluía código, mas a documentação oficial da xAI fornece um exemplo simples de WebSocket para ligar à API de voz para voz.

Selecionar o modelo através do URL WebSocket:

MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"

Em seguida, a sessão pode definir voz, instruções e deteção de turnos:

session_config = {
    "type": "session.update",
    "session": {
        "voice": "eve",
        "instructions": "És um assistente de apoio ao cliente conciso.",
        "turn_detection": {
            "type": "server_vad"
        }
    }
}

Para clientes de navegador ou dispositivos móveis, a xAI recomenda a utilização de tokens temporários, em vez de expor chaves API de longa duração ao cliente. As aplicações do lado do servidor podem autenticar-se através de uma chave API no cabeçalho de autorização.

Formatos de Áudio Suportados

A API de voz para voz suporta atualmente:

Formato Utilização Típica
PCM Áudio de alta qualidade para uso geral
G.711 μ-law / audio/pcmu Áudio telefónico
G.711 A-law / audio/pcma Sistemas telefónicos
Opus Áudio em tempo real comprimido

PCM suporta desde 8

Taxas de amostragem de vários kHz até 48 kHz.

Para aplicações de voz comuns, a documentação oficial recomenda por padrão o uso de PCM a 24 kHz. O suporte nativo a G.711 é útil para sistemas telefónicos, pois pode reduzir a necessidade de transcodificação adicional em alguns desses sistemas.

Cenários de aplicação mais adequados para o Think Fast 2.0

Este lançamento é voltado principalmente para fluxos de trabalho de agentes em tempo real, e não para transcrição offline simples.

Suporte ao cliente

O modelo pode ouvir as perguntas dos clientes, pesquisar informações aprovadas, utilizar ferramentas de conta e realizar diagnósticos de problemas em várias etapas.

Telemarketing

Os agentes de voz podem responder a perguntas, identificar potenciais clientes, usar ferramentas de vendas e guiar os chamadores através do processo de compra.

Agentes de reservas e agendamentos

O sistema pode recolher informações como data, hora, nome e preferências enquanto chama a API de agendamento.

Assistente interno empresarial

Os funcionários podem interagir com sistemas empresariais por voz, enquanto o modelo chama ferramentas internas ou pesquisa a base de conhecimento aprovada.

Serviço de voz multilingue

A plataforma Grok Voice da xAI suporta mais de 25 idiomas, tornando o modelo adequado para operações globais de suporte.

O que os programadores ainda precisam testar por conta própria

Os dados de benchmark são úteis, mas não permitem determinar se o modelo é adequado para uma aplicação específica.

Antes da implementação em produção, teste os sotaques reais dos chamadores, os codecs telefónicos, o ruído de fundo, os nomes de produtos, os nomes de clientes, os endereços, os números de conta longos, as interrupções, o silêncio, as mudanças de opinião do utilizador, as falhas de ferramentas, os resultados incorretos de ferramentas, as condições de transferência para humano, e as regras de segurança ou conformidade.

O tempo de resposta áudio inicial de 0,70 segundos só é valioso quando a resposta está correta. Da mesma forma, uma pontuação alta num benchmark não garante que um agente seguirá a política de reembolso específica de uma empresa ou introduzirá com precisão um nome de cliente incomum.

Perguntas Frequentes

O que é o Grok Voice Think Fast 2.0?

O Grok Voice Think Fast 2.0 é a nova geração de modelos de voz para voz da xAI, projetado para agentes de voz em tempo real. Ele combina interação áudio nativa, raciocínio, troca de turnos de conversação, transcrição e funcionalidades de uso de ferramentas.

Qual é o preço do Grok Voice Think Fast 2.0?

A xAI define o preço deste modelo em 0,08 dólares por minuto de áudio, o que equivale a 4,80 dólares por hora. Chamadas de ferramentas e outras funcionalidades da API podem gerar custos adicionais.

O Think Fast 2.0 é mais rápido que o Think Fast 1.0?

Sim. Relatórios da xAI e da Artificial Analysis mostram que o tempo de resposta áudio inicial diminuiu de 1,25 segundos para 0,70 segundos.

É superior ao GPT-Realtime-2.1?

No Índice de Qualidade Total de Voz para Voz e no benchmark τ-Voice Agent da Artificial Analysis, o Think Fast 2.0 obteve pontuações mais altas nas comparações publicadas. O GPT-Realtime-2.1 High ainda tem uma ligeira vantagem no benchmark full-duplex, portanto o Think Fast 2.0 não lidera em todos os parâmetros individuais.

Preciso reescrever os prompts para a versão 2.0?

A xAI afirma que a maioria das aplicações obterá ganhos de desempenho sem alterar os prompts. As equipas de produção devem, no entanto, realizar testes de regressão, pois a temporização, o uso de ferramentas, os padrões de troca de turnos e o estilo de resposta podem variar consoante a versão do modelo.

Quando é que grok-voice-latest mudará para o Think Fast 2.0?

A xAI indica que este alias será automaticamente alterado em 5 de agosto de 2026.

Os programadores que precisarem de continuar a usar a versão 1.0 devem fixar o modelo como grok-voice-think-fast-1.0.

O Grok Voice Think Fast 2.0 consegue chamar ferramentas?

Sim. A API atual de voz para voz suporta funções personalizadas, pesquisa de ficheiros, pesquisa na web, pesquisa no X e ferramentas MCP remotas.

O Think Fast 2.0 é apenas para suporte ao cliente?

Não. O suporte ao cliente e as vendas são cenários de aplicação típicos, mas o modelo também pode ser usado para outros fluxos de trabalho de agentes de voz em tempo real, como serviços de reservas, assistentes empresariais e aplicações interativas.

Ferramentas relacionadas

  • Grok Voice Think Fast 2.0: Anúncio oficial da xAI sobre o novo modelo de voz topo de gama.
  • Grok Voice API: Documentação oficial da API de voz para voz, abrangendo seleção de modelos, formatos de áudio, ferramentas e configuração de sessões.
  • Grok Voice Agent Builder: Ambiente sem código da xAI para construir agentes de voz de nível profissional.
  • Benchmark Voz para Voz da Artificial Analysis: Comparação independente de benchmarks que cobre raciocínio de voz, dinâmica de conversação, desempenho de agentes, velocidade e preços.
  • Deepgram Nova: Plataforma de reconhecimento de voz referenciada nas comparações de transcrição da xAI.
  • ElevenLabs: Plataforma de IA de voz, cujo modelo Scribe está incluído nas avaliações de transcrição da xAI.

Links relacionados

Resumo

O Grok Voice Think Fast 2.0 melhora o stack de tecnologia de voz em tempo real da xAI nas áreas mais críticas para agentes de nível profissional: conclusão de tarefas do agente, dinâmica de conversação, precisão de transcrição e latência.

O modelo alcançou 82,9% no Índice de Qualidade Voz para Voz da Artificial Analysis, uma pontuação de 56,5% no τ-voice, e um tempo de primeira resposta de áudio de 0,70 segundos. A xAI também relata melhor desempenho de transcrição em 24 idiomas e maior eficiência de raciocínio, permitindo que as chamadas de ferramentas sejam executadas mais cedo nas respostas de voz.

Os programadores podem agora usar o modelo ao preço de 0,08 dólares por minuto de áudio. Os utilizadores

existentes devem também notar que o grok-voice-latest está programado para mudar automaticamente do Think Fast 1.0 para o Think Fast 2.0 em 5 de agosto de 2026.

Esta atualização não é apenas um modelo de voz mais inteligente, mas um agente mais orientado para a produção, capaz de ouvir, raciocinar, dialogar e chamar ferramentas com menor latência.