Grok 4.6 lançado: desempenho de agente comparável ao GPT-5.6 Sol, com custo menor
A SpaceXAI lançou o Grok 4.6 em 12 de agosto de 2026, posicionando-o como um modelo de ponta para programação, tarefas de agente de longa duração e trabalho de conhecimento. O modelo é construído diretamente sobre o Grok 4.5, b

Lançamento do Grok 4.6: Desempenho de agente comparável ao GPT-5.6 Sol, com custo menor
Introdução
A SpaceXAI lançou o Grok 4.6 em 12 de agosto de 2026, posicionando-o como um modelo de ponta para programação, tarefas de agente de longa duração e trabalho do conhecimento.
O modelo é construído diretamente sobre o Grok 4.5, mas com um foco mais nítido e pragmático: manter a eficiência em trabalhos contínuos mais longos, usar ferramentas em várias etapas e gerar primeiras versões mais fortes para aplicações interativas e visuais.
De acordo com a SpaceXAI e a Cursor, o Grok 4.6 agora está no mesmo nível do GPT-5.6 Sol no Índice de Inteligência do Artificial Analysis, ao mesmo tempo em que apresenta resultados particularmente notáveis em avaliações de agente do mundo real, como GDPval-AA v2 e AA-Briefcase.
O artigo original da AIBase também destacou o preço e a velocidade de serviço do Grok 4.6. A vantagem de preço é totalmente respaldada pela documentação oficial. Os dados de velocidade exigem uma interpretação mais cuidadosa: a AIBase relatou 80 TPS, enquanto o Artificial Analysis atualmente mede a API de primeira parte do Grok 4.6 em cerca de 68 tokens de saída por segundo. A velocidade em tempo de execução varia conforme a infraestrutura, o comprimento do prompt, a intensidade de raciocínio e a carga do provedor.
Grok 4.6 é construído sobre o Grok 4.5
O Grok 4.6 é uma geração incremental de modelo, não o lançamento de uma nova arquitetura.
A SpaceXAI afirma que o novo modelo recebeu treinamento suplementar mais longo do que o Grok 4.5. A combinação de conteúdo de treinamento inclui:
- Dados de raciocínio gerados por modelo e selecionados
- Conceitos técnicos avançados
- Dados de engenharia de alta qualidade
- Otimizador e fórmula de treinamento aprimorados
- Ajuste fino supervisionado cobrindo múltiplas intensidades de raciocínio e estruturas de agente
- Aprendizado por reforço de agente voltado para programação, trabalho do conhecimento e ambientes técnicos especializados
A empresa afirma que o Grok 4.5 também foi usado para regenerar trajetórias de ajuste fino supervisionado para tarefas de STEM, engenharia de software e trabalho do conhecimento, com filtros baseados em modelo para remover rastros problemáticos.
Base do Grok 4.5
O Grok 4.5 já havia concluído o treinamento em escala massiva anteriormente.
A SpaceXAI declarou oficialmente que o treinamento do Grok 4.5 utilizou dezenas de milhares de GPUs NVIDIA GB300. Seus dados de treinamento abrangem programação, ciência, engenharia e matemática, enquanto o aprendizado por reforço se concentrou principalmente em tarefas de engenharia de software de múltiplas etapas e outros trabalhos técnicos de longa duração.
O Grok 4.6 é uma extensão dessa base, não uma substituição.
A mudança mais importante está na ênfase no comportamento contínuo de agente: o modelo não deve apenas resolver problemas de programação isolados, mas manter a coerência ao longo do processo de pesquisa, edição de arquivos, uso de ferramentas, teste do próprio trabalho e iteração com feedback em múltiplas rodadas.
Foco do treinamento: tarefas de agente de longa duração
A SpaceXAI afirma que o Grok 4.6 foi treinado em um amplo conjunto de tarefas de aprendizado por reforço de agente.
Esses ambientes incluem:
- Trabalho do conhecimento
- Programação geral
- Otimização de kernel
- Desenvolvimento web
- Design assistido por computador
- Outras tarefas técnicas específicas de domínio
Isso ajuda a explicar por que o modelo se destaca mais em avaliações que envolvem trabalho estendido, em vez de raciocínio de resposta curta.
Primeiras versões melhores para projetos visuais e interativos
A SpaceXAI e a Cursor também destacam
a capacidade do modelo de transformar ideias amplas de produtos em primeiras versões utilizáveis.
Em testes internos, o Grok 4.6 foi capaz de:
- Pesquisar domínios desconhecidos.
- Estruturar a arquitetura do aplicativo.
- Implementar as interações principais.
- Estabelecer a direção visual.
- Testar parte do conteúdo que produziu.
- Refinar continuamente os resultados ao longo de múltiplas iterações.
Isso não significa que cada aplicativo gerado de uma única vez já esteja em nível de prontidão para produção. Apenas indica que a empresa descobriu que a qualidade de sua saída inicial é melhor do que a do Grok 4.5, especialmente quando a tarefa exige a combinação de código, design, interação e uso iterativo de ferramentas.
Grok 4.6 empata com GPT-5.6 Sol no Índice de Inteligência do Artificial Analysis
O Artificial Analysis atualmente atribui ao Grok 4.6 (versão alta) uma pontuação de 61 no Índice de Inteligência.
Isso corresponde à mesma pontuação total do GPT-5.6 Sol (versão máxima) nas comparações divulgadas pela SpaceXAI.
O índice é um resultado agregado de nove avaliações, não um teste único, portanto é mais adequado como um sinal amplo de comparação do que como evidência de que os dois modelos têm desempenho idêntico em todas as cargas de trabalho.

A tabela de benchmarks que acompanha o lançamento inclui os seguintes resultados:
| Benchmark | Grok 4.6 Versão Alta | Grok 4.5 Versão Alta | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| Índice de Inteligência AA | 61 | 56 | 61 | 62 |
| GDPval-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| DeepSWE v1.1 | 65,9% | 54,0% | 73,0% | 70,0% |
| FrontierCode v1.1 Estendido | 61,3% | 56,6% | 60,6% | 63,6% |
| APEX-Agents | 57,5% | 47,1% | 56,7% | 59,2% |
| Terminal-Bench v3.0 | 26,0% | 15,7% | 34,6% | 34,1% |
| APEX-SWE | 56,4% | 53,6% | — | 58,8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15,8% | 12,9% | 2,5% | 11,3% |
Os rankings de benchmarks mudam à medida que modelos, estruturas de teste e versões de avaliação são atualizados. A tabela acima reflete os resultados comparativos do período de lançamento, não um ranking permanente.
GDPval-AA v2: forte capacidade de trabalho do conhecimento no mundo real
No GDPval-AA v2, o Grok 4.6 obteve uma pontuação de 1753 Elo.
O Artificial Analysis descreve o GDPval-AA v2 como uma avaliação de trabalho do conhecimento com agente no mundo real que cobre múltiplas profissões especializadas.
No momento da publicação da análise do Grok 4.6, o Artificial Analysis afirmou que essa pontuação fica atrás apenas da série Claude Opus 5, enquanto o intervalo de confiança se sobrepõe ao de outros modelos líderes, como Claude Fable 5 e Qwen3.8 Max.
Isso é mais rigoroso do que declarar diretamente que o Grok 4.6 está claramente em segundo lugar.
Avaliações baseadas em Elo têm incertezas, e pontuações próximas podem se sobrepor estatisticamente.
AA-Briefcase: trabalho de agente de ciclo longo
O Grok 4.6 também obteve 1577 Elo no AA-Briefcase.
da pontuação. Este é um benchmark privado da Artificial Analysis para trabalho de conhecimento agêntico de longa duração.
Isso coloca sua pontuação—
No snapshot publicado, o desempenho do Grok 4.6 é aproximadamente equivalente ao nível do Fable 5, ficando atrás da linha Claude Opus 5.
Seu desempenho de eficiência também merece atenção.
A Artificial Analysis relatou que o Grok 4.6, ao concluir suas tarefas AA-Briefcase, usou aproximadamente:
- Média de 53 rodadas de conversa
- Média de 500 milhões de tokens de entrada
Em comparação, o Claude Opus 5 (versão máxima) teria usado aproximadamente:
- 103 rodadas de conversa
- 2 bilhões de tokens de entrada
Isso não significa que o Grok 4.6 seja mais eficiente que o Claude Opus 5 em todos os casos. É apenas uma observação para esse benchmark específico. Ainda assim, para agentes inteligentes de longa duração, menos rodadas e menos contexto acumulado podem reduzir significativamente o custo das tarefas.
Preços do Grok 4.6 a partir de US$ 2 por entrada e US$ 6 por saída
O preço padrão da API pública continua sendo uma das maiores vantagens competitivas do Grok 4.6.
Para prompts abaixo do limite de preço de contexto longo, a documentação da SpaceXAI informa:
| Tipo de token | Preço por milhão de tokens |
|---|---|
| Entrada | US$ 2,00 |
| Entrada em cache | US$ 0,50 |
| Saída | US$ 6,00 |
A Artificial Analysis aponta que, apesar do aumento no índice de inteligência de 56 para 61, esse preço público permanece o mesmo em comparação ao Grok 4.5.
Em comparação, no momento em que este texto foi escrito:
- A API padrão do GPT-5.6 Sol custa US$ 5 por milhão de tokens de entrada / US$ 30 por saída.
- O preço público de tokens do Claude Opus 5 é mais alto que o do Grok 4.6.
Isso torna o Grok 4.6 especialmente atraente para loops de agentes de alta vazão, pois nesses cenários os tokens de saída e o contexto repetido tendem a dominar a maior parte do custo total.
Prompts longos custam mais caro
As notas oficiais de lançamento da SpaceXAI incluem um detalhe importante que o breve artigo da AIBase não mencionou.
Para prompts acima de 200 mil tokens, o Grok 4.6 adota um nível de preço mais alto:
| Tipo de token | Preço por milhão de tokens para prompts acima de 200 mil |
|---|---|
| Entrada | US$ 4,00 |
| Entrada em cache | US$ 1,00 |
| Saída | US$ 12,00 |
Portanto, "US$ 2 por entrada / US$ 6 por saída" é o preço inicial, não um valor universal aplicável a todas as solicitações.
Variante rápida
A Cursor afirma que a variante rápida tem o preço de duas vezes o valor padrão.
Isso é separado das regras de preço para prompts longos acima. Dependendo da plataforma e da carga de trabalho, os usuários devem confirmar o nível de velocidade e o nível de contexto aplicáveis antes de estimar o custo de produção.
E a velocidade de 80 TPS divulgada?
O artigo da AIBase afirma que o Grok 4.6 pode rodar a 80 tokens por segundo.
Esse número deve ser tratado com cautela.
O anúncio oficial do Grok 4.6 da SpaceXAI não publica uma garantia fixa de velocidade de 80 TPS. A Artificial Analysis atualmente mede, em sua carga de trabalho de benchmark, a velocidade de saída do Grok 4.6 (high) na API first-party em cerca de 67,6 tokens de saída por segundo.
Em comparação, a página oficial de lançamento do Grok 4.5 da SpaceXAI afirma explicitamente que o Grok 4.5 é servido a 80 TPS.
Portanto, o artigo de origem curto pode ter repetido o número antigo de 80 TPS ou citado um nível de serviço diferente.
O ponto prático é mais simples:
O Grok 4.6 tem uma velocidade bastante boa para um modelo de raciocínio de fronteira, mas não existe um único número fixo de TPS aplicável a todos os prompts, provedores, níveis de raciocínio ou camadas de velocidade.
Contexto de 500 mil na API da SpaceXAI
A documentação da API da SpaceXAI lista a janela de contexto do grok-4.6 como 500 mil tokens.
O modelo suporta:
- Entrada de texto
- Entrada de imagem
- Saída de texto
- Intensidades de raciocínio baixa, média, alta e extremamente alta
- Chamada de função
- Busca na web
- Busca no X
- Execução de código
A página oficial do modelo também lista a data de corte de conhecimento como 1º de fevereiro de 2026.
A Cursor usa um limite de contexto diferente
A documentação do modelo Grok 4.6 na Cursor lista atualmente uma janela de contexto de 256k dentro da Cursor.
Isso não contradiz a especificação do modelo base. Significa que a integração da plataforma pode expor um limite de contexto menor do que o da API first-party da SpaceXAI.
Ao comparar limites de modelos, verifique sempre o provedor e a integração exatos em uso.
Como usar o Grok 4.6 via API
O ID oficial do modelo na SpaceXAI é:
grok-4.6
Uma solicitação mínima à Responses API seria assim:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.6",
"input": "Encontre e corrija o bug e depois explique: function median(a){a.sort();return a[a.length/2]}"
}'
O mesmo modelo também está disponível via SDK oficial da xAI e clientes de API compatíveis com OpenAI.
Exemplo em Python
import os
from xai_sdk import Client
from xai_sdk.chat import user
client = Client(api_key=os.getenv("XAI_API_KEY"))
chat = client.chat.create(model="grok-4.6")
chat.append(
user(
"Encontre e corrija o bug e depois explique: "
"function median(a){a.sort();return a[a.length/2]}"
)
)
response = chat.sample()
print(response.content)
Para loops de agentes de longa duração, a SpaceXAI recomenda o uso de cache de prompt e compactação de contexto quando apropriado, a fim de reduzir custos de contexto repetido.
Grok 4.6 disponível na Cursor e no Grok Build
No lançamento, o Grok 4.6 está disponível nas seguintes plataformas:
- Cursor
- Grok Build
- API da SpaceXAI
- OpenRouter
- Vercel
- Cloudflare
A SpaceXAI e a Cursor também oferecem 2x o uso incluído na primeira semana na Cursor e no Grok Build.
Essa promoção de lançamento é temporária e não deve ser considerada preço permanente.
Grok 4.6 na Cursor
A Cursor exibe o Grok 4.6 em quatro níveis de intensidade de raciocínio:
- xhigh
- high
- medium
- low
high é a intensidade de raciocínio padrão.
Nos planos elegíveis da Cursor, também está disponível o nível de velocidade rápida.
Dentro da Cursor, o modelo pode usar as ferramentas de agente da plataforma para executar tarefas como:
- Buscar arquivos e pastas
- Ler arquivos
- Editar arquivos
- Executar comandos de shell
- Navegar na web
- Testes de aplicativos baseados em navegador
- Geração de imagens
- Obter regras do projeto
Essa é uma das razões pelas quais o lançamento do Grok 4.6 deu tanta ênfase a benchmarks de agentes: seu uso pretendido não se limita a conclusões de chat isoladas.
Grok 4.6 é mais forte em tarefas que exigem trabalho contínuo
O modo de benchmark indica que o maior avanço do Grok 4.6 não está apenas no raciocínio estático.
Suas melhorias são mais evidentes quando as tarefas envolvem:
- Múltiplas etapas
- Uso de ferramentas
- Pesquisa
- Operações com código ou documentos
- Autoverificação
- Contexto longo
- Refinamento iterativo
Isso o torna especialmente adequado para:
- Agentes de codificação
- Trabalho de software em nível de repositório
- Agentes de pesquisa
- Fluxos de trabalho com planilhas e documentos
- Análise técnica
- Prototipagem de aplicativos web
Tarefas de trabalho intensivo em conhecimento e de longa duração
Para prompts curtos e simples, essa vantagem pode não ser evidente.
O que os benchmarks podem e não podem comprovar
Os dados divulgados suportam as seguintes conclusões claras:
- Em vários benchmarks de agentes, o Grok 4.6 é significativamente mais forte que o Grok 4.5.
- Na comparação atual do Índice de Inteligência Artificial Analysis, ele empata com o GPT-5.6 Sol.
- Ele tem desempenho particularmente bom no GDPval-AA v2 e no AA-Briefcase.
- Seu preço padrão de API anunciado é muito inferior ao do GPT-5.6 Sol.
Mas os dados não provam que o Grok 4.6 é universalmente superior ao GPT-5.6 Sol ou ao Claude em todas as tarefas.
Por exemplo, a mesma tabela de divulgação mostra o GPT-5.6 Sol liderando no DeepSWE v1.1 e no Terminal-Bench v3.0, enquanto o Claude Fable 5 lidera em várias outras avaliações de programação e agentes.
Portanto, a escolha do modelo deve depender da carga de trabalho real, e não de uma única pontuação agregada.
Perguntas frequentes
O que é o Grok 4.6?
O Grok 4.6 é o modelo de fronteira da SpaceXAI voltado para programação, tarefas de agente e trabalho de conhecimento. Ele adiciona treinamento extra sobre o Grok 4.5, com foco em agentes de longa duração, maior capacidade de construção de aplicativos na primeira tentativa e trabalho multi-etapas mais persistente.
O Grok 4.6 é melhor que o GPT-5.6 Sol?
Depende da tarefa específica. Na comparação de lançamento, o Grok 4.6 empata com o GPT-5.6 Sol no Índice de Inteligência da Artificial Analysis e lidera em algumas avaliações de agentes, enquanto o GPT-5.6 Sol ainda é mais forte em certos benchmarks de programação. Os dois modelos também diferem significativamente em preço e comprimento de contexto.
Quanto custa a API do Grok 4.6?
O preço padrão é de US$ 2 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de entrada em cache e US$ 6 por milhão de tokens de saída. Para prompts com mais de 200 mil tokens, a documentação da SpaceXAI especifica faixas de preço mais altas: US$ 4 / US$ 1 / US$ 12 por milhão para entrada, entrada em cache e saída, respectivamente.
Qual é o tamanho da janela de contexto do Grok 4.6?
A API proprietária da SpaceXAI suporta uma janela de contexto de 500 mil tokens. O Cursor atualmente oferece uma janela de contexto de 256 mil tokens para sua própria integração com o Grok 4.6, portanto o limite real depende da plataforma.
O Grok 4.6 suporta imagens?
Sim. A SpaceXAI lista o Grok 4.6 como suportando entrada de texto e imagem, bem como saída de texto. O modelo também suporta ferramentas como chamada de função, busca na web, busca no X e execução de código, disponíveis através da API xAI.
Posso usar o Grok 4.6 no Cursor?
Sim. O Grok 4.6 já está disponível no Cursor e suporta intensidades de raciocínio xhigh, high, medium e low. O Cursor também concede a ele acesso ao conjunto de ferramentas de agente para operações de arquivo, comandos Shell, navegação e outros fluxos de trabalho de programação.
O Grok 4.6 é open source?
Não. O Grok 4.6 é um modelo proprietário, e a SpaceXAI não divulgou seus pesos ou número de parâmetros.
Qual é a velocidade do Grok 4.6?
A AIBase relatou 80 tokens por segundo, mas as medições atuais da Artificial Analysis mostram que a API proprietária do Grok 4.6 gera cerca de 68 tokens de saída por segundo em sua carga de trabalho de referência. A velocidade varia conforme a intensidade de raciocínio, o tamanho do prompt, a carga da infraestrutura e o nível da plataforma.
Ferramentas relacionadas
- Grok 4.6: Página oficial de lançamento da SpaceXAI, cobrindo treinamento, benchmarks, segurança e disponibilidade.
- Console da API SpaceXAI: Console oficial para criar chaves de API e acessar os modelos Grok.
- Grok Build: Ambiente de codificação e trabalho com agentes da SpaceXAI, alimentado pelos modelos Grok.
- Cursor: Ambiente de codificação com IA, que lançou o Grok 4.6 em conjunto com a SpaceXAI e disponibiliza o modelo através de seus fluxos de trabalho de agente.
- Artificial Analysis: Benchmark independente de modelos para inteligência, custo, velocidade, contexto e desempenho de agentes.
Links relacionados
- Anúncio oficial do Grok 4.6: Principal anúncio de lançamento da SpaceXAI com tabelas de benchmark.
- Documentação da API do Grok 4.6: ID oficial do modelo, janela de contexto, preços, modalidades suportadas, ferramentas e exemplos de API.
- Notas de versão da SpaceXAI: Histórico oficial de lançamentos, incluindo faixas de preço e disponibilidade do Grok 4.6.
- Anúncio do Grok 4.6 no Cursor: Artigo de lançamento do Cursor cobrindo treinamento, comportamento de agente, preços e integrações suportadas.
- Documentação do modelo Grok 4.6 no Cursor: Limites de contexto específicos do Cursor, níveis de esforço e ferramentas de agente disponíveis.
- Análise do Grok 4.6 pela Artificial Analysis: Análise independente sobre o Índice de Inteligência, GDPval-AA v2, AA-Briefcase, eficiência de custo e uso de tokens.
- Anúncio oficial do Grok 4.5: Contexto de treinamento em escala GB300, aprendizado por reforço, alegação de 80 TPS e preços de lançamento do modelo anterior.
Resumo
O Grok 4.6 é uma atualização direcionada ao Grok 4.5, com foco em agentes de longa duração, codificação, trabalho de conhecimento e qualidade de execução na primeira tentativa em projetos interativos. Seus resultados de lançamento o colocam na vanguarda das avaliações atuais de modelos, alcançando 61 pontos no Índice de Inteligência da Artificial Analysis — empatando com o GPT-5.6 Sol na comparação de lançamento.
O ponto mais forte deste lançamento é a combinação de desempenho de agente e preço. O Grok 4.6 começa em US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, ao mesmo tempo em que obtém pontuações altas no GDPval-AA v2 e no AA-Briefcase. Prompts longos e níveis rápidos podem gerar custos mais altos, portanto estimativas de produção devem usar a configuração exata do provedor.
O dado divulgado de 80 TPS deve ser tratado com cautela: as medições independentes atuais ficam próximas de 68 tokens de saída por segundo, e a velocidade do serviço pode mudar ao longo do tempo.
A principal vantagem não está em ter vencido todos os benchmarks, mas sim em agora oferecer desempenho de agente de nível avançado a um preço extremamente competitivo.