ByteDance planeja lançar modelo de IA com mais de 5 trilhões de parâmetros, segundo relatos; relatos posteriores apontam até 10 trilhões
A corrida por modelos de fronteira na China está adentrando a era dos trilhões de parâmetros. O Qwen3.8-Max da Alibaba já atingiu 2,4 trilhões de parâmetros, enquanto o Kimi K3 da Moonshot AI foi elevado para

Relatos indicam que a ByteDance planeja treinar um modelo de IA com mais de 5 trilhões de parâmetros; relatos posteriores apontam para até 10 trilhões
Introdução
A corrida por modelos de fronteira na China está avançando para a era dos trilhões de parâmetros.
O Qwen3.8-Max da Alibaba já atingiu 2,4 trilhões de parâmetros, enquanto o Kimi K3 da Moonshot AI elevou a escala divulgada publicamente para 2,8 trilhões de parâmetros.
A ByteDance pode estar se preparando para o próximo salto.
Citando uma reportagem da LatePost, o AIBase informou que a ByteDance estava discutindo, em 7 de agosto de 2026, o treinamento de um modelo de base com mais de 5 trilhões de parâmetros. Segundo a reportagem, o projeto ainda está em estágio inicial, e não há garantia de que o modelo final será lançado.

Apenas em termos de escala, o projeto se tornaria um dos maiores projetos de modelos de IA já noticiados publicamente na China.
No entanto, houve uma atualização importante no mesmo dia.
Na noite de 7 de agosto, a Reuters, citando o jornal britânico Financial Times e fontes familiarizadas com o assunto, informou que a ByteDance está treinando um modelo com até 10 trilhões de parâmetros, e que o modelo já entrou na fase de pré-treinamento. A ByteDance ainda não respondeu publicamente a essa reportagem.
Os dois relatos não são necessariamente contraditórios. Um projeto inicialmente discutido como "mais de 5 trilhões" pode, no fim, mirar uma configuração ainda maior. Mas, como a ByteDance ainda não divulgou oficialmente a arquitetura ou o número de parâmetros do modelo, todos os números neste artigo devem ser considerados como planos relatados, e não como especificações confirmadas do modelo.
ByteDance supostamente caminha para a marca de 5 trilhões de parâmetros
A reportagem original da LatePost afirma que a ByteDance está discutindo um modelo com mais de 5 trilhões de parâmetros.
Isso o colocaria muito acima das escalas já divulgadas por vários modelos de fronteira chineses atuais.
| Modelo | Parâmetros totais divulgados publicamente | Status |
|---|---|---|
| Qwen3.8-Max | 2,4 trilhões | Já lançado pela Alibaba |
| Kimi K3 | 2,8 trilhões | Já lançado pela Moonshot AI |
| Modelo da ByteDance (relatado) | Mais de 5 trilhões | Plano relatado |
| Dados subsequentes do FT/Reuters | Até 10 trilhões | Relatado, sem confirmação oficial |
A Moonshot AI descreveu oficialmente o Kimi K3 como um modelo de mistura de especialistas com 2,8 trilhões de parâmetros, com 104 bilhões de parâmetros ativados por token.
A Reuters informou em 3 de agosto que o Qwen3.8-Max da Alibaba contém 2,4 trilhões de parâmetros totais.
Se a ByteDance eventualmente treinar e implantar um modelo com 5 a 10 trilhões de parâmetros, isso representará um aumento significativo na escala total do modelo.
Mas isso não significa automaticamente que a capacidade do modelo será duas ou três vezes maior.
Número de parâmetros não é igual a inteligência
As fontes do AIBase descreveram o modelo de 5 trilhões de parâmetros como estando na mesma ordem de grandeza dos principais sistemas de fronteira dos EUA, como o GPT-5.6 ou o mais recente modelo topo de linha da Anthropic.
Essa comparação exige uma ressalva importante.
A OpenAI e a Anthropic não divulgam publicamente o número exato de parâmetros do GPT-5.6, do Claude Fable 5 ou do Claude Mythos 5.
A Reuters também levantou o mesmo ponto em sua reportagem de 7 de agosto: a comparação direta de escala com os principais sistemas dos EUA é difícil porque esses laboratórios não publicam o número de parâmetros de seus modelos.
O número de parâmetros é apenas uma dimensão para medir a capacidade de um modelo.
O desempenho também depende de:
- Arquitetura do modelo
- Número de parâmetros ativados por token
- Qualidade dos dados de treinamento
- Número de tokens de treinamento
- Filtragem de dados
- Design do otimizador
- Aprendizado por reforço
- Pós-treinamento
- Uso de ferramentas
- Computação em tempo de teste
- Arquitetura de contexto longo
- Eficiência de inferência
Isso é especialmente importante para modelos de mistura de especialistas (MoE).
Um modelo MoE esparso pode conter trilhões de parâmetros totais, mas ativar apenas um subconjunto muito pequeno deles por token.
O Kimi K3 é um bom exemplo.
Suas especificações oficiais listam:
- 2,8 trilhões de parâmetros totais
- 104 bilhões de parâmetros ativados
- 896 especialistas roteados
- 16 especialistas selecionados por token
Portanto, o total de pesos não é a mesma coisa que a quantidade de computação usada em cada etapa de inferência.
A ByteDance ainda não divulgou publicamente se o modelo relatado usa arquitetura esparsa semelhante, nem quantos parâmetros serão ativados por token.
Um modelo de 5 trilhões de parâmetros exigirá enorme capacidade computacional de treinamento
A reportagem original usou as GPUs NVIDIA H100 como exemplo para ilustrar a escala.
As estimativas sugerem que treinar um modelo de 5 trilhões de parâmetros exigiria aproximadamente:
- 100.000 GPUs da classe H100 rodando por 347 dias, ou
- 1.000.000 de GPUs rodando por cerca de 35 dias
Ambos os cenários têm o mesmo total de tempo de aceleradores, na mesma ordem de grandeza:
| Cenário | Número de GPUs | Duração | Aprox. GPU-dias |
|---|---|---|---|
| Cluster de longo prazo | 100.000 | 347 dias | 34,7 milhões |
| Cluster massivo de curto prazo | 1.000.000 | 35 dias | 35 milhões |
Esses números devem ser entendidos como estimativas aproximadas de cenários feitas pelas fontes, e não como uma fórmula genérica de engenharia.
As necessidades reais de treinamento dependem em grande parte de:
- Arquitetura
- Ativação esparsa ou densa
- Número de tokens
- Precisão
- Utilização de FLOPs do modelo
- Salvamento de checkpoints
- Eficiência de rede
- Geração de hardware
- Estabilidade do treinamento
- Desempenho do pipeline de dados
- Execuções com falha e reinicializações
As especificações oficiais da NVIDIA para a H100 indicam que a versão SXM tem TDP de até 700W e suporta treinamento de transformers em larga escala por meio do Transformer Engine da arquitetura Hopper e da infraestrutura NVLink.
Em uma escala de centenas de milhares de aceleradores, apenas o cluster de GPUs já atinge um patamar em que energia elétrica, rede, refrigeração e capacidade do data center se tornam restrições primárias.
Por que "1 milhão de GPUs" não significa que a ByteDance treinará dessa forma
As fontes do AIBase apontaram corretamente que operar 1 milhão de aceleradores da classe H100 simultaneamente seria uma configuração de infraestrutura extrema.
Um projeto mais realista provavelmente distribuiria o treinamento por um cluster menor, mas ainda assim gigantesco.
As fontes sugeriram uma abordagem mais próxima de:
- 200.000 a 300.000 aceleradores
- Rodando por aproximadamente três a quatro meses
Isso ainda seria um dos maiores clusters de treinamento já construídos.
Um dos empreendimentos de engenharia de treinamento de modelos mais ambiciosos da história da humanidade.
E o pré-treinamento é apenas uma fase.
Um modelo de fronteira também exige tempo e capacidade computacional para as seguintes etapas:
- Preparação de dados
- Experimentação de arquitetura
- Pesquisa de expansão de escala
- Pré-treinamento
- Avaliação de checkpoints
- Pós-treinamento supervisionado
- Aprendizado por reforço
- Testes de segurança
- Treinamento de ferramentas e agentes
- Otimização de serviço
Portanto, o artigo original do AIBase estimou que todo o processo levaria pelo menos seis meses, e o tempo total poderia se aproximar de um ano antes que um modelo maduro estivesse disponível.
Posteriormente, a reportagem do Financial Times (resumida pela Reuters) afirmou que o modelo já entrou na fase de pré-treinamento, e observou que essa fase geralmente leva cerca de três a seis meses, antes das etapas de ajuste fino e lançamento.
Ambas as descrições apontam para a mesma conclusão prática: um projeto dessa escala é um empreendimento de infraestrutura de longo prazo, e não um modelo que surge imediatamente após o primeiro cluster de treinamento entrar em operação.
A ByteDance tem capacidade para tentar
Treinar nessa escala não é apenas uma questão de pesquisa.
É também uma questão de infraestrutura e capital.
A ByteDance é uma das poucas empresas de tecnologia chinesas com poder financeiro, canais de distribuição para consumidores, infraestrutura em nuvem, capacidade de data center e equipes de engenharia de IA suficientes para tentar seriamente um projeto dessa magnitude.
A organização oficial Seed da empresa já cobre as seguintes áreas:
- Pré-treinamento de modelos de base
- Pós-treinamento
- Aprendizado por reforço
- Inferência de alto desempenho
- Treinamento distribuído
- Compilação para hardware heterogêneo
- Modelos multimodais
- Sistemas de agentes
A equipe de infraestrutura da ByteDance descreve explicitamente seu trabalho como abrangendo treinamento distribuído, sistemas de aprendizado por reforço, inferência de alto desempenho e tecnologia de compiladores voltada para modelos de base.
Seus materiais de recrutamento também mencionam explicitamente as seguintes frentes de trabalho:
- Treinamento em escala ultra grande
- Estabilidade de treinamento
- Utilização de FLOPs do modelo
- Co-design de software e hardware
- Inferência multinó
- Paralelização
- Otimização de agendamento
Esses são exatamente os problemas de engenharia de sistemas que se tornam críticos ao treinar modelos com trilhões de parâmetros.
O número de GPUs da fonte é apenas uma estimativa, não um dado divulgado publicamente
A AIBase também citou estimativas de terceiros sobre a escala de capacidade de computação de IA disponível em vários laboratórios de fronteira.
As quantidades aproximadas mencionadas no artigo são:
- OpenAI: cerca de 2 milhões de GPUs
- Anthropic: cerca de 620 mil
- DeepSeek: cerca de 60 mil
Esses números não devem ser considerados como dados de inventário auditados.
OpenAI e Anthropic não mantêm publicamente uma contagem em tempo real de todos os aceleradores disponíveis em suas próprias instalações, parceiros de nuvem e capacidade reservada.
O número de cerca de 60 mil aceleradores da DeepSeek veio originalmente de uma estimativa da SemiAnalysis e, desde então, foi amplamente citado em várias reportagens. Essas estimativas incluem uma combinação mista de vários aceleradores, como A100, H100, H800 e H20, em vez de uma frota de um único tipo.
Mais confiável do que qualquer número exato de inventário é o ponto-chave mais amplo:
O desenvolvimento de modelos de fronteira depende cada vez mais do acesso a capacidade de computação de aceleradores em escala ultra grande, e, à medida que os modelos continuam crescendo, a diferença entre empresas com infraestrutura de escala ultra grande e laboratórios menores pode se tornar extremamente acentuada.
Escalando para trilhões de parâmetros.
A comparação com H100 é apenas uma linha de base
Usar o equivalente computacional de H100 torna a discussão sobre computação mais fácil de entender, mas a ByteDance não necessariamente dependerá de um único tipo de acelerador.
Grandes empresas de IA podem combinar o uso de:
- H100
- H200
- Sistemas NVIDIA da geração Blackwell
- Chips NVIDIA de edição especial para a China
- Aceleradores de IA nacionais
- Hardware personalizado
- Múltiplas regiões de nuvem e data centers
Aceleradores mais novos podem alterar a quantidade física de GPUs necessária para concluir a mesma quantidade de computação de treinamento.
O software também é igualmente importante.
Melhorias em:
- Eficiência de kernels
- Grau de paralelismo
- Roteamento de especialistas
- Gerenciamento de memória
- Comunicação
- Salvamento de checkpoints
- Quantização
- Carregamento de dados
Podem alterar significativamente a relação entre o tamanho total do modelo e o custo de treinamento.
Portanto, "o modelo X precisa exatamente de Y GPUs" deve sempre ser tratado como uma hipótese de cenário, e não como uma regra fixa.
Por que a ByteDance pode precisar de um modelo tão grande
A fonte enquadra principalmente o plano como uma tentativa de elevar o nível de inteligência do Doubao à fronteira global.
Isso provavelmente é apenas parte da motivação.
Um modelo de base maior pode sustentar várias partes do ecossistema de IA da ByteDance.
Doubao
Doubao é um dos principais produtos de IA voltados ao consumidor da ByteDance no mercado chinês.
Um modelo base mais forte pode melhorar:
- Raciocínio geral
- Trabalho de conhecimento
- Programação
- Busca
- Tarefas de contexto longo
- Comportamento de agentes
- Interação multimodal
Pesquisa Seed
Modelos de escala ultra grande também fornecerão uma nova plataforma de pesquisa para a equipe Seed explorar:
- Leis de escalabilidade
- Arquiteturas esparsas
- Aprendizado por reforço
- Treinamento de agentes
- Eficiência de modelos
- Memória
- Raciocínio de longo prazo
Volcano Engine
A ByteDance também pode comercializar as capacidades do modelo por meio de serviços empresariais e de nuvem.
Portanto, um modelo de fronteira tem valor potencial além de chatbots voltados ao consumidor.
Modelos maiores ainda precisam trazer retorno econômico
A última questão no artigo da AIBase é a mais crítica.
Um modelo com custo de treinamento extremamente alto pode gerar retornos proporcionais?
Laboratórios de fronteira não pagam apenas pela execução final do treinamento.
As despesas totais podem incluir:
- GPUs
- Data centers
- Eletricidade
- Rede
- Armazenamento
- Salários de pesquisadores
- Preparação de dados
- Experimentos fracassados
- Pós-treinamento
- Inferência
- Trabalhos relacionados à segurança
- Integração de produtos
Em seguida, o modelo deve criar valor por meio de alguma combinação de:
- Assinaturas voltadas ao consumidor
- Publicidade
- Comércio eletrônico
- APIs empresariais
- Serviços de nuvem
- Produtos de ferramentas de eficiência
- Ferramentas de programação
- Agentes
- Ganhos internos de eficiência
O tamanho de parâmetros só faz sentido econômico quando se traduz em capacidades úteis a um custo de inferência aceitável.
É por isso que a geração atual de modelos de fronteira enfatiza cada vez mais a eficiência de escala, e não apenas o número total de parâmetros.
Por exemplo, o Kimi K3 tem 2,8 trilhões de parâmetros totais, mas ativa apenas 104 bilhões de parâmetros por token. A Moonshot AI afirma que sua arquitetura trouxe melhorias em eficiência de escala em comparação com a geração anterior.
Portanto, a verdadeira competição não é:
Quem tem mais parâmetros?
Mas sim, mais próxima de:
Quem consegue transformar o menor número de recursos na capacidade mais forte?
No menor custo sustentável de treinamento e inferência, transformando-se na inteligência mais útil?
O que está confirmado e o que ainda é apenas reportagem
Confirmado
- De acordo com informações da Moonshot AI, o Kimi K3 tem 2,8 trilhões de parâmetros totais.
- De acordo com reportagens da Alibaba e da Reuters, o Qwen3.8-Max tem 2,4 trilhões de parâmetros totais.
- A equipe Seed da ByteDance trabalha com pré-treinamento em larga escala, pós-treinamento, inferência e infraestrutura de modelos.
- Doubao é o produto de IA voltado ao consumidor da ByteDance.
- A NVIDIA H100 foi projetada para treinamento de Transformers em larga escala e cargas de trabalho de IA com trilhões de parâmetros.
Reportado, mas não confirmado oficialmente pela ByteDance
- A ByteDance está construindo um modelo com mais de 5 trilhões de parâmetros.
- O objetivo final pode chegar a 10 trilhões de parâmetros.
- O tamanho exato do cluster de treinamento.
- A quantidade total de computação equivalente a H100 necessária.
- A data final de lançamento.
- Se o modelo será eventualmente disponibilizado publicamente.
- A arquitetura do modelo e o número de parâmetros ativados.
Não verificável a partir de especificações públicas de modelos
- Um modelo de 5 trilhões de parâmetros automaticamente pertence ao "nível GPT-5.6".
- Apenas o número de parâmetros pode prever o nível de inteligência de um modelo.
- O número exato de parâmetros de modelos de nível GPT-5.6 ou Fable/Mythos da Anthropic.
- O inventário exato atual de GPUs da OpenAI ou da Anthropic.
Perguntas frequentes
A ByteDance realmente está treinando um modelo de 5 trilhões de parâmetros?
A AIBase citou o LatePost reportando que a ByteDance está discutindo um modelo com mais de 5 trilhões de parâmetros. Mais tarde no mesmo dia, a Reuters citou o Financial Times reportando que a ByteDance já está em pré-treinamento de um modelo que pode chegar a 10 trilhões de parâmetros. A ByteDance não confirmou publicamente o número exato.
Esse modelo dará suporte ao Doubao?
A fonte espera que o modelo fortaleça o ecossistema Doubao da ByteDance, mas a ByteDance ainda não anunciou oficialmente como o modelo mencionado na reportagem será implantado. Modelos de fronteira também podem suportar APIs empresariais, agentes, pesquisa e outros produtos da ByteDance.
Um modelo de 5 trilhões de parâmetros é necessariamente melhor que o Kimi K3 ou o Qwen3.8-Max?
Não necessariamente. O número total de parâmetros não determina diretamente a qualidade do modelo. Arquitetura, parâmetros ativados, dados de treinamento, pós-treinamento, aprendizado por reforço, raciocínio em tempo de inferência e uso de ferramentas podem ser igualmente importantes.
Quantos parâmetros o Kimi K3 tem?
A Moonshot AI divulgou oficialmente que o Kimi K3 tem 2,8 trilhões de parâmetros totais e 104 bilhões de parâmetros ativados. Ele usa uma arquitetura de Mistura de Especialistas (MoE) esparsa.
Quantos parâmetros o Qwen3.8-Max tem?
De acordo com reportagens da Alibaba e da Reuters, o Qwen3.8-Max da Alibaba tem 2,4 trilhões de parâmetros totais. Ele também é baseado em design de modelo esparso, em vez de ativar todos os parâmetros para cada token.
Quantas GPUs H100 são necessárias para treinar um modelo de 5 trilhões de parâmetros?
A fonte apresenta um cenário aproximado, equivalente a cerca de 35 milhões de H100 GPU-dias, como 100 mil H100 rodando por 347 dias, ou 1 milhão de H100 rodando por cerca de 35 dias. A necessidade real pode variar muito dependendo da arquitetura, precisão, utilização, número de tokens, hardware e eficiência de treinamento.
O GPT-5.6 tem 5 trilhões de parâmetros?
A OpenAI não divulgou publicamente o número de parâmetros do GPT-5.6. Qualquer afirmação sobre
Uma comparação numérica direta com algum modelo
Segundo relatos, um modelo da ByteDance ainda é especulativo no momento.
Quando a ByteDance poderá lançar esse modelo?
Até agora, nenhuma data oficial de lançamento foi anunciada. A Reuters, com base em uma reportagem do Financial Times do Reino Unido, afirmou que o modelo está em fase de pré-treinamento, uma etapa que pode levar vários meses antes que ajuste fino, avaliação e implantação sejam possíveis.
Ferramentas relacionadas
- ByteDance Seed: centro oficial de pesquisa da ByteDance e hub de modelos para modelos de fundação, sistemas multimodais e pesquisa em IA.
- ByteDance Seed LLM: visão geral oficial da ByteDance sobre pré-treinamento, pós-treinamento, inferência, memória, aprendizado e pesquisa de modelos de fundação.
- Doubao: assistente de IA voltado ao consumidor da ByteDance e um dos principais pontos de entrada para produtos que podem se beneficiar de modelos de fundação mais fortes.
- Kimi: plataforma oficial de produtos da Moonshot AI e porta de acesso à família de modelos Kimi.
- Qwen: portal oficial da Alibaba para os modelos e produtos Qwen.
- NVIDIA H100: especificações oficiais do acelerador H100 e informações de desempenho de treinamento fornecidas pela NVIDIA.
Links relacionados
- Reuters: ByteDance mira modelo de IA gigante: relato posterior no mesmo dia indicando que o modelo pode ter até 10 trilhões de parâmetros.
- ByteDance Seed Models: catálogo oficial de modelos e direções de pesquisa da equipe ByteDance Seed.
- ByteDance Seed Infrastructure: visão geral oficial do trabalho da ByteDance em infraestrutura de treinamento distribuído, inferência e sistemas de IA.
- Blog técnico do Kimi K3: explicação oficial da Moonshot AI sobre a arquitetura de 2,8T do Kimi K3 e 104B de parâmetros ativos.
- Repositório GitHub do Kimi K3: repositório oficial do modelo Kimi K3 e especificações técnicas.
- Site oficial do Qwen: portal oficial de modelos e API da Alibaba.
- GPU NVIDIA H100: especificações oficiais do H100 e informações para treinamento de modelos de grande porte.
Resumo
De acordo com relatos, a ByteDance está se preparando para lançar um modelo de fundação em escala ultra-grande, maior do que os modelos chineses atualmente divulgados publicamente. A AIBase e a LatePost descreveram inicialmente o projeto como tendo mais de 5 trilhões de parâmetros, enquanto relatos posteriores da Reuters/Financial Times no mesmo dia indicaram que o modelo pode chegar a 10 trilhões de parâmetros e já está em fase de pré-treinamento.
Um projeto dessa escala exigirá recursos computacionais imensos. As fontes citaram, por exemplo, que o cálculo de H100 necessário equivale a cerca de 35 milhões de dias de GPU, mas as necessidades reais de treinamento dependem da arquitetura, parâmetros ativos, geração de hardware, utilização e eficiência do treinamento.
A questão maior não é se a ByteDance consegue construir o maior modelo. O total de parâmetros é uma métrica incompleta para medir inteligência, especialmente para sistemas especialistas mistos esparsos.
O verdadeiro teste está em
a ByteDance conseguir transformar computação na escala de trilhões em um modelo que seja significativamente superior em desempenho, eficiente o suficiente para sustentar serviços e valioso o bastante para justificar a infraestrutura por trás dele.