Anthropic revela Modelo Interno 2: Capacidade Geral Ligeiramente Superior ao Claude Mythos 5
A Anthropic divulgou discretamente, em seu relatório de riscos de agosto de 2026, um modelo interno de IA não publicado, chamado Modelo 2. Esse modelo não é uma versão pública do Claude, e a Anthropic não anunciou...

Anthropic divulga Modelo Interno 2: Capacidade geral ligeiramente superior ao Claude Mythos 5
Introdução
A Anthropic divulgou discretamente, em seu relatório de riscos de agosto de 2026, um modelo de IA interno não publicado chamado Modelo 2.
O modelo não é uma versão pública do Claude, e a Anthropic não o lançou como produto. Ele aparece no relatório porque a empresa incluiu sistemas de fronteira e quase fronteira implantados internamente ao avaliar riscos avançados de IA.
Segundo a Anthropic, o Modelo 2 tem capacidade geral ligeiramente superior ao Claude Mythos 5.
O avanço é real, mas a empresa evita cuidadosamente descrevê-lo como um salto geracional significativo.
O resumo da própria Anthropic observa que o Modelo 2 é visivelmente superior ao Mythos 5 em muitas tarefas relacionadas ao uso interno, mas ainda está longe do salto de capacidade observado na transição do Claude Opus 4.6 para o Claude Mythos Preview.
Isso torna o Modelo 2 relevante sob um ângulo diferente.
Mais do que marcar a chegada de uma nova geração, ele representa o aprimoramento contínuo das capacidades de modelos de fronteira pela Anthropic.
O relatório também apresenta um dado específico: na avaliação interna CoBench da Anthropic, o Modelo 2 obteve 62,8%, superando o Claude Mythos 5, com 50,3%, e o Claude Mythos Preview, com 54,8%.

O mesmo relatório menciona outro sistema interno, o Modelo 1, o que gerou especulações externas de que a Anthropic estaria desenvolvendo uma série de modelos internos antes de atribuir nomes públicos de produtos Claude.
O relatório oficial apoia apenas parcialmente essa interpretação.
A Anthropic confirma que o Modelo 1 e o Modelo 2 são modelos internos, mas não afirma que o Modelo 2 é o sucessor oficial do Modelo 1, nem que qualquer um deles se tornará uma futura versão do Claude.
Modelo 2 é ligeiramente superior ao Claude Mythos 5 no geral
O ponto central da matéria da AIBase é preciso: a Anthropic afirma que o Modelo 2 é, no geral, superior ao Claude Mythos 5.
O relatório de riscos de agosto descreve o Modelo 2 como:
- Superior ao Mythos 5 em algumas áreas.
- Inferior ao Mythos 5 em outras.
- Ligeiramente superior no geral.
A Anthropic também afirma que sua avaliação qualitativa preliminar indica que o Modelo 2 oferece melhorias visíveis em muitas tarefas relacionadas ao uso interno.
Essa redação é importante.
O Modelo 2 não deve ser descrito como superior ao Mythos 5 em todos os benchmarks ou em todos os domínios relacionados a riscos.
O próprio relatório mostra que os resultados variam conforme a tarefa.
Por exemplo, em algumas avaliações de riscos químicos e biológicos, a Anthropic afirma que os resultados limitados do Modelo 2 são comparáveis ou inferiores aos do Claude Mythos 5.
Em outra avaliação de comportamento enganoso, o Modelo 2 é ligeiramente superior ao Mythos 5, mas ainda visivelmente inferior ao Mythos Preview.
Portanto, o resumo mais justo é:
Modelo 2
= capacidade geral ligeiramente superior
≠ superior em todas as avaliações
A melhoria não representa um salto geracional significativo
O texto original enfatiza que o avanço é relativamente limitado.
A Anthropic afirma que, em comparação com...
mesma situação.
A empresa compara especificamente o Modelo 2 com a transição anterior, ou seja, do Claude Opus 4.6 para o Claude Mythos Preview.
Essa atualização representou um ganho de capacidade muito maior.
O Modelo 2 não é o caso.
A Anthropic afirma que esse modelo interno mais recente apresenta melhorias visíveis em muitas tarefas internas, mas não é uma mudança disruptiva na mesma escala.
Isso também se reflete em outro indicador interno de capacidade.
A Anthropic mantém uma versão interna do Índice de Capacidade da Epoch, chamada AECI, que combina o desempenho em diversos benchmarks internos.
Com base em dados limitados, a pontuação do Modelo 2 é de aproximadamente:
1,5 pontos de AECI
acima do Claude Mythos 5.
A Anthropic ressalta que essa estimativa tem uma margem de erro considerável.
Ela também afirma que esse aumento é menor do que a melhoria observada entre o Mythos Preview e o Mythos 5.
Isso reforça a principal qualificação do artigo: o Modelo 2 parece ser um aprimoramento incremental dos modelos de fronteira, e não uma nova fase clara de capacidade.
CoBench oferece a comparação pública mais clara
A evidência mais concreta do relatório vem do CoBench.
A Anthropic descreve o CoBench como uma avaliação interna projetada para testar a capacidade do modelo de resolver problemas reais de pesquisa e desenvolvimento da empresa, em vez de usar benchmarks genéricos como substitutos.
A avaliação posiciona o modelo em um ponto histórico da infraestrutura da Anthropic.
O modelo recebe um snapshot de recursos, incluindo:
- Código.
- Logs.
- Documentação interna.
- Mensagens internas históricas.
Em seguida, ele precisa diagnosticar a causa raiz de problemas técnicos que engenheiros da Anthropic já resolveram anteriormente.
A versão atual descrita no relatório de agosto contém:
449 problemas
provenientes principalmente de problemas resolvidos entre fevereiro e abril de 2026.
Esses problemas vêm de setores da organização técnica da Anthropic que envolvem:
- Treinamento de modelos.
- Operação da infraestrutura de modelos.
- Depuração de sistemas técnicos.
- Engenharia de pesquisa.
Isso torna o CoBench particularmente relevante para o foco da Anthropic em IA automatizando pesquisa e desenvolvimento de IA.
Modelo 2 atinge 62,8% no CoBench
As pontuações comparativas apresentadas no relatório são:
| Modelo | Pontuação no CoBench |
|---|---|
| Claude Sonnet 4.6 | 12,0% |
| Claude Opus 4.6 | 15,6% |
| Claude Opus 4.7 | 27,4% |
| Claude Mythos 5 | 50,3% |
| Claude Mythos Preview | 54,8% |
| Modelo 2 | 62,8% |
Portanto, o Modelo 2 lidera entre os modelos mostrados no gráfico.
Sua vantagem em relação ao Mythos 5 é:
62,8% - 50,3% = 12,5 pontos percentuais
Nesse benchmark interno específico, é uma diferença significativa.
Mas ainda está muito abaixo da pontuação que a Anthropic considera necessária para substituir totalmente seus técnicos.
A Anthropic estima que a substituição total de pesquisadores exigiria cerca de 85% de pontuação
A Anthropic afirma que, com base em revisão manual de tarefas e do processo de pontuação, um sistema capaz de substituir verdadeiramente e integralmente os cientistas e engenheiros de pesquisa da Anthropic precisaria atingir, no mínimo, aproximadamente:
85%
no CoBench.
Os 62,8% do Modelo 2, portanto, ainda deixam uma lacuna considerável.
A Anthropic também alerta que o benchmark não é uma medida perfeita de equivalência humana.
O conjunto de dados é
deliberadamente filtrado para problemas difíceis.
A maioria das tarefas foi selecionada porque o Mythos Preview falhou pelo menos uma vez em três tentativas.
A Anthropic afirma que, sem essa filtragem, o tamanho do conjunto de dados seria aproximadamente o dobro.
Há outras limitações:
- Algumas conclusões humanas históricas podem não ser ideais.
- Algumas respostas podem ser ambíguas.
- A pontuação automática pode cometer erros.
O modelo não obtém todas as permissões ou o suporte de infraestrutura que um engenheiro real da Anthropic poderia ter.
Portanto, o CoBench é melhor visto como um sinal interno útil, e não como um padrão geral para medir se um modelo de IA pode substituir pesquisadores.
Dar mais tokens ao Mythos 5 não fecha completamente a lacuna
A Anthropic também testou se os resultados do CoBench refletiam apenas um orçamento de raciocínio insuficiente.
O orçamento de tokens usado no gráfico é de aproximadamente:
300.000 tokens
para as configurações avaliadas.
Quando a Anthropic aumentou o orçamento do Mythos 5 para:
900.000 tokens
a pontuação dele melhorou apenas cerca de:
3 pontos percentuais
Isso indica que pelo menos parte da vantagem do Model 2 não pode ser explicada simplesmente dando mais tokens ao Mythos 5.
A Anthropic ainda acredita que melhores andaimes e estruturas de avaliação podem melhorar os resultados; portanto, esse benchmark não mede puramente os pesos do modelo em si.
A arquitetura do agente é importante.
O Model 2 já é amplamente usado internamente na Anthropic
O Model 2 ainda não foi lançado, mas não é apenas um checkpoint de laboratório sem uso.
A Anthropic afirma que o Model 2 e o Claude Mythos 5 estão entre os modelos mais capazes e mais utilizados internamente.
Eles são amplamente usados para:
- Programação.
- Geração de dados.
- Outros fluxos de trabalho de agentes.
- Pesquisa.
- Engenharia.
A Anthropic também afirma que ambos os modelos são usados por meio de implantações de agentes persistentes, não apenas em sessões de chat interativas.
Isso é importante porque a seção de riscos do relatório se concentra em como os sistemas de IA podem automatizar cada vez mais partes do próprio trabalho de P&D da Anthropic.
O relatório afirma que o Claude agora escreve a grande maioria do código mesclado no repositório de produção da Anthropic.
No entanto, a Anthropic não concluiu que seus modelos são atualmente capazes de substituir completamente seus pesquisadores.
A empresa acredita que a IA está acelerando substancialmente o trabalho interno, mas sua avaliação de agosto ainda ficou abaixo dos limites da Política de Expansão Responsável para uma aceleração significativa de P&D impulsionada por IA.
O Model 2 ainda não concluiu toda a suíte de avaliação pré-implantação da Anthropic
O relatório também contém outra ressalva importante.
O Model 2 já passou pelo processo interno de revisão de implantação da Anthropic, mas ainda não passou pela suíte completa de avaliações que a empresa normalmente executa antes da implantação externa.
Portanto, a Anthropic afirma que sua confiança no entendimento do Model 2 é um pouco menor do que sua confiança em modelos lançados que passaram por avaliação completa.
Isso é importante ao interpretar comparações de benchmarks.
Um único resultado do CoBench pode indicar que o Model 2 tem um desempenho forte em tarefas internas de P&D.
Mas isso não estabelece um perfil completo de desempenho, abrangendo:
- Raciocínio geral.
- Programação.
- Segurança cibernética.
- Biologia.
- Segurança.
- Alinhamento.
- Autonomia de longo ciclo.
- Uso do consumidor.
- Ambientes empresariais.
Volume de trabalho.
A conclusão atual da Anthropic é deliberadamente ampla: o Model 2 parece, no geral, um pouco superior ao Mythos 5.
A Anthropic atualmente não tem planos de lançar o Model 2 externamente
No breve artigo da AIBase, o detalhe prático mais importante pode facilmente passar despercebido.
A Anthropic afirmou explicitamente:
Atualmente não temos planos
de lançar este modelo
externamente.
Portanto, o Model 2 não deve ser visto como um próximo produto Claude com data de lançamento implícita.
Atualmente, não há:
- Data de lançamento oficial.
- Nome público do modelo.
- ID do modelo na API Claude.
- Preço.
- Especificações de janela de contexto.
- Planos de disponibilidade para consumidores.
- Planos de implantação empresarial.
Qualquer alegação de que o Model 2 se tornará "Claude Mythos 6", "Claude Opus 6" ou outro produto nomeado é apenas especulação.
A Anthropic divulgou o modelo porque seus modelos internos são relevantes para a avaliação de risco da empresa.
Isso é diferente de lançar um produto.
O Claude Mythos 5 não é, na prática, um modelo público amplamente disponível
O título original da AIBase afirma que o Claude Mythos 5 é o modelo público mais forte disponível da Anthropic.
Isso precisa de uma pequena correção.
O Claude Mythos 5 não está amplamente disponível.
A Anthropic atualmente oferece o modelo apenas a um grupo limitado de clientes aprovados por meio do Projeto Glasswing e de programas relacionados de acesso confiável.
A versão amplamente disponível correspondente é o Claude Fable 5.
A Anthropic afirma que o Fable 5 e o Mythos 5 usam o mesmo modelo subjacente.
A diferença é que o Fable 5 inclui salvaguardas mais fortes em áreas sensíveis, como segurança cibernética e biologia, enquanto o Mythos 5 é fornecido a usuários revisados que precisam de menos restrições em trabalhos autorizados.
A relação atual do produto é:
Claude Mythos 5
= acesso confiável restrito
Claude Fable 5
= mesmo modelo subjacente
+ salvaguardas mais fortes
+ ampla disponibilidade
Portanto, para o leitor comum, uma afirmação mais precisa é: o Mythos 5 é o modelo de fronteira de acesso restrito mais forte da Anthropic, enquanto o Fable 5 é seu modelo amplamente lançado mais capaz.
O Model 1 é real, mas a história do produto "Model 1 → Model 2" é pura especulação
O relatório também menciona o Model 1.
Isso é suficiente para gerar especulações:
Model 1
→ Model 2
→ futuras versões do Claude?
Mas a Anthropic não fez essa afirmação.
Na verdade, ela descreve o Model 1 de forma bastante contida.
A empresa afirma que o Model 1 é aproximadamente equivalente em capacidade a:
- Claude Mythos Preview.
- Claude Mythos 5.
Ele recebeu implantação interna relativamente limitada.
A Anthropic diz que a grande maioria dos usuários internos prefere o Mythos 5, e o uso do Model 1 já era baixo e estava diminuindo na data de corte do relatório, 15 de julho.
A empresa também afirma:
Ela espera que o Model 1 não seja
implantado externamente
nem amplamente usado internamente
no futuro
Portanto, o Model 1 parece mais um branch de desenvolvimento interno ou checkpoint do que um produto predecessor claramente definido aguardando lançamento público.
O Model 2 difere do Model 1 em um aspecto importante
A Anthropic trata o Model 2 de forma visivelmente mais cuidadosa.
O Model 1 é discutido brevemente e depois praticamente excluído da análise de risco, porque a Anthropic
considera o Mythos 5 um limite superior razoável para seu risco.
Em contraste, o Model 2 é usado na maior parte do relatório porque:
- É mais capaz no geral.
- É usado com mais frequência internamente.
- É relevante para a análise de risco de fronteira da Anthropic.
O relatório afirma que o uso interno do Model 2 é semelhante ao do Mythos 5.
Isso não prova um lançamento público iminente.
Mas indica que o Model 2 tem uma posição operacional importante dentro da Anthropic.
O relatório de risco é o motivo pelo qual o modelo é conhecido publicamente
O Model 2 não foi apresentado por meio de um post tradicional de lançamento.
Ele veio à tona porque a Política de Expansão Responsável da Anthropic exige que a empresa faça análises de risco dos sistemas que está realmente desenvolvendo e implantando internamente.
O relatório de risco de agosto de 2026 abrange as atividades da Anthropic até 15 de julho de 2026.
Quando modelos internos são relevantes para as seguintes questões, a Anthropic os lista:
- Problemas de desalinhamento em ambientes de alto risco.
- Automação de P&D de IA.
- Riscos biológicos e químicos.
- Segurança de modelos.
- Monitoramento interno.
É por isso que, no relatório, o Model 2
informação do que um modelo comum não lançado obteria.
Esta divulgação é, em primeiro lugar, um produto da governança de segurança e, em segundo lugar, um vazamento de produto.
O que o relatório nos diz e o que não nos diz
| Declaração | Status |
|---|---|
| A Anthropic tem um modelo interno chamado Modelo 2 | Confirmado |
| O Modelo 2 ainda não foi lançado | Confirmado |
| O Modelo 2 é, no geral, ligeiramente superior ao Mythos 5 | Confirmado pela Anthropic |
| O Modelo 2 é melhor que o Mythos 5 em todas as áreas | Não |
| O Modelo 2 obteve 62,8% na comparação CoBench mostrada no relatório | Confirmado nos dados do relatório |
| O Mythos 5 obteve 50,3% na mesma comparação | Confirmado nos dados do relatório |
| A Anthropic estima uma taxa de substituição total de funcionários técnicos em cerca de 85% no CoBench | Confirmado |
| O Modelo 2 é amplamente utilizado internamente | Confirmado |
| O Modelo 2 concluiu o conjunto completo de avaliações externas padrão de lançamento | Não |
| A Anthropic planeja atualmente lançar publicamente o Modelo 2 | Não |
| O Modelo 2 tem um nome oficial de produto Claude | Não |
| O Modelo 1 é um modelo interno real | Confirmado |
| O Modelo 1 é definitivamente o predecessor direto do Modelo 2 | Ainda não determinado |
| O Modelo 1 deverá ser lançado publicamente | Não |
| O Claude Mythos 5 está disponível para todos | Não |
| O Claude Fable 5 é a versão de lançamento amplo correspondente ao Mythos 5 | Confirmado |
Perguntas frequentes
O que é o Modelo 2 da Anthropic?
O Modelo 2 é um modelo de fronteira interno não lançado, divulgado no relatório de risco de agosto de 2026 da Anthropic. A Anthropic afirma que ele é, no geral, ligeiramente superior ao Claude Mythos 5 e já foi amplamente utilizado internamente para codificação, geração de dados, pesquisa, engenharia e outros trabalhos de agentes.
O Modelo 2 é melhor que o Claude Mythos 5?
No geral, a Anthropic diz que sim — mas apenas ligeiramente. A empresa também afirma que o Modelo 2 é mais forte em algumas áreas e mais fraco em outras, portanto não deve ser descrito como superior em todos os aspectos.
Qual é a pontuação CoBench do Modelo 2?
A comparação mostrada no relatório indica que o Modelo 2 obteve 62,8%, à frente do Mythos Preview com 54,8% e do Mythos 5 com 50,3%. A Anthropic estima que um modelo com capacidade plena
de substituição de funcionários técnicos precisaria atingir pelo menos cerca de 85% nas avaliações atuais.
O que o CoBench avalia?
O CoBench é uma avaliação interna projetada pela Anthropic com base em problemas históricos de pesquisa e engenharia que seus funcionários técnicos resolveram no passado. O modelo recebe snapshots históricos, incluindo código, logs, mensagens internas e documentação, e deve diagnosticar o problema técnico subjacente.
A Anthropic lançará o Modelo 2?
A Anthropic afirma que não há planos atuais de lançar publicamente o Modelo 2. A empresa ainda não divulgou nome de produto, data de lançamento, identificadores de API, preços ou planos de acesso público.
O Modelo 2 é o próximo modelo Claude Mythos?
A Anthropic não fez tal afirmação. O Modelo 2 é um identificador interno usado no relatório de risco; relacioná-lo a um futuro nome de produto Claude é pura especulação.
O que é o Modelo 1 da Anthropic?
O Modelo 1 é outro modelo interno divulgado no mesmo relatório. A Anthropic afirma que ele é aproximadamente semelhante ao Mythos Preview e ao Mythos 5, com uso interno relativamente baixo e em declínio, e não há expectativa de implantação pública.
O Claude Mythos 5 foi lançado publicamente?
Não está amplamente disponível. O Mythos 5 é oferecido por meio de programas de acesso confiável restrito, como o Project Glasswing, enquanto o Claude Fable 5 usa o mesmo modelo de base, mas com proteções de segurança mais fortes e está amplamente disponível.
Ferramentas relacionadas
- Claude: assistente de IA geral da Anthropic para consumidores e profissionais.
- API Claude: plataforma de desenvolvedores da Anthropic para modelos Claude amplamente disponíveis.
- Console Anthropic: espaço de trabalho oficial para testar modelos da API Claude e gerenciar acesso de desenvolvedores.
- Project Glasswing: programa de acesso confiável da Anthropic para capacidades avançadas de segurança cibernética de nível Mythos.
- Anthropic Transparency Hub: recurso central para avaliações de segurança de modelos, fichas técnicas e informações de risco.
Links relacionados
- Relatório de risco de agosto de 2026 da Anthropic: fonte principal que divulga o Modelo 1, o Modelo 2, CoBench, uso interno e planos de lançamento atuais.
- Claude Fable 5 e Claude Mythos 5: anúncio oficial de lançamento da Anthropic explicando a relação entre os dois modelos.
- Visão geral dos modelos Claude: informações oficiais atuais de disponibilidade e API dos modelos lançados pela Anthropic.
- Claude Mythos: informações oficiais sobre disponibilidade, proteções de segurança, preços e o Project Glasswing do Mythos 5.
- Política de Escalonamento Responsável da Anthropic: estrutura de governança por trás do processo regular de relatórios de risco da Anthropic.
- Anthropic Transparency Hub: informações oficiais de segurança e capacidades dos modelos Claude atuais.
Resumo
O relatório de risco de agosto de 2026 da Anthropic revelou um modelo interno chamado Modelo 2, que já
está sendo amplamente utilizado para pesquisa, engenharia, codificação, geração de dados e fluxos de trabalho persistentes de agentes.
O modelo é mais forte que o Claude Mythos 5 na avaliação interna CoBench da Anthropic, com pontuações de 62,8% e 50,3%, respectivamente. A Anthropic também afirma que o Modelo 2 parece, no geral, ligeiramente superior, embora seja mais fraco que o Mythos 5 em algumas áreas, e o nível de melhoria é muito menor do que saltos anteriores de capacidade significativa.
O relatório também menciona o Modelo 1, mas as evidências são insuficientes para considerar o Modelo 1 e o Modelo 2 como uma sequência confirmada de produtos públicos. O uso interno do Modelo 1 está em declínio, e a Anthropic afirma explicitamente que não há planos atuais de lançar publicamente o Modelo 2.
A conclusão mais clara é que a fronteira interna da Anthropic já superou ligeiramente o Mythos 5 — mas o Modelo 2 é um sistema de pesquisa interno, não o próximo produto Claude de nova geração lançado.