Anthropic revela Modelo Interno 2: Capacidade Geral Ligeiramente Superior ao Claude Mythos 5

A Anthropic divulgou discretamente, em seu relatório de riscos de agosto de 2026, um modelo interno de IA não publicado, chamado Modelo 2. Esse modelo não é uma versão pública do Claude, e a Anthropic não anunciou...

发布于 2026年8月19日generalGEO 评分: 06 次阅读
Anthropic revela Modelo Interno 2: Capacidade Geral Ligeiramente Superior ao Claude Mythos 5

Anthropic divulga Modelo Interno 2: Capacidade geral ligeiramente superior ao Claude Mythos 5

Introdução

A Anthropic divulgou discretamente, em seu relatório de riscos de agosto de 2026, um modelo de IA interno não publicado chamado Modelo 2.

O modelo não é uma versão pública do Claude, e a Anthropic não o lançou como produto. Ele aparece no relatório porque a empresa incluiu sistemas de fronteira e quase fronteira implantados internamente ao avaliar riscos avançados de IA.

Segundo a Anthropic, o Modelo 2 tem capacidade geral ligeiramente superior ao Claude Mythos 5.

O avanço é real, mas a empresa evita cuidadosamente descrevê-lo como um salto geracional significativo.

O resumo da própria Anthropic observa que o Modelo 2 é visivelmente superior ao Mythos 5 em muitas tarefas relacionadas ao uso interno, mas ainda está longe do salto de capacidade observado na transição do Claude Opus 4.6 para o Claude Mythos Preview.

Isso torna o Modelo 2 relevante sob um ângulo diferente.

Mais do que marcar a chegada de uma nova geração, ele representa o aprimoramento contínuo das capacidades de modelos de fronteira pela Anthropic.

O relatório também apresenta um dado específico: na avaliação interna CoBench da Anthropic, o Modelo 2 obteve 62,8%, superando o Claude Mythos 5, com 50,3%, e o Claude Mythos Preview, com 54,8%.

O mesmo relatório menciona outro sistema interno, o Modelo 1, o que gerou especulações externas de que a Anthropic estaria desenvolvendo uma série de modelos internos antes de atribuir nomes públicos de produtos Claude.

O relatório oficial apoia apenas parcialmente essa interpretação.

A Anthropic confirma que o Modelo 1 e o Modelo 2 são modelos internos, mas não afirma que o Modelo 2 é o sucessor oficial do Modelo 1, nem que qualquer um deles se tornará uma futura versão do Claude.

Modelo 2 é ligeiramente superior ao Claude Mythos 5 no geral

O ponto central da matéria da AIBase é preciso: a Anthropic afirma que o Modelo 2 é, no geral, superior ao Claude Mythos 5.

O relatório de riscos de agosto descreve o Modelo 2 como:

  • Superior ao Mythos 5 em algumas áreas.
  • Inferior ao Mythos 5 em outras.
  • Ligeiramente superior no geral.

A Anthropic também afirma que sua avaliação qualitativa preliminar indica que o Modelo 2 oferece melhorias visíveis em muitas tarefas relacionadas ao uso interno.

Essa redação é importante.

O Modelo 2 não deve ser descrito como superior ao Mythos 5 em todos os benchmarks ou em todos os domínios relacionados a riscos.

O próprio relatório mostra que os resultados variam conforme a tarefa.

Por exemplo, em algumas avaliações de riscos químicos e biológicos, a Anthropic afirma que os resultados limitados do Modelo 2 são comparáveis ou inferiores aos do Claude Mythos 5.

Em outra avaliação de comportamento enganoso, o Modelo 2 é ligeiramente superior ao Mythos 5, mas ainda visivelmente inferior ao Mythos Preview.

Portanto, o resumo mais justo é:

Modelo 2
= capacidade geral ligeiramente superior
≠ superior em todas as avaliações

A melhoria não representa um salto geracional significativo

O texto original enfatiza que o avanço é relativamente limitado.

A Anthropic afirma que, em comparação com...

mesma situação.

A empresa compara especificamente o Modelo 2 com a transição anterior, ou seja, do Claude Opus 4.6 para o Claude Mythos Preview.

Essa atualização representou um ganho de capacidade muito maior.

O Modelo 2 não é o caso.

A Anthropic afirma que esse modelo interno mais recente apresenta melhorias visíveis em muitas tarefas internas, mas não é uma mudança disruptiva na mesma escala.

Isso também se reflete em outro indicador interno de capacidade.

A Anthropic mantém uma versão interna do Índice de Capacidade da Epoch, chamada AECI, que combina o desempenho em diversos benchmarks internos.

Com base em dados limitados, a pontuação do Modelo 2 é de aproximadamente:

1,5 pontos de AECI

acima do Claude Mythos 5.

A Anthropic ressalta que essa estimativa tem uma margem de erro considerável.

Ela também afirma que esse aumento é menor do que a melhoria observada entre o Mythos Preview e o Mythos 5.

Isso reforça a principal qualificação do artigo: o Modelo 2 parece ser um aprimoramento incremental dos modelos de fronteira, e não uma nova fase clara de capacidade.

CoBench oferece a comparação pública mais clara

A evidência mais concreta do relatório vem do CoBench.

A Anthropic descreve o CoBench como uma avaliação interna projetada para testar a capacidade do modelo de resolver problemas reais de pesquisa e desenvolvimento da empresa, em vez de usar benchmarks genéricos como substitutos.

A avaliação posiciona o modelo em um ponto histórico da infraestrutura da Anthropic.

O modelo recebe um snapshot de recursos, incluindo:

  • Código.
  • Logs.
  • Documentação interna.
  • Mensagens internas históricas.

Em seguida, ele precisa diagnosticar a causa raiz de problemas técnicos que engenheiros da Anthropic já resolveram anteriormente.

A versão atual descrita no relatório de agosto contém:

449 problemas

provenientes principalmente de problemas resolvidos entre fevereiro e abril de 2026.

Esses problemas vêm de setores da organização técnica da Anthropic que envolvem:

  • Treinamento de modelos.
  • Operação da infraestrutura de modelos.
  • Depuração de sistemas técnicos.
  • Engenharia de pesquisa.

Isso torna o CoBench particularmente relevante para o foco da Anthropic em IA automatizando pesquisa e desenvolvimento de IA.

Modelo 2 atinge 62,8% no CoBench

As pontuações comparativas apresentadas no relatório são:

Modelo Pontuação no CoBench
Claude Sonnet 4.6 12,0%
Claude Opus 4.6 15,6%
Claude Opus 4.7 27,4%
Claude Mythos 5 50,3%
Claude Mythos Preview 54,8%
Modelo 2 62,8%

Portanto, o Modelo 2 lidera entre os modelos mostrados no gráfico.

Sua vantagem em relação ao Mythos 5 é:

62,8% - 50,3% = 12,5 pontos percentuais

Nesse benchmark interno específico, é uma diferença significativa.

Mas ainda está muito abaixo da pontuação que a Anthropic considera necessária para substituir totalmente seus técnicos.

A Anthropic estima que a substituição total de pesquisadores exigiria cerca de 85% de pontuação

A Anthropic afirma que, com base em revisão manual de tarefas e do processo de pontuação, um sistema capaz de substituir verdadeiramente e integralmente os cientistas e engenheiros de pesquisa da Anthropic precisaria atingir, no mínimo, aproximadamente:

85%

no CoBench.

Os 62,8% do Modelo 2, portanto, ainda deixam uma lacuna considerável.

A Anthropic também alerta que o benchmark não é uma medida perfeita de equivalência humana.

O conjunto de dados é

deliberadamente filtrado para problemas difíceis.

A maioria das tarefas foi selecionada porque o Mythos Preview falhou pelo menos uma vez em três tentativas.

A Anthropic afirma que, sem essa filtragem, o tamanho do conjunto de dados seria aproximadamente o dobro.

Há outras limitações:

  • Algumas conclusões humanas históricas podem não ser ideais.
  • Algumas respostas podem ser ambíguas.
  • A pontuação automática pode cometer erros.

O modelo não obtém todas as permissões ou o suporte de infraestrutura que um engenheiro real da Anthropic poderia ter.

Portanto, o CoBench é melhor visto como um sinal interno útil, e não como um padrão geral para medir se um modelo de IA pode substituir pesquisadores.

Dar mais tokens ao Mythos 5 não fecha completamente a lacuna

A Anthropic também testou se os resultados do CoBench refletiam apenas um orçamento de raciocínio insuficiente.

O orçamento de tokens usado no gráfico é de aproximadamente:

300.000 tokens

para as configurações avaliadas.

Quando a Anthropic aumentou o orçamento do Mythos 5 para:

900.000 tokens

a pontuação dele melhorou apenas cerca de:

3 pontos percentuais

Isso indica que pelo menos parte da vantagem do Model 2 não pode ser explicada simplesmente dando mais tokens ao Mythos 5.

A Anthropic ainda acredita que melhores andaimes e estruturas de avaliação podem melhorar os resultados; portanto, esse benchmark não mede puramente os pesos do modelo em si.

A arquitetura do agente é importante.

O Model 2 já é amplamente usado internamente na Anthropic

O Model 2 ainda não foi lançado, mas não é apenas um checkpoint de laboratório sem uso.

A Anthropic afirma que o Model 2 e o Claude Mythos 5 estão entre os modelos mais capazes e mais utilizados internamente.

Eles são amplamente usados para:

  • Programação.
  • Geração de dados.
  • Outros fluxos de trabalho de agentes.
  • Pesquisa.
  • Engenharia.

A Anthropic também afirma que ambos os modelos são usados por meio de implantações de agentes persistentes, não apenas em sessões de chat interativas.

Isso é importante porque a seção de riscos do relatório se concentra em como os sistemas de IA podem automatizar cada vez mais partes do próprio trabalho de P&D da Anthropic.

O relatório afirma que o Claude agora escreve a grande maioria do código mesclado no repositório de produção da Anthropic.

No entanto, a Anthropic não concluiu que seus modelos são atualmente capazes de substituir completamente seus pesquisadores.

A empresa acredita que a IA está acelerando substancialmente o trabalho interno, mas sua avaliação de agosto ainda ficou abaixo dos limites da Política de Expansão Responsável para uma aceleração significativa de P&D impulsionada por IA.

O Model 2 ainda não concluiu toda a suíte de avaliação pré-implantação da Anthropic

O relatório também contém outra ressalva importante.

O Model 2 já passou pelo processo interno de revisão de implantação da Anthropic, mas ainda não passou pela suíte completa de avaliações que a empresa normalmente executa antes da implantação externa.

Portanto, a Anthropic afirma que sua confiança no entendimento do Model 2 é um pouco menor do que sua confiança em modelos lançados que passaram por avaliação completa.

Isso é importante ao interpretar comparações de benchmarks.

Um único resultado do CoBench pode indicar que o Model 2 tem um desempenho forte em tarefas internas de P&D.

Mas isso não estabelece um perfil completo de desempenho, abrangendo:

  • Raciocínio geral.
  • Programação.
  • Segurança cibernética.
  • Biologia.
  • Segurança.
  • Alinhamento.
  • Autonomia de longo ciclo.
  • Uso do consumidor.
  • Ambientes empresariais.

Volume de trabalho.

A conclusão atual da Anthropic é deliberadamente ampla: o Model 2 parece, no geral, um pouco superior ao Mythos 5.

A Anthropic atualmente não tem planos de lançar o Model 2 externamente

No breve artigo da AIBase, o detalhe prático mais importante pode facilmente passar despercebido.

A Anthropic afirmou explicitamente:

Atualmente não temos planos
de lançar este modelo
externamente.

Portanto, o Model 2 não deve ser visto como um próximo produto Claude com data de lançamento implícita.

Atualmente, não há:

  • Data de lançamento oficial.
  • Nome público do modelo.
  • ID do modelo na API Claude.
  • Preço.
  • Especificações de janela de contexto.
  • Planos de disponibilidade para consumidores.
  • Planos de implantação empresarial.

Qualquer alegação de que o Model 2 se tornará "Claude Mythos 6", "Claude Opus 6" ou outro produto nomeado é apenas especulação.

A Anthropic divulgou o modelo porque seus modelos internos são relevantes para a avaliação de risco da empresa.

Isso é diferente de lançar um produto.

O Claude Mythos 5 não é, na prática, um modelo público amplamente disponível

O título original da AIBase afirma que o Claude Mythos 5 é o modelo público mais forte disponível da Anthropic.

Isso precisa de uma pequena correção.

O Claude Mythos 5 não está amplamente disponível.

A Anthropic atualmente oferece o modelo apenas a um grupo limitado de clientes aprovados por meio do Projeto Glasswing e de programas relacionados de acesso confiável.

A versão amplamente disponível correspondente é o Claude Fable 5.

A Anthropic afirma que o Fable 5 e o Mythos 5 usam o mesmo modelo subjacente.

A diferença é que o Fable 5 inclui salvaguardas mais fortes em áreas sensíveis, como segurança cibernética e biologia, enquanto o Mythos 5 é fornecido a usuários revisados que precisam de menos restrições em trabalhos autorizados.

A relação atual do produto é:

Claude Mythos 5
= acesso confiável restrito

Claude Fable 5
= mesmo modelo subjacente
  + salvaguardas mais fortes
  + ampla disponibilidade

Portanto, para o leitor comum, uma afirmação mais precisa é: o Mythos 5 é o modelo de fronteira de acesso restrito mais forte da Anthropic, enquanto o Fable 5 é seu modelo amplamente lançado mais capaz.

O Model 1 é real, mas a história do produto "Model 1 → Model 2" é pura especulação

O relatório também menciona o Model 1.

Isso é suficiente para gerar especulações:

Model 1
→ Model 2
→ futuras versões do Claude?

Mas a Anthropic não fez essa afirmação.

Na verdade, ela descreve o Model 1 de forma bastante contida.

A empresa afirma que o Model 1 é aproximadamente equivalente em capacidade a:

  • Claude Mythos Preview.
  • Claude Mythos 5.

Ele recebeu implantação interna relativamente limitada.

A Anthropic diz que a grande maioria dos usuários internos prefere o Mythos 5, e o uso do Model 1 já era baixo e estava diminuindo na data de corte do relatório, 15 de julho.

A empresa também afirma:

Ela espera que o Model 1 não seja
implantado externamente
nem amplamente usado internamente
no futuro

Portanto, o Model 1 parece mais um branch de desenvolvimento interno ou checkpoint do que um produto predecessor claramente definido aguardando lançamento público.

O Model 2 difere do Model 1 em um aspecto importante

A Anthropic trata o Model 2 de forma visivelmente mais cuidadosa.

O Model 1 é discutido brevemente e depois praticamente excluído da análise de risco, porque a Anthropic

considera o Mythos 5 um limite superior razoável para seu risco.

Em contraste, o Model 2 é usado na maior parte do relatório porque:

  • É mais capaz no geral.
  • É usado com mais frequência internamente.
  • É relevante para a análise de risco de fronteira da Anthropic.

O relatório afirma que o uso interno do Model 2 é semelhante ao do Mythos 5.

Isso não prova um lançamento público iminente.

Mas indica que o Model 2 tem uma posição operacional importante dentro da Anthropic.

O relatório de risco é o motivo pelo qual o modelo é conhecido publicamente

O Model 2 não foi apresentado por meio de um post tradicional de lançamento.

Ele veio à tona porque a Política de Expansão Responsável da Anthropic exige que a empresa faça análises de risco dos sistemas que está realmente desenvolvendo e implantando internamente.

O relatório de risco de agosto de 2026 abrange as atividades da Anthropic até 15 de julho de 2026.

Quando modelos internos são relevantes para as seguintes questões, a Anthropic os lista:

  • Problemas de desalinhamento em ambientes de alto risco.
  • Automação de P&D de IA.
  • Riscos biológicos e químicos.
  • Segurança de modelos.
  • Monitoramento interno.

É por isso que, no relatório, o Model 2

informação do que um modelo comum não lançado obteria.

Esta divulgação é, em primeiro lugar, um produto da governança de segurança e, em segundo lugar, um vazamento de produto.

O que o relatório nos diz e o que não nos diz

Declaração Status
A Anthropic tem um modelo interno chamado Modelo 2 Confirmado
O Modelo 2 ainda não foi lançado Confirmado
O Modelo 2 é, no geral, ligeiramente superior ao Mythos 5 Confirmado pela Anthropic
O Modelo 2 é melhor que o Mythos 5 em todas as áreas Não
O Modelo 2 obteve 62,8% na comparação CoBench mostrada no relatório Confirmado nos dados do relatório
O Mythos 5 obteve 50,3% na mesma comparação Confirmado nos dados do relatório
A Anthropic estima uma taxa de substituição total de funcionários técnicos em cerca de 85% no CoBench Confirmado
O Modelo 2 é amplamente utilizado internamente Confirmado
O Modelo 2 concluiu o conjunto completo de avaliações externas padrão de lançamento Não
A Anthropic planeja atualmente lançar publicamente o Modelo 2 Não
O Modelo 2 tem um nome oficial de produto Claude Não
O Modelo 1 é um modelo interno real Confirmado
O Modelo 1 é definitivamente o predecessor direto do Modelo 2 Ainda não determinado
O Modelo 1 deverá ser lançado publicamente Não
O Claude Mythos 5 está disponível para todos Não
O Claude Fable 5 é a versão de lançamento amplo correspondente ao Mythos 5 Confirmado

Perguntas frequentes

O que é o Modelo 2 da Anthropic?

O Modelo 2 é um modelo de fronteira interno não lançado, divulgado no relatório de risco de agosto de 2026 da Anthropic. A Anthropic afirma que ele é, no geral, ligeiramente superior ao Claude Mythos 5 e já foi amplamente utilizado internamente para codificação, geração de dados, pesquisa, engenharia e outros trabalhos de agentes.

O Modelo 2 é melhor que o Claude Mythos 5?

No geral, a Anthropic diz que sim — mas apenas ligeiramente. A empresa também afirma que o Modelo 2 é mais forte em algumas áreas e mais fraco em outras, portanto não deve ser descrito como superior em todos os aspectos.

Qual é a pontuação CoBench do Modelo 2?

A comparação mostrada no relatório indica que o Modelo 2 obteve 62,8%, à frente do Mythos Preview com 54,8% e do Mythos 5 com 50,3%. A Anthropic estima que um modelo com capacidade plena

de substituição de funcionários técnicos precisaria atingir pelo menos cerca de 85% nas avaliações atuais.

O que o CoBench avalia?

O CoBench é uma avaliação interna projetada pela Anthropic com base em problemas históricos de pesquisa e engenharia que seus funcionários técnicos resolveram no passado. O modelo recebe snapshots históricos, incluindo código, logs, mensagens internas e documentação, e deve diagnosticar o problema técnico subjacente.

A Anthropic lançará o Modelo 2?

A Anthropic afirma que não há planos atuais de lançar publicamente o Modelo 2. A empresa ainda não divulgou nome de produto, data de lançamento, identificadores de API, preços ou planos de acesso público.

O Modelo 2 é o próximo modelo Claude Mythos?

A Anthropic não fez tal afirmação. O Modelo 2 é um identificador interno usado no relatório de risco; relacioná-lo a um futuro nome de produto Claude é pura especulação.

O que é o Modelo 1 da Anthropic?

O Modelo 1 é outro modelo interno divulgado no mesmo relatório. A Anthropic afirma que ele é aproximadamente semelhante ao Mythos Preview e ao Mythos 5, com uso interno relativamente baixo e em declínio, e não há expectativa de implantação pública.

O Claude Mythos 5 foi lançado publicamente?

Não está amplamente disponível. O Mythos 5 é oferecido por meio de programas de acesso confiável restrito, como o Project Glasswing, enquanto o Claude Fable 5 usa o mesmo modelo de base, mas com proteções de segurança mais fortes e está amplamente disponível.

Ferramentas relacionadas

  • Claude: assistente de IA geral da Anthropic para consumidores e profissionais.
  • API Claude: plataforma de desenvolvedores da Anthropic para modelos Claude amplamente disponíveis.
  • Console Anthropic: espaço de trabalho oficial para testar modelos da API Claude e gerenciar acesso de desenvolvedores.
  • Project Glasswing: programa de acesso confiável da Anthropic para capacidades avançadas de segurança cibernética de nível Mythos.
  • Anthropic Transparency Hub: recurso central para avaliações de segurança de modelos, fichas técnicas e informações de risco.

Links relacionados

Resumo

O relatório de risco de agosto de 2026 da Anthropic revelou um modelo interno chamado Modelo 2, que já

está sendo amplamente utilizado para pesquisa, engenharia, codificação, geração de dados e fluxos de trabalho persistentes de agentes.

O modelo é mais forte que o Claude Mythos 5 na avaliação interna CoBench da Anthropic, com pontuações de 62,8% e 50,3%, respectivamente. A Anthropic também afirma que o Modelo 2 parece, no geral, ligeiramente superior, embora seja mais fraco que o Mythos 5 em algumas áreas, e o nível de melhoria é muito menor do que saltos anteriores de capacidade significativa.

O relatório também menciona o Modelo 1, mas as evidências são insuficientes para considerar o Modelo 1 e o Modelo 2 como uma sequência confirmada de produtos públicos. O uso interno do Modelo 1 está em declínio, e a Anthropic afirma explicitamente que não há planos atuais de lançar publicamente o Modelo 2.

A conclusão mais clara é que a fronteira interna da Anthropic já superou ligeiramente o Mythos 5 — mas o Modelo 2 é um sistema de pesquisa interno, não o próximo produto Claude de nova geração lançado.