GPT-5.6 Sol supera ligeiramente Claude Mythos 5 em testes de cibersegurança, enquanto modelos de código aberto reduzem a diferença

Duas avaliações de cibersegurança divulgadas pelo Instituto de Segurança de Inteligência Artificial do Reino Unido (AISI) mostram que o GPT-5.6 Sol teve um desempenho ligeiramente superior ao Claude Mythos 5. Esse resultado merece atenção, mas deve ser interpretado com cautela. O AISI não publicou um ranking abrangente de capacidades ofensivas e defensivas em cibersegurança, mas testou os modelos em um conjunto específico de tarefas técnicas restritas e em cenários simulados de ataques de longo prazo a redes empresariais. Nessas condições, o GPT-5.6 Sol obteve a maior pontuação média, enquanto o Mythos

发布于 2026年7月23日generalGEO 评分: 01 次阅读
Cover image for “GPT-5.6 Sol supera ligeiramente Claude Mythos 5 em testes de cibersegurança, enquanto modelos de código aberto reduzem a diferença”

GPT-5.6 Sol supera ligeiramente Claude Mythos 5 em testes de cibersegurança, enquanto modelos de código aberto reduzem a diferença

Introdução

Nas duas avaliações de segurança cibernética publicadas pelo Instituto de Segurança de Inteligência Artificial do Reino Unido (AISI), o GPT-5.6 Sol ficou ligeiramente acima do Claude Mythos 5. Este resultado merece atenção, mas deve ser interpretado com cautela.

O AISI não publicou um ranking geral que abranja todas as capacidades de segurança cibernética ofensivas e defensivas. Ele testou o desempenho dos modelos em várias tarefas técnicas específicas e em ataques simulados de longo prazo a redes empresariais. Nessas configurações, o GPT-5.6 Sol obteve a maior pontuação média, enquanto o Mythos 5 ficou muito próximo.

Descobertas mais importantes vêm dos modelos de peso aberto. O AISI constatou que o desempenho do GLM-5.2 e do DeepSeek V4-Pro já é comparável ao dos principais modelos fechados lançados há apenas quatro a sete meses. Nos testes internos do AISI em 2025, a diferença de tempo era de seis a dez meses.

Essa redução na diferença de tempo é significativa, pois modelos de peso aberto podem ser baixados, modificados, implantados de forma privada e executados sem monitoramento do provedor. Essa flexibilidade, que apoia a pesquisa, protege a privacidade e reduz custos, também pode tornar mais difícil controlar capacidades avançadas de rede após o lançamento.

O que o AISI avaliou

O AISI utilizou dois sistemas de avaliação complementares.

Tarefas de rede em domínios restritos

O primeiro sistema de avaliação mede habilidades específicas de segurança cibernética por meio de 70 tarefas selecionadas de um conjunto maior de 96 tarefas.

Essas tarefas abrangem quatro áreas principais:

  • Pesquisa e exploração de vulnerabilidades
  • Engenharia reversa
  • Exploração de rede
  • Criptografia

Elas são divididas em quatro níveis de dificuldade, com base na experiência humana estimada necessária:

Nível de dificuldade Experiência humana aproximada Número de tarefas
Não especialista técnico Possui formação técnica, mas experiência limitada em segurança cibernética 18
Aprendiz Cerca de 1-3 anos 25
Praticante Cerca de 3-10 anos 19
Especialista Mais de 10 anos 8

Cada modelo tem cinco tentativas por tarefa, com um limite de 2,5 milhões de tokens por tentativa. O AISI então calcula a taxa média de sucesso.

Campo de treino de rede

O segundo sistema mede se o modelo consegue sustentar de forma autônoma um ataque de várias etapas em uma rede simulada.

O cenário principal discutido no relatório é chamado de O Último Sobrevivente. Ele inclui:

  • 32 etapas consecutivas de ataque
  • Quatro sub-redes de rede
  • Cerca de 20 anfitriões
  • Vários marcos nomeados
  • Especialistas humanos estimam 20 horas de trabalho

Cada trajetória do modelo principal representa a média de dez execuções, com um limite de 100 milhões de tokens por execução.

Esses ambientes não reproduzem todas as dificuldades de atacar uma organização real bem defendida. O AISI observa que esses campos de treino atualmente não incluem defensores humanos ativos, ferramentas de defesa nem penalidades por acionar alarmes.

O que os resultados do GPT-5.6 Sol e Mythos 5 realmente indicam

No conjunto de tarefas restritas, o GPT-5.6 Sol registrou a maior taxa média de sucesso nos gráficos publicados pelo AISI. O Claude Mythos 5 ficou logo atrás, com sobreposição nas faixas de incerteza.

Imagem do gráfico publicado pelo AISI comparando o desempenho de modelos de peso aberto recentes com modelos fechados de ponta lançados há 4-5 meses em tarefas restritas de rede. O eixo horizontal representa o tempo, e o eixo vertical a taxa média de sucesso. Vários modelos são identificados com cores diferentes, como GPT-5.6-Sol, GPT-5, Claude Mythos 5, etc. O GPT-5.6-Sol tem uma taxa média de sucesso próxima de 90% em fevereiro de 2026, enquanto o Claude Mythos 5 tem cerca de 60% em outubro de 2025. O gráfico está intimamente relacionado ao contexto, apresentando visualmente as diferenças de desempenho dos modelos em tarefas restritas de rede.

O gráfico mostra que a taxa média de sucesso do GPT-5.6 Sol é ligeiramente superior a 90%, enquanto a do Mythos 5 é de cerca de 90%. Devido à sobreposição nas barras de incerteza, o resultado deve ser descrito como uma ligeira liderança nesta avaliação — não prova que o Sol é absolutamente superior em todos os cenários de segurança cibernética.

As tarefas de longo prazo também apresentam uma situação semelhante.

Em média, o GPT-5.6 Sol completou cerca de 29 das 32 etapas, enquanto o Claude Mythos 5 completou cerca de 27. As melhores tentativas de ambos os modelos completaram todas as etapas.

As seguintes conclusões podem ser tiradas:

  1. O GPT-5.6 Sol teve o melhor desempenho médio nesta tarefa específica de longo prazo.
  2. O Mythos 5 apresentou desempenho próximo e também completou todas as 32 etapas em sua melhor tentativa.
  3. A diferença pode refletir a capacidade do modelo, confiabilidade do agente, uso de ferramentas, capacidade de planejamento de longo prazo ou uma combinação desses fatores.
  4. A evidência de um único cenário de segurança cibernética é mais fraca do que dados de um grande número de tarefas diversificadas.
  5. Esses resultados não estabelecem um ranking geral de segurança ofensiva.

O relatório do AISI concentra-se principalmente na diferença de capacidade entre modelos de código aberto e fechado, em vez de determinar quem é o vencedor geral entre Sol e Mythos.

Modelos de código aberto agora estão apenas 4 a 7 meses atrás

O AISI selecionou o GLM-5.2 e o DeepSeek V4-Pro porque eram os principais candidatos a modelos de código aberto no momento dos testes.

A comparação central do relatório baseia-se em modelos com desempenho semelhante e no intervalo de tempo entre seus lançamentos.

Modelo de código aberto Tarefa avaliada Modelo fechado comparável Diferença estimada na data de lançamento
GLM-5.2 Tarefas restritas de rede Claude Opus 4.6 e GPT-5.3-Codex Cerca de 4 meses
GLM-5.2 Cenário de segurança cibernética "O Último Sobrevivente" Claude Opus 4.5 Menos de 7 meses
DeepSeek V4-Pro Tarefas restritas de rede Claude Opus 4.5 Cerca de 5 meses
DeepSeek V4-Pro Tarefas de cenário de segurança cibernética Abaixo do Sonnet 4.5 em cenários específicos Não considerado correspondência direta de ponta

O GLM-5.2 teve desempenho comparável ao Opus 4.6 em todos os quatro níveis de dificuldade das tarefas restritas. No cenário "O Último Sobrevivente", ele atingiu o mesmo número médio final de etapas que o Opus 4.5.

O DeepSeek V4-Pro correspondeu ao Opus 4.5 em tarefas restritas, mas teve desempenho inferior em tarefas de longo prazo.

Os testes internos do AISI em 2025 mostraram que os principais modelos de código aberto estavam seis a dez meses atrás dos modelos fechados de ponta. A estimativa mais recente de quatro a sete meses sugere que a janela de preparação para os defensores pode estar diminuindo.

Por que essa diferença não é uma previsão fixa

O número de quatro a sete meses descreve apenas os modelos e as tarefas de avaliação testados pelo AISI. Não é uma previsão de que todo futuro modelo de código aberto manterá esse atraso fixo.

Vários fatores podem fazer a diferença se mover em qualquer direção:

  • Desenvolvedores de código fechado podem obter um salto repentino de capacidade.
  • Modelos de código aberto podem replicar melhorias recentes de ponta.
  • Melhores estruturas de agente podem liberar mais desempenho de modelos existentes.

Pesos.

  • Ajuste fino e prompts específicos do modelo podem alterar as capacidades medidas.
  • Novos benchmarks podem expor fraquezas que os testes atuais não descobrem.
  • Custos de implantação e hardware disponível podem limitar o risco real de uso indevido.
  • Medidas de segurança e controle de acesso podem alterar as capacidades disponíveis de modelos hospedados.

O AISI também afirma que suas configurações podem subestimar ligeiramente a capacidade máxima dos modelos de peso aberto, pois não realizaram extrações ou otimizações profundas específicas para os modelos.

Este relatório se aplica apenas ao domínio da segurança cibernética e não deve ser usado para inferir diferenças equivalentes em ciência, programação, raciocínio geral ou outras áreas.

Modelos de código aberto têm custo drasticamente reduzido com nível de capacidade semelhante

A diferença de capacidade é pequena, mas a diferença de preço é grande.

O AISI comparou os preços de token de primeira parte publicados para modelos com desempenho semelhante.

Execução

Custo de 1 bilhão de tokens em um campo de treinamento cibernético

Modelo Custo aproximado
Claude Opus 4.5 $85
Claude Opus 4.6 $85
GLM-5.2 $46
DeepSeek V4-Pro $1.19

Custo para resolver uma única tarefa específica com 100% de confiabilidade

Comparação Custo do modelo fechado Custo do modelo de pesos abertos
Opus 4.6 vs GLM-5.2 $15,17 $6,12
Opus 4.5 vs DeepSeek V4-Pro $12,50 $0,28

Nestes exemplos, o DeepSeek V4-Pro apresenta um preço uma a duas ordens de grandeza menor do que modelos fechados comparáveis.

A comparação tem limitações. O AISI não executou os modelos de pesos abertos testados através de seus provedores primários, portanto, os custos reais de infraestrutura podem variar. A auto-hospedagem também introduz custos de hardware, engenharia, eletricidade, rede e manutenção que não se refletem nos preços de API.

Ainda assim, custos de inferência mais baixos tornam a experimentação iterativa, o ajuste fino e a implantação privada mais viáveis.

Por que os pesos abertos mudam as questões de segurança

Modelos de pesos abertos oferecem vantagens práticas:

  • Implantação privada
  • Sem necessidade de enviar dados de volta ao provedor original
  • Customização para tarefas específicas
  • Imunidade à descontinuação do serviço pelo provedor
  • Pesquisa reproduzível
  • Inspeção e modificação dos pesos do modelo
  • Colaboração entre organizações

As mesmas características limitam as medidas de segurança que podem ser aplicadas após o lançamento.

Provedores de modelos fechados podem:

  • Monitorar padrões de uso anômalos
  • Aplicar classificadores
  • Suspender contas
  • Limitar taxas de acesso
  • Atualizar medidas de segurança
  • Restringir ferramentas específicas
  • Retirar ou substituir modelos

Uma vez que os pesos do modelo são públicos, cópias podem ser redistribuídas e executadas privadamente. Recusas podem ser modificadas, monitoramento de implantação pode ser removido, e o desenvolvedor original não pode recuperar de forma confiável cada cópia.

O AISI descobriu que as medidas de segurança não impediram substancialmente a maioria de seus testes em dois modelos de pesos abertos. O DeepSeek V4-Pro ocasionalmente recusava tarefas de engenharia reversa, mas algumas tentativas geralmente contornavam essas recusas.

Isso não significa que todos os modelos de pesos abertos serão usados maliciosamente, mas sim que, quando um modelo atinge níveis de capacidade relevantes para risco, a decisão de lançamento se torna difícil de reverter.

Modelos fechados também precisam de medidas de segurança mais fortes

Acesso fechado não é uma garantia de segurança.

A Anthropic lançou o Claude Fable 5 e o Claude Mythos 5 em 9 de junho de 2026. O Fable 5 usa classificadores mais fortes para acesso regular, enquanto o Mythos 5 expõe mais capacidades de segurança cibernética do modelo subjacente a um grupo limitado de defensores confiáveis.

Em 12 de junho, controles de exportação dos EUA exigiram que a Anthropic suspendesse o acesso. A Anthropic afirmou que a diretriz foi emitida após um relatório submetido por pesquisadores da Amazon descrevendo um método para contornar as proteções do Fable 5 em cenários limitados de segurança cibernética.

A Anthropic então treinou um classificador atualizado, desenvolveu uma estrutura de avaliação de gravidade de jailbreak com parceiros governamentais e da indústria, e restaurou globalmente o Fable 5 em 1º de julho, após o levantamento das restrições.

O evento revelou vários pontos:

  • Classificadores podem produzir falsos negativos e falsos positivos.
  • A gravidade dos métodos de jailbreak varia amplamente.
  • Métodos de contorno não revelam necessariamente as capacidades mais perigosas do modelo.
  • Provedores fechados podem atualizar proteções e suspender acesso.
  • Essas intervenções também podem dificultar o trabalho legítimo de segurança.
  • A indústria e o governo ainda carecem de padrões unificados para julgar jailbreaks cibernéticos.

A implantação fechada oferece mais opções de intervenção, mas essas opções ainda exigem monitoramento, teste, políticas e controles técnicos eficazes.

A janela de preparação defensiva está se estreitando

O AISI descreve a diferença entre aberto e fechado como tempo de preparação.

Se os sistemas mais fortes são controlados por meses antes do lançamento equivalente de pesos abertos, os defensores podem usar esse tempo para:

  • Descobrir e corrigir vulnerabilidades
  • Melhorar inventários de ativos
  • Remover software não suportado
  • Fortalecer controles de identidade
  • Implantar autenticação resistente a phishing
  • Melhorar a segmentação de rede
  • Expandir registro e detecção
  • Testar planos de resposta a incidentes
  • Aplicar revisão de código assistida por IA e análise de ameaças

A redução de seis a dez meses para quatro a sete meses significa que as organizações podem ter menos tempo para concluir esse trabalho antes que capacidades semelhantes se tornem mais baratas e difundidas.

O Centro Nacional de Segurança Cibernética do Reino Unido adverte que a IA ampliará a lacuna entre práticas de segurança fortes e fracas. Suas diretrizes enfatizam que as ferramentas de IA não podem compensar fundamentos fracos.

Organizações com gerenciamento de patches deficiente, serviços expostos, reutilização de credenciais, backups incompletos e monitoramento limitado permanecerão vulneráveis, independentemente do modelo de IA usado pelo invasor.

A IA também está acelerando o trabalho defensivo de segurança

As mesmas capacidades usadas para avaliação ofensiva podem ajudar defensores a auditar código, gerar testes, investigar falhas e expandir a pesquisa de vulnerabilidades.

Um exemplo recente vem do desenvolvedor de rede de jogos Glenn Fiedler, que usou Claude Code com Claude Fable 5 para auditar quatro bibliotecas de código aberto maduras:

  • netcode
  • reliable
  • serialize
  • yojimbo

A auditoria adicionou alvos libFuzzer, integração contínua baseada em sanitizadores, testes de estresse com milhões de iterações, testes de formato de linha dourada e revisão linha por linha.

O registro público de vulnerabilidades mostra 43 correções:

Biblioteca Correções totais Correções acessíveis pela rede
netcode 7 2
reliable 7 6
serialize 11 7
yojimbo 18 12
Total 43 27

O problema mais grave era uma vulnerabilidade de estouro de heap no yojimbo, acionável remotamente desde 2019. Fragmentos de bloco elaborados podiam ser copiados para um buffer de remontagem antes da validação de tamanho.

Cada problema listado tem links para commits de correção e versões, e cada correção inclui testes de regressão. O desenvolvedor relatou ter gasto mais de $2.500 no Claude Code durante a correção de duas semanas.

Os usuários das bibliotecas afetadas são aconselhados a atualizar para as versões mais recentes especificadas no registro público de vulnerabilidades.

Este caso não prova que agentes de IA podem proteger independentemente qualquer software. Ele mostra que mantenedores experientes podem usar IA para dimensionar fuzzing, cobertura de sanitizadores, revisão e geração de testes em bases de código existentes.

Assimetria na aceleração ofensivo-defensiva

A IA pode ajudar ambos os lados, mas os modos de implantação diferem.

Um invasor precisa apenas de uma vulnerabilidade explorável, um alvo acessível e um caminho para o sucesso. Modelos de pesos abertos podem ser copiados e reutilizados repetidamente após o lançamento.

Os defensores devem proteger numerosos sistemas, manter inventários de ativos, priorizar patches, testar alterações, gerenciar tempo de inatividade e coordenar entre equipes. As melhorias defensivas devem ser implementadas organização por organização.

Isso cria uma assimetria:

  • As capacidades ofensivas podem se espalhar rapidamente.
  • As capacidades defensivas devem ser implementadas localmente.
  • O lançamento de um modelo pode ser feito uma vez.
  • As atualizações de segurança devem ser implantadas várias vezes.
  • Os invasores podem escolher o alvo mais fraco.
  • Os defensores devem cobrir todos os caminhos críticos.

A resposta adequada não é evitar o uso de IA defensiva, mas combiná-la com práticas sólidas de engenharia, conhecimento humano e controles de segurança comprovados.

Como as organizações devem responder

As descobertas do AISI e do NCSC apoiam um conjunto de ações práticas.

1. Primeiro, fortaleça a linha de base

Priorize:

  • Inventário de ativos
  • Software suportado
  • Aplicação rápida de patches
  • Autenticação multifator
  • Acesso com privilégios mínimos
  • Segmentação de rede
  • Backups testados
  • Registro centralizado
  • Exercícios de resposta a incidentes

A defesa aprimorada por IA funciona melhor quando esses fundamentos já existem.

2. Expanda os testes contínuos de segurança

Para projetos de software, introduza:

  • Fuzzing
  • AddressSanitizer
  • UndefinedBehaviorSanitizer
  • MemorySanitizer onde suportado
  • Análise estática
  • Verificação de dependências
  • Testes de regressão para cada erro confirmado
  • Revisão de segurança para caminhos de entrada não confiáveis

A auditoria do Mas Bandwidth foi útil porque combinou revisão de IA com evidência mecânica, em vez de confiar em explicações geradas.

3. Trate as descobertas de IA como pistas, não como evidências

Relatórios de vulnerabilidade gerados por IA podem estar corretos, incompletos ou enganosos.

Exija:

  1. Reprodução

  2. Análise de causa raiz

  3. Revisão manual

  4. Correção mínima

  5. Teste de regressão

  6. Documentação de lançamento

  7. Divulgação coordenada, se aplicável

4. Limitar permissões de agentes

Agentes de codificação defensiva não devem, por padrão, ter acesso irrestrito.

Limitações:

  • Credenciais de produção
  • Acesso à rede
  • Comandos destrutivos no shell
  • Escopo de escrita no repositório
  • Acesso a chaves
  • Permissões de implantação
  • Comunicação externa

Utilize ambientes isolados e
coloque ações importantes sob aprovação humana.

5. Medir custo e eficácia

Acompanhe os seguintes indicadores:

  • Vulnerabilidades confirmadas
  • Falsos positivos
  • Tempo necessário para reprodução
  • Tempo necessário para correção
  • Nova cobertura de testes
  • Custos de tokens e infraestrutura
  • Tempo de revisão manual
  • Reversões de segurança pós-implantação

Se o modelo gerar resultados não confiáveis ou exigir muita revisão, o modelo mais barato pode não ser o mais custo-efetivo.

Como interpretar benchmarks de segurança cibernética de IA

Benchmarks de segurança cibernética são úteis, mas é necessário compreender seu escopo de aplicação.

Pontuações altas não significam comprometimento no mundo real

Os ambientes simulados de teste simplificam a realidade. Redes reais podem conter defensores ativos, proteção de endpoints, mecanismos de alerta, limitação de taxa, sistemas de decepção e informações incompletas.

Capacidades do modelo e capacidades do agente estão interligadas

Os resultados de tarefas de longo prazo não dependem apenas do conhecimento do modelo. Design de ferramentas, memória, gerenciamento de contexto, estratégias de repetição, estrutura de prompts e confiabilidade de execução também influenciam o desempenho.

Resultados médios e melhores tentativas respondem a perguntas diferentes

A melhor tentativa mostra o que o sistema pode fazer às vezes. O resultado médio mostra a confiabilidade do progresso do sistema em múltiplas execuções.

Ambos são importantes para o risco operacional.

Comparações baseadas em data de lançamento são apenas aproximações

Modelos com desempenho semelhante a modelos antigos não são idênticos a eles. Esses sistemas podem ter diferentes pontos fortes, fracos, salvaguardas, custos e limitações de implantação.

Capacidades de segurança cibernética têm uso duplo

As mesmas habilidades podem ser usadas para testes de penetração, revisão de código de segurança, resposta a incidentes, descoberta de vulnerabilidades ou invasões maliciosas.

Os resultados da avaliação devem subsidiar tanto a gestão de riscos quanto o investimento em segurança defensiva.

Perguntas frequentes

O GPT-5.6 Sol tem melhor desempenho que o Claude Mythos 5 nos testes da AISI?

O GPT-5.6 Sol obteve resultados médios ligeiramente superiores nas tarefas restritas de segurança cibernética e nos campos de treinamento de longo prazo especificamente mencionados pela AISI. O Mythos 5 teve pontuações próximas, com sobreposição nas faixas de incerteza do conjunto de tarefas restritas, e ambos os modelos concluíram todas as 32 etapas do campo de treinamento em suas melhores tentativas.

Isso significa que o GPT-5.6 Sol é o melhor modelo de segurança cibernética?

Não necessariamente. A AISI testa conjuntos específicos de tarefas e ambientes simulados, e não todos os cenários reais de defesa ou ataque. Os resultados suportam uma comparação restrita de benchmarks, não uma classificação geral.

Qual é a diferença entre modelos de peso aberto e modelos fechados de ponta?

A AISI estima que os principais modelos de peso aberto testados estejam de quatro a sete meses atrasados. Esse dado é baseado na correspondência do desempenho medido com as datas de lançamento de modelos fechados comparáveis.

Qual modelo de peso aberto teve o melhor desempenho?

No momento da publicação do relatório, o GLM-5.2 era o modelo de peso aberto mais forte testado pela AISI. Ele empatou com o Opus 4.6 em tarefas restritas e alcançou a mesma pontuação média que o Opus 4.5 no campo de treinamento de segurança cibernética especificamente mencionado.

Por que modelos de peso aberto geram preocupações de segurança cibernética?

Seus pesos podem ser baixados, modificados, implantados de forma privada e redistribuídos. Isso traz benefícios para pesquisa e privacidade, mas também limita a capacidade dos desenvolvedores originais de monitorar uso indevido, atualizar medidas de segurança de implantação, suspender usuários ou recuperar todas as cópias.

Aberto

Na avaliação da AISI?

Sim. Com base nos preços públicos divulgados, o GLM-5.2, especialmente o DeepSeek V4-Pro, é muito mais barato que modelos fechados similares. Os custos reais de auto-hospedagem e implantação de terceiros podem variar.

Modelos de IA podem ajudar tanto defensores quanto atacantes?

Sim. A IA pode auxiliar na revisão de código, geração de testes de fuzzing, análise de vulnerabilidades, investigação de logs e correções. Após o trabalho de segurança auxiliado pelo Claude Code, a auditoria da Mas Bandwidth registrou 43 correções em quatro bibliotecas de rede.

O que as organizações devem priorizar?

Antes de depender de ferramentas de IA, fortalecer os controles básicos de segurança. Visibilidade de ativos, gerenciamento de patches, proteção de identidade, backups, segmentação de rede, monitoramento e resposta a incidentes testada continuam sendo essenciais.

Ferramentas relacionadas

  • AISI Inspect Cyber: Estrutura de avaliação para criar e executar tarefas de segurança cibernética para agentes.
  • Inspect AI: Estrutura de código aberto da AISI para avaliar grandes modelos de linguagem.
  • GLM-5.2: Repositório oficial do modelo de peso aberto da Z.ai.
  • DeepSeek API: Documentação oficial e informações de acesso atuais para modelos DeepSeek.
  • Claude Code: Ambiente de codificação agente da Anthropic para trabalho em repositórios, testes e revisões de segurança.
  • NCSC Cyber Essentials: Padrão básico apoiado pelo Reino Unido para proteger organizações contra ameaças cibernéticas comuns.

Links relacionados

Resumo

Os resultados mais recentes da AISI mostram que, na pontuação média de duas avaliações específicas de segurança cibernética, o GPT-5.6 Sol lidera ligeiramente o Claude Mythos 5. Essa liderança é pequena e não deve ser considerada evidência de superioridade geral.

A principal
conclusão do relatório é mais ampla: o atraso do GLM-5.2 e do DeepSeek V4-Pro em relação a modelos fechados de ponta similares agora se reduziu para 4 a 7 meses, enquanto nos testes internos da AISI em 2025, essa diferença era de 6 a 10 meses.

Seu preço também é muito inferior ao dos concorrentes.

Esse tempo de latência reduzido significa que a janela de tempo que os defensores podem ter para reagir antes que capacidades avançadas se tornem mais fáceis de baixar, modificar e executar localmente diminui ainda mais. Ao mesmo tempo, o fato de o Claude Code ter descoberto 43 vulnerabilidades em quatro bibliotecas de rede mostra que modelos poderosos também podem acelerar o trabalho defensivo.

A estratégia prática não é depender exclusivamente de proteções de modelo ou ferramentas de segurança de IA, mas sim fortalecer a linha de base de segurança e aplicar a IA em processos defensivos controlados, orientados por testes e revisados por humanos.