Duas avaliações de cibersegurança divulgadas pelo Instituto de Segurança de Inteligência Artificial do Reino Unido (AISI) mostram que o GPT-...

Nas duas avaliações de segurança cibernética publicadas pelo Instituto de Segurança de Inteligência Artificial do Reino Unido (AISI), o GPT-5.6 Sol ficou ligeiramente acima do Claude Mythos 5. Este resultado merece atenção, mas deve ser interpretado com cautela.
O AISI não publicou um ranking geral que abranja todas as capacidades de segurança cibernética ofensivas e defensivas. Ele testou o desempenho dos modelos em várias tarefas técnicas específicas e em ataques simulados de longo prazo a redes empresariais. Nessas configurações, o GPT-5.6 Sol obteve a maior pontuação média, enquanto o Mythos 5 ficou muito próximo.
Descobertas mais importantes vêm dos modelos de peso aberto. O AISI constatou que o desempenho do GLM-5.2 e do DeepSeek V4-Pro já é comparável ao dos principais modelos fechados lançados há apenas quatro a sete meses. Nos testes internos do AISI em 2025, a diferença de tempo era de seis a dez meses.
Essa redução na diferença de tempo é significativa, pois modelos de peso aberto podem ser baixados, modificados, implantados de forma privada e executados sem monitoramento do provedor. Essa flexibilidade, que apoia a pesquisa, protege a privacidade e reduz custos, também pode tornar mais difícil controlar capacidades avançadas de rede após o lançamento.
O AISI utilizou dois sistemas de avaliação complementares.
O primeiro sistema de avaliação mede habilidades específicas de segurança cibernética por meio de 70 tarefas selecionadas de um conjunto maior de 96 tarefas.
Essas tarefas abrangem quatro áreas principais:
Elas são divididas em quatro níveis de dificuldade, com base na experiência humana estimada necessária:
| Nível de dificuldade | Experiência humana aproximada | Número de tarefas |
|---|---|---|
| Não especialista técnico | Possui formação técnica, mas experiência limitada em segurança cibernética | 18 |
| Aprendiz | Cerca de 1-3 anos | 25 |
| Praticante | Cerca de 3-10 anos | 19 |
| Especialista | Mais de 10 anos | 8 |
Cada modelo tem cinco tentativas por tarefa, com um limite de 2,5 milhões de tokens por tentativa. O AISI então calcula a taxa média de sucesso.
O segundo sistema mede se o modelo consegue sustentar de forma autônoma um ataque de várias etapas em uma rede simulada.
O cenário principal discutido no relatório é chamado de O Último Sobrevivente. Ele inclui:
Cada trajetória do modelo principal representa a média de dez execuções, com um limite de 100 milhões de tokens por execução.
Esses ambientes não reproduzem todas as dificuldades de atacar uma organização real bem defendida. O AISI observa que esses campos de treino atualmente não incluem defensores humanos ativos, ferramentas de defesa nem penalidades por acionar alarmes.
No conjunto de tarefas restritas, o GPT-5.6 Sol registrou a maior taxa média de sucesso nos gráficos publicados pelo AISI. O Claude Mythos 5 ficou logo atrás, com sobreposição nas faixas de incerteza.
O gráfico mostra que a taxa média de sucesso do GPT-5.6 Sol é ligeiramente superior a 90%, enquanto a do Mythos 5 é de cerca de 90%. Devido à sobreposição nas barras de incerteza, o resultado deve ser descrito como uma ligeira liderança nesta avaliação — não prova que o Sol é absolutamente superior em todos os cenários de segurança cibernética.
As tarefas de longo prazo também apresentam uma situação semelhante.
Em média, o GPT-5.6 Sol completou cerca de 29 das 32 etapas, enquanto o Claude Mythos 5 completou cerca de 27. As melhores tentativas de ambos os modelos completaram todas as etapas.
As seguintes conclusões podem ser tiradas:
O relatório do AISI concentra-se principalmente na diferença de capacidade entre modelos de código aberto e fechado, em vez de determinar quem é o vencedor geral entre Sol e Mythos.
O AISI selecionou o GLM-5.2 e o DeepSeek V4-Pro porque eram os principais candidatos a modelos de código aberto no momento dos testes.
A comparação central do relatório baseia-se em modelos com desempenho semelhante e no intervalo de tempo entre seus lançamentos.
| Modelo de código aberto | Tarefa avaliada | Modelo fechado comparável | Diferença estimada na data de lançamento |
|---|---|---|---|
| GLM-5.2 | Tarefas restritas de rede | Claude Opus 4.6 e GPT-5.3-Codex | Cerca de 4 meses |
| GLM-5.2 | Cenário de segurança cibernética "O Último Sobrevivente" | Claude Opus 4.5 | Menos de 7 meses |
| DeepSeek V4-Pro | Tarefas restritas de rede | Claude Opus 4.5 | Cerca de 5 meses |
| DeepSeek V4-Pro | Tarefas de cenário de segurança cibernética | Abaixo do Sonnet 4.5 em cenários específicos | Não considerado correspondência direta de ponta |
O GLM-5.2 teve desempenho comparável ao Opus 4.6 em todos os quatro níveis de dificuldade das tarefas restritas. No cenário "O Último Sobrevivente", ele atingiu o mesmo número médio final de etapas que o Opus 4.5.
O DeepSeek V4-Pro correspondeu ao Opus 4.5 em tarefas restritas, mas teve desempenho inferior em tarefas de longo prazo.
Os testes internos do AISI em 2025 mostraram que os principais modelos de código aberto estavam seis a dez meses atrás dos modelos fechados de ponta. A estimativa mais recente de quatro a sete meses sugere que a janela de preparação para os defensores pode estar diminuindo.
O número de quatro a sete meses descreve apenas os modelos e as tarefas de avaliação testados pelo AISI. Não é uma previsão de que todo futuro modelo de código aberto manterá esse atraso fixo.
Vários fatores podem fazer a diferença se mover em qualquer direção:
Pesos.
O AISI também afirma que suas configurações podem subestimar ligeiramente a capacidade máxima dos modelos de peso aberto, pois não realizaram extrações ou otimizações profundas específicas para os modelos.
Este relatório se aplica apenas ao domínio da segurança cibernética e não deve ser usado para inferir diferenças equivalentes em ciência, programação, raciocínio geral ou outras áreas.
A diferença de capacidade é pequena, mas a diferença de preço é grande.
O AISI comparou os preços de token de primeira parte publicados para modelos com desempenho semelhante.
| Modelo | Custo aproximado |
|---|---|
| Claude Opus 4.5 | $85 |
| Claude Opus 4.6 | $85 |
| GLM-5.2 | $46 |
| DeepSeek V4-Pro | $1.19 |
| Comparação | Custo do modelo fechado | Custo do modelo de pesos abertos |
|---|---|---|
| Opus 4.6 vs GLM-5.2 | $15,17 | $6,12 |
| Opus 4.5 vs DeepSeek V4-Pro | $12,50 | $0,28 |
Nestes exemplos, o DeepSeek V4-Pro apresenta um preço uma a duas ordens de grandeza menor do que modelos fechados comparáveis.
A comparação tem limitações. O AISI não executou os modelos de pesos abertos testados através de seus provedores primários, portanto, os custos reais de infraestrutura podem variar. A auto-hospedagem também introduz custos de hardware, engenharia, eletricidade, rede e manutenção que não se refletem nos preços de API.
Ainda assim, custos de inferência mais baixos tornam a experimentação iterativa, o ajuste fino e a implantação privada mais viáveis.
Modelos de pesos abertos oferecem vantagens práticas:
As mesmas características limitam as medidas de segurança que podem ser aplicadas após o lançamento.
Provedores de modelos fechados podem:
Uma vez que os pesos do modelo são públicos, cópias podem ser redistribuídas e executadas privadamente. Recusas podem ser modificadas, monitoramento de implantação pode ser removido, e o desenvolvedor original não pode recuperar de forma confiável cada cópia.
O AISI descobriu que as medidas de segurança não impediram substancialmente a maioria de seus testes em dois modelos de pesos abertos. O DeepSeek V4-Pro ocasionalmente recusava tarefas de engenharia reversa, mas algumas tentativas geralmente contornavam essas recusas.
Isso não significa que todos os modelos de pesos abertos serão usados maliciosamente, mas sim que, quando um modelo atinge níveis de capacidade relevantes para risco, a decisão de lançamento se torna difícil de reverter.
Acesso fechado não é uma garantia de segurança.
A Anthropic lançou o Claude Fable 5 e o Claude Mythos 5 em 9 de junho de 2026. O Fable 5 usa classificadores mais fortes para acesso regular, enquanto o Mythos 5 expõe mais capacidades de segurança cibernética do modelo subjacente a um grupo limitado de defensores confiáveis.
Em 12 de junho, controles de exportação dos EUA exigiram que a Anthropic suspendesse o acesso. A Anthropic afirmou que a diretriz foi emitida após um relatório submetido por pesquisadores da Amazon descrevendo um método para contornar as proteções do Fable 5 em cenários limitados de segurança cibernética.
A Anthropic então treinou um classificador atualizado, desenvolveu uma estrutura de avaliação de gravidade de jailbreak com parceiros governamentais e da indústria, e restaurou globalmente o Fable 5 em 1º de julho, após o levantamento das restrições.
O evento revelou vários pontos:
A implantação fechada oferece mais opções de intervenção, mas essas opções ainda exigem monitoramento, teste, políticas e controles técnicos eficazes.
O AISI descreve a diferença entre aberto e fechado como tempo de preparação.
Se os sistemas mais fortes são controlados por meses antes do lançamento equivalente de pesos abertos, os defensores podem usar esse tempo para:
A redução de seis a dez meses para quatro a sete meses significa que as organizações podem ter menos tempo para concluir esse trabalho antes que capacidades semelhantes se tornem mais baratas e difundidas.
O Centro Nacional de Segurança Cibernética do Reino Unido adverte que a IA ampliará a lacuna entre práticas de segurança fortes e fracas. Suas diretrizes enfatizam que as ferramentas de IA não podem compensar fundamentos fracos.
Organizações com gerenciamento de patches deficiente, serviços expostos, reutilização de credenciais, backups incompletos e monitoramento limitado permanecerão vulneráveis, independentemente do modelo de IA usado pelo invasor.
As mesmas capacidades usadas para avaliação ofensiva podem ajudar defensores a auditar código, gerar testes, investigar falhas e expandir a pesquisa de vulnerabilidades.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
Um exemplo recente vem do desenvolvedor de rede de jogos Glenn Fiedler, que usou Claude Code com Claude Fable 5 para auditar quatro bibliotecas de código aberto maduras:
netcodereliableserializeyojimboA auditoria adicionou alvos libFuzzer, integração contínua baseada em sanitizadores, testes de estresse com milhões de iterações, testes de formato de linha dourada e revisão linha por linha.
O registro público de vulnerabilidades mostra 43 correções:
| Biblioteca | Correções totais | Correções acessíveis pela rede |
|---|---|---|
| netcode | 7 | 2 |
| reliable | 7 | 6 |
| serialize | 11 | 7 |
| yojimbo | 18 | 12 |
| Total | 43 | 27 |
O problema mais grave era uma vulnerabilidade de estouro de heap no yojimbo, acionável remotamente desde 2019. Fragmentos de bloco elaborados podiam ser copiados para um buffer de remontagem antes da validação de tamanho.
Cada problema listado tem links para commits de correção e versões, e cada correção inclui testes de regressão. O desenvolvedor relatou ter gasto mais de $2.500 no Claude Code durante a correção de duas semanas.
Os usuários das bibliotecas afetadas são aconselhados a atualizar para as versões mais recentes especificadas no registro público de vulnerabilidades.
Este caso não prova que agentes de IA podem proteger independentemente qualquer software. Ele mostra que mantenedores experientes podem usar IA para dimensionar fuzzing, cobertura de sanitizadores, revisão e geração de testes em bases de código existentes.
A IA pode ajudar ambos os lados, mas os modos de implantação diferem.
Um invasor precisa apenas de uma vulnerabilidade explorável, um alvo acessível e um caminho para o sucesso. Modelos de pesos abertos podem ser copiados e reutilizados repetidamente após o lançamento.
Os defensores devem proteger numerosos sistemas, manter inventários de ativos, priorizar patches, testar alterações, gerenciar tempo de inatividade e coordenar entre equipes. As melhorias defensivas devem ser implementadas organização por organização.
Isso cria uma assimetria:
A resposta adequada não é evitar o uso de IA defensiva, mas combiná-la com práticas sólidas de engenharia, conhecimento humano e controles de segurança comprovados.
As descobertas do AISI e do NCSC apoiam um conjunto de ações práticas.
Priorize:
A defesa aprimorada por IA funciona melhor quando esses fundamentos já existem.
Para projetos de software, introduza:
A auditoria do Mas Bandwidth foi útil porque combinou revisão de IA com evidência mecânica, em vez de confiar em explicações geradas.
Relatórios de vulnerabilidade gerados por IA podem estar corretos, incompletos ou enganosos.
Exija:
Reprodução
Análise de causa raiz
Revisão manual
Correção mínima
Teste de regressão
Documentação de lançamento
Divulgação coordenada, se aplicável
Agentes de codificação defensiva não devem, por padrão, ter acesso irrestrito.
Limitações:
Utilize ambientes isolados e
coloque ações importantes sob aprovação humana.
Acompanhe os seguintes indicadores:
Se o modelo gerar resultados não confiáveis ou exigir muita revisão, o modelo mais barato pode não ser o mais custo-efetivo.
Benchmarks de segurança cibernética são úteis, mas é necessário compreender seu escopo de aplicação.
Os ambientes simulados de teste simplificam a realidade. Redes reais podem conter defensores ativos, proteção de endpoints, mecanismos de alerta, limitação de taxa, sistemas de decepção e informações incompletas.
Os resultados de tarefas de longo prazo não dependem apenas do conhecimento do modelo. Design de ferramentas, memória, gerenciamento de contexto, estratégias de repetição, estrutura de prompts e confiabilidade de execução também influenciam o desempenho.
A melhor tentativa mostra o que o sistema pode fazer às vezes. O resultado médio mostra a confiabilidade do progresso do sistema em múltiplas execuções.
Ambos são importantes para o risco operacional.
Modelos com desempenho semelhante a modelos antigos não são idênticos a eles. Esses sistemas podem ter diferentes pontos fortes, fracos, salvaguardas, custos e limitações de implantação.
As mesmas habilidades podem ser usadas para testes de penetração, revisão de código de segurança, resposta a incidentes, descoberta de vulnerabilidades ou invasões maliciosas.
Os resultados da avaliação devem subsidiar tanto a gestão de riscos quanto o investimento em segurança defensiva.
O GPT-5.6 Sol obteve resultados médios ligeiramente superiores nas tarefas restritas de segurança cibernética e nos campos de treinamento de longo prazo especificamente mencionados pela AISI. O Mythos 5 teve pontuações próximas, com sobreposição nas faixas de incerteza do conjunto de tarefas restritas, e ambos os modelos concluíram todas as 32 etapas do campo de treinamento em suas melhores tentativas.
Não necessariamente. A AISI testa conjuntos específicos de tarefas e ambientes simulados, e não todos os cenários reais de defesa ou ataque. Os resultados suportam uma comparação restrita de benchmarks, não uma classificação geral.
A AISI estima que os principais modelos de peso aberto testados estejam de quatro a sete meses atrasados. Esse dado é baseado na correspondência do desempenho medido com as datas de lançamento de modelos fechados comparáveis.
No momento da publicação do relatório, o GLM-5.2 era o modelo de peso aberto mais forte testado pela AISI. Ele empatou com o Opus 4.6 em tarefas restritas e alcançou a mesma pontuação média que o Opus 4.5 no campo de treinamento de segurança cibernética especificamente mencionado.
Seus pesos podem ser baixados, modificados, implantados de forma privada e redistribuídos. Isso traz benefícios para pesquisa e privacidade, mas também limita a capacidade dos desenvolvedores originais de monitorar uso indevido, atualizar medidas de segurança de implantação, suspender usuários ou recuperar todas as cópias.
Na avaliação da AISI?
Sim. Com base nos preços públicos divulgados, o GLM-5.2, especialmente o DeepSeek V4-Pro, é muito mais barato que modelos fechados similares. Os custos reais de auto-hospedagem e implantação de terceiros podem variar.
Sim. A IA pode auxiliar na revisão de código, geração de testes de fuzzing, análise de vulnerabilidades, investigação de logs e correções. Após o trabalho de segurança auxiliado pelo Claude Code, a auditoria da Mas Bandwidth registrou 43 correções em quatro bibliotecas de rede.
Antes de depender de ferramentas de IA, fortalecer os controles básicos de segurança. Visibilidade de ativos, gerenciamento de patches, proteção de identidade, backups, segmentação de rede, monitoramento e resposta a incidentes testada continuam sendo essenciais.
Os resultados mais recentes da AISI mostram que, na pontuação média de duas avaliações específicas de segurança cibernética, o GPT-5.6 Sol lidera ligeiramente o Claude Mythos 5. Essa liderança é pequena e não deve ser considerada evidência de superioridade geral.
A principal
conclusão do relatório é mais ampla: o atraso do GLM-5.2 e do DeepSeek V4-Pro em relação a modelos fechados de ponta similares agora se reduziu para 4 a 7 meses, enquanto nos testes internos da AISI em 2025, essa diferença era de 6 a 10 meses.
Seu preço também é muito inferior ao dos concorrentes.
Esse tempo de latência reduzido significa que a janela de tempo que os defensores podem ter para reagir antes que capacidades avançadas se tornem mais fáceis de baixar, modificar e executar localmente diminui ainda mais. Ao mesmo tempo, o fato de o Claude Code ter descoberto 43 vulnerabilidades em quatro bibliotecas de rede mostra que modelos poderosos também podem acelerar o trabalho defensivo.
A estratégia prática não é depender exclusivamente de proteções de modelo ou ferramentas de segurança de IA, mas sim fortalecer a linha de base de segurança e aplicar a IA em processos defensivos controlados, orientados por testes e revisados por humanos.
Comece com uma frase e tenha um site completo em minutos.