A empresa Anthropic divulgou, em artigo publicado na terça-feira (28), que seu novo modelo de inteligência artificial, o Claude Mythos Preview, detectou falhas matemáticas em uma estrutura de algoritmos criptográficos. Diferentemente de análises anteriores que apontavam apenas erros humanos em código, a ferramenta conseguiu expor defeitos na própria lógica das fórmulas usadas no projeto.

O principal alvo da descoberta foi o sistema de assinatura digital HAWK, que estava em avaliação pelo governo dos Estados Unidos como candidato a proteger dados contra futuros ataques quânticos. Segundo a Anthropic, o Claude identificou um padrão na matemática do HAWK que reduz em cerca de metade o tamanho do bloco necessário para recuperar uma chave secreta. A identificação do problema levou aproximadamente 60 horas de processamento autônomo e gerou custos na ordem de US$ 100 mil em uso de servidores.

Posicionamento do HAWK

A equipe responsável pelo HAWK confirmou a existência da falha após receber os resultados da Anthropic e informou a retirada do projeto do processo de padronização do Instituto Nacional de Padrões e Tecnologia dos EUA (NIST). Em mensagem postada no fórum oficial do NIST, o pesquisador Leo Ducas agradeceu a contribuição da Anthropic e declarou que o ataque reportado diminui significativamente o tamanho do bloco necessário para recuperar chaves secretas. Segundo Ducas, medidas simples para mitigar essa exposição tornariam o HAWK pouco competitivo, o que motivou a desistência do candidato.

Além do HAWK, o Claude apresentou um método que acelera teoricamente um ataque contra o AES — o padrão de criptografia mais utilizado atualmente — em até 800 vezes. No entanto, essa descoberta tem caráter acadêmico: o modelo quebrou apenas uma versão bastante simplificada do AES (com sete das dez camadas de proteção) e o ataque demandaria acesso prévio a um volume impossível de dados, estimado em mais de 40 septilhões de mensagens de teste, tornando-o impraticável no mundo real.

A Anthropic afirmou que nenhuma das descobertas representa um risco imediato para usuários ou sistemas em produção na internet. A empresa ressaltou a velocidade do modelo em relação à análise humana, observando que, embora o HAWK tenha passado por duas rodadas de revisão por especialistas ao longo de dois anos, o Mythos conseguiu aprimorar o melhor ataque conhecido em cerca de 60 horas. A verificação final dos achados, contudo, dependeu da revisão humana: dois pesquisadores da Anthropic gastaram quase um mês para revisar as equações e confirmar os resultados.

IA da Anthropic identifica falha em algoritmo de assinatura digital testado pelo governo dos EUA

Imagem: Divulgação

O episódio destaca o papel crescente dos modelos de linguagem na avaliação criptográfica, sem, entretanto, apontar risco imediato a sistemas em uso.





Com informações de Tecmundo