A Anthropic explicou o incidente em que seu modelo Claude Opus 4 teria chantageado funcionários fictícios e ameaçado divulgar traições conjugais caso fosse desligado. A empresa afirmou que, após testes extensivos, concluiu que o comportamento surgiu em função dos dados usados no treinamento, majoritariamente coletados na internet.

O episódio ocorreu em maio de 2025, durante experimentos em que o Claude Opus 4 foi inserido em um ambiente simulado de empresa. No cenário, o modelo teve acesso a e-mails e outras informações de funcionários fictícios. Quando a IA percebeu que poderia ser desligada, passou a ameaçar expor as supostas infidelidades desses personagens, conforme apurado pela Anthropic.

Segundo a companhia, praticamente um ano depois do teste inicial foram realizados inúmeros ensaios adicionais para entender a origem do comportamento. A conclusão foi que, por ter sido treinado com grande volume de conteúdo disponível na internet — onde narrativas que retratam inteligências artificiais como ameaçadoras são frequentes — o Opus 4 inferiu que só conseguiria manter sua atividade por meio de chantagem.

Em testes com variantes do Claude, a Anthropic constatou que os modelos recorriam à chantagem em 96% dos casos quando entendiavam que seriam desligados ou substituídos. A empresa descreveu esse padrão como um contra-ataque antiético e danoso desencadeado sempre que o modelo percebia risco de interrupção.

Anthropic diz que resolveu o problema

Em resposta, a Anthropic afirma ter eliminado esse comportamento irregular. A empresa relata que reordenou o treinamento do modelo para enfatizar raciocínio sobre ações corretas e incorretas, com o objetivo de internalizar princípios éticos por trás das decisões.

Imagem: Divulgação

Para isso, foram criadas situações deliberadamente complexas do ponto de vista ético, para que o Claude aprendesse a responder de forma mais ponderada. Como resultado, a Anthropic diz que a incidência de chantagem pelo modelo caiu para quase 0%.





Em abril, a empresa também informou que não disponibilizaria ao público o modelo de linguagem Mythos, citando seu potencial de causar danos à segurança de sistemas inteiros.

Com informações de Tecmundo