Os ataques de deepfake e impersonação já respondem pela maior fatia das violações conduzidas com inteligência artificial, 45% delas, segundo a edição mais recente do Cost of a Data Breach, estudo do Ponemon Institute publicado pela IBM com base em cerca de 600 organizações violadas em 17 setores. A engenharia social, técnica mais antiga do repertório criminoso, ganhou uma camada de fabricação sintética que muda a natureza do problema, porque a voz ao telefone, o rosto na chamada de vídeo e o texto no e-mail podem ser genuínos na forma e falsos na origem. Já não se trata de exceção estatística de laboratório, e sim da categoria dominante entre os ataques que utilizam a tecnologia.
O terreno para esse tipo de golpe segue fértil porque o alvo continua sendo gente. O Data Breach Investigations Report, estudo da Verizon com mais de 22 mil violações confirmadas analisadas, encontrou o fator humano presente em 62% dos casos e registrou que o sucesso da engenharia social em dispositivos móveis cresceu 40% no período, sinal de que o golpe migrou também para os canais nos quais a atenção do usuário costuma estar mais baixa e as ferramentas de proteção corporativa enxergam menos.
A nova engenharia social: voz, vídeo e identidade fabricados sob medida
A mecânica do golpe permanece reconhecível, um pedido urgente, uma figura de autoridade, uma janela curta para agir, mas a matéria-prima mudou de qualidade. Minutos de áudio público bastam para clonar a voz de um executivo, e ferramentas acessíveis produzem vídeo convincente o suficiente para sustentar uma chamada curta, na qual a urgência fabricada desencoraja qualquer verificação. O que era um e-mail malfeito, endereçado em massa, virou uma abordagem personalizada, construída sobre informações públicas da empresa e do alvo, com forma impecável e contexto plausível.
A matéria-prima desses golpes está disponível em abundância e de graça. Entrevistas, participações em eventos, vídeos institucionais e teleconferências de resultados oferecem horas de voz e imagem dos executivos mais visados, enquanto perfis profissionais públicos entregam o organograma, os projetos em andamento e o vocabulário interno que tornam a abordagem verossímil. O atacante que combina esses elementos não precisa invadir nada para começar, monta o cenário inteiro a partir do que a própria empresa publica, e chega à primeira interação sabendo com quem fala, o que pedir e em nome de quem pedir.
O estudo da IBM detalha a composição dos ataques que usam inteligência artificial: além dos 45% de deepfake e impersonação, o malware desenvolvido com apoio de IA responde por 19% e o phishing gerado por IA, por 17%. O phishing, aliás, permaneceu como o vetor inicial mais comum das violações pelo quarto ano consecutivo no levantamento, com uma diferença qualitativa importante, já que as mensagens deixaram de carregar os erros de escrita e de formatação que décadas de treinamento ensinaram os funcionários a procurar como sinal de fraude.
Técnicas de pressão sobre processos completam o quadro. A impersonação de help desk, na qual o atacante liga para o suporte se passando por funcionário, ou para o funcionário se passando pelo suporte, e a chamada fadiga de autenticação multifator, o envio insistente de notificações de aprovação até que a vítima aceite uma delas, figuram entre as causas mais frequentes de violação apontadas pelo estudo da IBM. São golpes que não exploram falha técnica alguma, exploram a rotina, o cansaço e a disposição das pessoas em ajudar quem parece precisar.
Por que os controles tradicionais não alcançam o ataque sintético
As defesas construídas na última década olham majoritariamente para artefatos, o anexo malicioso, o domínio recém-registrado, o padrão de escrita suspeito. O ataque sintético contorna essa camada porque, em muitos casos, não carrega artefato algum: a chamada telefônica não passa pelo filtro de correio, o vídeo acontece em plataforma legítima de reunião e a mensagem parte de uma conta real previamente comprometida. O que existe para detectar não é um objeto, e sim uma ação fora de lugar, e ferramentas desenhadas para inspecionar conteúdo não foram feitas para enxergar isso, ainda que continuem encontrando com eficiência aquilo para o que foram construídas.
A própria autenticação multifator, apresentada por anos como resposta definitiva ao roubo de senhas, virou alvo de engenharia. A fadiga de aprovações explora o desgaste do usuário até obter o consentimento, e o atacante que entra com credencial válida e aprovação concedida atravessa a porta da frente sem que nenhum controle de perímetro registre nada além de um login bem-sucedido. A Verizon acrescenta um indicador de escala a esse cenário ao apontar que o volume de texto assistido por inteligência artificial em e-mails maliciosos dobrou em relação aos anos anteriores, segundo dados da Anthropic compartilhados para o relatório.
Existe ainda uma fragmentação organizacional que joga a favor do golpe. O sinal de fraude financeira costuma nascer em uma área, o de comprometimento de conta em outra e o de phishing em uma ferramenta separada, cada qual com a própria equipe e o próprio painel, e o ataque sintético atravessa essas fronteiras sem pedir licença. Enquanto cada silo enxerga apenas um fragmento aceitável do comportamento, a sequência completa, que denunciaria a fraude, não se forma em lugar algum, e a janela para agir se fecha antes que alguém tenha juntado as peças.
O resultado é uma lacuna estrutural, na qual o golpe acontece na camada humana e de processo enquanto a detecção segue concentrada na camada técnica de conteúdo. Fechar essa distância não significa abandonar os filtros, que continuam barrando o volume massivo de tentativas comuns e mantêm o ruído sob algum controle, e sim aceitar que a fração mais perigosa dos ataques só se revela pelo comportamento que produz depois de passar, o acesso incomum, a movimentação lateral, a transação que destoa do histórico.
Engenharia social e análise comportamental: detectar a ação, não a mensagem
A análise de comportamento de usuários e entidades parte de uma premissa simples, a de que, mesmo com credencial válida e aparência legítima, o impostor age diferente do titular. Horário, origem, dispositivo, sequência de sistemas acessados, volume e destino dos dados movimentados compõem uma assinatura de uso que os modelos aprendem para cada conta ao longo do tempo, e o desvio combinado dessas dimensões denuncia o que cada evento, isolado, jamais denunciaria a um analista ou a uma regra estática. É uma camada que independe do canal de entrada, e por isso alcança o telefonema e a videochamada que os filtros de conteúdo nunca verão.
A correlação entre canais amplia esse alcance. Uma tentativa de phishing barrada no correio, o cadastro de um novo dispositivo de autenticação e uma transferência atípica solicitada em seguida são, para ferramentas isoladas, três eventos menores e desconexos, enquanto para uma operação de monitoramento que cruza identidade, endpoint e aplicação eles formam a narrativa de um ataque em andamento. Mecanismos de inteligência dedicados a phishing agregam a camada preventiva ao identificar campanhas e domínios de impersonação ainda em preparação, antes que a primeira mensagem alcance uma caixa de entrada.
Quando o golpe avança apesar de tudo, a resposta precisa estar ensaiada. Playbooks específicos para engenharia social definem quem congela uma transação sob suspeita, como se valida a identidade de um solicitante depois do fato e em que momento os times de fraude, segurança e comunicação passam a trabalhar juntos, decisões que, improvisadas durante o incidente, consomem exatamente o tempo que o atacante conta em ganhar. Simulações que incluem áudio e vídeo sintéticos, e não apenas o e-mail de teste tradicional, mostram à organização, em ambiente controlado, o quanto os controles atuais resistem à versão contemporânea do golpe.
O processo continua sendo parte da defesa, e talvez a mais barata delas. Verificação por canal independente para pedidos financeiros ou de credenciais, com retorno por número previamente conhecido em vez de resposta ao contato recebido, dupla aprovação para mudanças de dados bancários de fornecedores e janelas de contestação para transferências acima de determinado valor criam atritos pequenos que desmontam a urgência da qual o golpe depende. Os treinamentos, por fim, precisam incorporar o cenário sintético, preparando as equipes para desconfiar de pedidos plausíveis e bem produzidos, porque a qualidade da mensagem deixou de separar o legítimo do fraudulento.
O teste ao qual processos e detecção serão submetidos
A engenharia social sempre evoluiu junto com os canais de comunicação, do telefone ao correio eletrônico e deste aos aplicativos de mensagem, e a síntese por inteligência artificial é o passo mais recente dessa trajetória, com a diferença de que agora o canal reproduz com fidelidade a identidade de quem se confia. Defesas centradas em conteúdo continuarão necessárias e continuarão insuficientes, e a distância entre uma condição e outra será coberta por comportamento, correlação e processo, ou simplesmente não será coberta.
Resta a pergunta que cada decisor deveria levar para a próxima conversa sobre segurança: se amanhã uma voz indistinguível da do diretor financeiro pedir, com urgência plausível e detalhes corretos, uma transferência fora do fluxo habitual, quantas camadas da operação precisariam falhar para o dinheiro sair, e quantas de fato existem hoje entre o pedido e a execução?