O Google Threat Intelligence Group (GTIG) publicou, em 8 de setembro de 2026, o retrato mais nítido até aqui da migração dos adversários do chat para o agente: grupos criminosos e de espionagem já delegam a agentes de IA tarefas completas do ciclo de ataque, do reconhecimento à exploração e à colheita de credenciais. No caso mais grave documentado do segundo trimestre, invasores comprometeram um recurso de nuvem e montaram, com um framework multiagente autônomo, uma campanha que comprometeu milhares de credenciais de terceiros em menos de seis horas — intervalo menor que um turno típico de SOC. Estão no alvo equipes que administram nuvem, desenvolvedores que usam assistentes de codificação e organizações que possuem ativos proprietários de IA. A ação prioritária é direta: tratar todo agente de IA como identidade privilegiada, com credencial própria, escopo mínimo e telemetria de comportamento em tempo real.
Da conversa à autonomia
Os relatórios anteriores mostravam adversários usando modelos de linguagem para pesquisar vítimas e escrever iscas de phishing. O novo rastreamento do GTIG registra a virada operacional: frameworks multiagentes que gerenciam pipelines de varredura de vulnerabilidades, resolvem erros em tempo real e executam colheita de credenciais em escala, sem um humano aprovando cada passo. O balanço é explícito em chamar esses grupos de multiplicadores de força ao longo do ciclo de ataque, do reconhecimento de alvos e da criação de iscas de engenharia social à ofuscação de malware e ao diagnóstico de problemas pós-exploração.
O relatório AI Risk and Resilience do Mandiant, que acompanha o rastreamento, descreve o novo papel do modelo: participante do ataque, e não conselheiro. O LLM decide e faz pivô em velocidade de máquina, e a latência do humano no ciclo cai a ponto de comprimir a janela tradicional de resposta da defesa. O segundo vetor é o roubo dos próprios recursos de IA: credenciais de desenvolvedor roubadas, contas de plataformas compradas em mercados ilícitos e nuvem sequestrada para sustentar cargas não autorizadas de alta performance — prática que o GTIG agrupa sob o rótulo de LLMJacking. Modelos proprietários, código, prompts e pesquisas viraram alvo de espionagem e extorsão em saúde, governo e mídia, movimento de valorização desses ativos que já havíamos registrado na cobertura sobre destilação industrial contra modelos de IA.
O ataque de seis horas
Na intrusão que abre o relatório, o grupo comprometeu primeiro um recurso de nuvem da vítima. A partir dele, usou um chatbot de codificação assistida por IA, um prompt e conjuntos de instruções em markdown que funcionavam como playbooks operacionais pré-configurados. Com esse material, o agente planejou, construiu e executou a campanha de forma autônoma: varredura automatizada de infraestrutura, exploração direcionada e rotação de endereços IP sem intervenção manual, com solução de problemas em tempo real feita pelo próprio sistema. Como o tráfego saía de endereços legítimos da vítima, listas de reputação baseadas em IP perdem a utilidade como controle.
O detalhe relevante para a defesa não é a sofisticação do malware — é a compressão do tempo. O intervalo entre o comprometimento inicial e o impacto em massa caiu para menos de uma tarde de trabalho, e a escalada atingiu a velocidade típica de grupos muito maiores e com mais recursos. Runbooks que preveem triagem humana em horas ficam obsoletos quando o adversário conclui o ciclo inteiro nesse intervalo: a contenção precisa ser automática ou simplesmente não acontece.
Cadeia de suprimentos de IA
O segundo eixo é o ataque aos próprios fluxos de desenvolvimento assistido. O cluster UNC6780, associado ao grupo TeamPCP, enganou assistentes de codificação com IA e scanners de segurança baseados em LLM em comprometimentos de software open source, manipulando o comportamento dessas ferramentas por injeção de prompt. O relatório do Mandiant resume a consequência: uma única fonte de dados envenenada, dependência maliciosa ou extensão comprometida transforma um agente confiável em canal não autorizado de reconhecimento interno, movimento lateral e escape de sandbox.
A raiz do problema é estrutural. Modelos de linguagem seguem instruções presentes no conteúdo que processam e não distinguem com confiabilidade a origem de cada instrução. Quando um agente combina acesso a dados privados, exposição a conteúdo não confiável e capacidade de comunicação externa, um invasor consegue induzi-lo a ler e exportar o que interessa — a combinação que Simon Willison batizou de tríade letal. O fornecedor pode corrigir um vetor de exfiltração no produto dele; quem monta o próprio agente combinando ferramentas de origens diversas não herda nenhuma dessa proteção.
Controles prioritários de defesa
O relatório do Mandiant traduz o diagnóstico em controles concretos, começando por hooks de verificação em IDE e CLI que validam toda dependência recomendada por IA contra checksums criptográficos e allowlists aprovados. No plano de identidade, a documentação do Google Cloud propõe substituir service accounts compartilhados por identidades de agente baseadas no padrão SPIFFE: não compartilhadas por padrão entre workloads, sem personificação e sem chaves de longa duração geráveis por desenvolvedores, com tokens de acesso vinculados criptograficamente aos certificados X.509 de cada agente para impedir roubo de credencial. A tabela resume o roteiro por prioridade:
| Prioridade | Controle | O que fazer |
|---|---|---|
| P1 | Isolar credenciais locais | Impedir que extensões e plugins acessem chaves de API e tokens OAuth de longa duração; adotar secrets just-in-time para sessões de desenvolvimento. |
| P1 | Egress controlado | Roteirizar tráfego de dependências por repositórios internos verificados e bloquear saída arbitrária das estações de desenvolvimento. |
| P1 | Inventário dinâmico de IA | Manter catálogo central em tempo real de casos de uso, endpoints de modelo, componentes e cotas de nuvem associadas. |
| P2 | Limites operacionais | Caps financeiros, limites de recursão e rate limits por serviço e projeto para conter execução descontrolada de agentes. |
| P2 | Inspeção de contexto | Camada de segurança entre fontes externas e a janela de contexto do modelo, com DLP no fluxo de resposta. |
| P2 | Revisão de modelos abertos | Verificação de hash, benchmark e avaliação de vulnerabilidade antes de colocar pesos de terceiros em produção. |
Sinais a monitorar na nuvem
A recomendação central dos dois relatórios é reorientar o SOC para telemetria comportamental em tempo real, em vez de confiar em perímetro estático. Configure alertas para: serviço de IA corporativo habilitado fora do processo de compra; instância de compute de alto desempenho criada sem registro de mudança; consultas que varrem tabelas de variáveis de ambiente e credenciais; service account novo com papel de Editor; pedido súbito de aumento de cota de GPU; e domínio de autenticação recém-registrado imitando serviços internos. Cada um desses sinais apareceu em pelo menos uma intrusão descrita no rastreamento.
O quadro geral fecha com a leitura de campo do Mandiant: a maioria das invasões bem-sucedidas continua nascendo de falhas humanas e sistêmicas básicas, e nenhuma quebra de 2025 resultou diretamente de IA. O que mudou é a velocidade de execução depois do primeiro erro — e é essa velocidade que obriga a defesa a automatizar contenção, identidade e observabilidade. A mesma pressão combinada de grupos que adotam IA na execução já aparecia no cenário do ransomware 2026, com mais grupos e ataques assistidos por IA.