Os agentes de IA para testes de intrusão deixaram de ser experimento de laboratório. Uma análise técnica publicada pelo AppSec Santa em junho de 2026 mapeia pelo menos 39 projetos open-source ativos, organizados em seis padrões de arquitetura. Dois marcos definiram o campo. Em junho de 2025, o agente autônomo da XBOW assumiu o topo do leaderboard global do HackerOne com mais de 1.060 submissões validadas, segundo a própria empresa. Já o Mythos Preview, da Anthropic, teria encontrado milhares de vulnerabilidades de alta severidade em todos os principais sistemas operacionais e navegadores — a ponto de a empresa julgá-lo capaz demais para liberar amplamente. Entre 2026 e 2027, a tendência é que essas arquiteturas se tornem infraestrutura padrão de red team.
Como um agente de pentest funciona
A diferença entre um copiloto e um agente é simples: o copiloto aconselha, o agente executa. Ele roda o comando, lê a saída e decide o próximo passo dentro de um loop ReAct (raciocínio-ação). Um scanner como o Nuclei aplica uma lista fixa de verificações; o agente lê o resultado, formula uma hipótese sobre o que é explorável e, quando ela falha, tenta outra abordagem que não existe em nenhum playbook. É a diferença entre checklist e raciocínio.
Os seis padrões de arquitetura
A análise de 39 projetos open-source publicada pelo AppSec Santa identifica seis padrões consolidados:
- Agente único (loop ReAct): PentestGPT e hackingBuddyGPT. Simples de construir, mas o limite do contexto derruba achados anteriores quando a saída do nmap enche a janela.
- Planner-executor: VulnBot e HPTSA. O planejador cuida da estratégia, executores com contexto próprio cuidam da tática. O HPTSA registrou melhoria de 4,3 vezes sobre agentes monolíticos na exploração de zero-days.
- Papéis especializados: PentAGI, com 14.700 estrelas no GitHub, orquestra quatro sub-agentes (busca, código, instalação, operação ofensiva) com memória vetorial em PostgreSQL.
- Enxame dinâmico: o D-CIPHER cria agentes conforme a superfície de ataque cresce e resolveu 65% mais técnicas do MITRE ATT&CK que as linhas de base de agente único.
- Baseado em MCP: HexStrike AI expõe mais de 150 ferramentas como endpoints MCP e deixa o raciocínio por conta do cliente LLM. Segundo a análise do AppSec Santa, é o padrão que cresce mais rápido no campo.
- Nativo do Claude Code: agentes definidos como arquivos markdown, como o Raptor, criado por Gadi Evron, Daniel Cuthbert e Halvar Flake, entre outros. Iteração rápida, ecossistema fechado.
O abismo entre laboratório e mundo real
O número mais citado do campo vem do estudo de Fang e colegas (2024): o GPT-4 explotou 87% das CVEs de um dia quando a descrição do advisory estava no contexto. O que a manchete omite: sem a descrição, o índice cai para 7%. No CVE-Bench, com condições próximas do real, o estado da arte resolve 13%. Nos desafios difíceis do HackTheBox AI Range, os resultados publicados pela plataforma mostram todos os modelos testados perto de zero. A regra prática: quanto mais realistas as condições, pior o desempenho do agente.
Onde a IA já compete com pentesters
O estudo ARTEMIS (dezembro de 2025) comparou agente e humanos numa rede real de cerca de 8 mil hosts em ambiente acadêmico. O agente encontrou 9 vulnerabilidades válidas com precisão de 82% e venceu 9 dos 10 pentesters humanos — a cerca de 18 dólares por hora, contra 60 ou mais cobrados por profissional. O melhor humano ainda ganhou, com 13 achados válidos, explorando encadeamento criativo de falhas, validação de casos extremos e entendimento de lógica de negócio — categorias em que o agente nem chegou a registrar como anomalia. E esse é o ponto central do estudo: segundo os autores do ARTEMIS, 70% das vulnerabilidades críticas em aplicações web são falhas de lógica de negócio, a classe que nenhum agente autônomo detecta de forma confiável hoje.
Achados que mudaram o campo
O Big Sleep, do Google, encontrou a primeira vulnerabilidade explorável descoberta por IA em código em desenvolvimento: um underflow de buffer em branch pré-release do SQLite, que o OSS-Fuzz e a suíte de testes do próprio projeto não haviam detectado. O agente da XBOW construiu uma cadeia de exploração de 48 passos e igualou, em 28 minutos, a avaliação manual de 40 horas de um pentester principal. O relatório de 2025 do HackerOne registra salto de 210% em relatórios válidos gerados por IA e mais de 560 submissões de agentes totalmente autônomos.
O que esperar de 2027
Três movimentos devem consolidar o campo até 2027. Primeiro, a arquitetura multi-agente vira padrão: os ganhos de 4,3 vezes do HPTSA e os resultados do D-CIPHER já justificam o custo adicional. Segundo, modelos médios ajustados para segurança ofensiva substituem modelos genéricos de fronteira — o xOffense, com Qwen3-32B ajustado, atingiu 79,17% de conclusão de subtarefas e superou agentes baseados em GPT-4 e Llama 3. Terceiro, a fronteira de detecção de falhas de lógica de negócio continua sendo o diferencial humano: enquanto 70% das vulnerabilidades críticas vivem aí, o pentester sênior mantém o lugar — e o agente vira a ferramenta de cobertura, varredura e relatório que roda 24/7 ao lado dele.
O que fazer agora
Para equipes de segurança, o caminho prático é tratá-los como multiplicadores de cobertura, não como substitutos: rodar os agentes sobre superfícies conhecidas para liberar os humanos para encadeamento criativo e lógica de negócio. Para quem opera defesa, a leitura é inversa e urgente: a mesma arquitetura que acha vulnerabilidades em escala está disponível para atacantes. Ataques orquestrados por agentes já coletam credenciais em seis horas, ferramentas de agentes expõem credenciais de IA em produção, e a superfície dos servidores MCP já tem benchmark próprio do CIS. Quem testa seus próprios sistemas com agentes antes que atacantes o façam sai na frente em 2027.