Pesquisadores apresentaram uma nova abordagem voltada para a segurança digital que utiliza inteligência artificial para proteger redes com muito mais rapidez no uso de dados. Apresentado em 25 de setembro de 2026 pelos cientistas Ryozo Masukawa, Sanggeon Yun, Raheeb Hassan, Hyunwoo Oh, SungHeon Jeong e Mohsen Imani, o projeto chamado CyberWorld (abre em nova aba) aplica o conceito de modelos de mundo para viabilizar defesas cibernéticas autônomas eficientes.
A proteção autônoma contra invasões tradicionalmente utiliza o aprendizado por reforço profundo, uma técnica na qual o programa toma decisões, observa os acertos ou erros e ajusta suas táticas com o tempo. Esse processo tradicional atua de forma direta no ambiente sem possuir um modelo prévio da realidade, método conhecido na área técnica pela expressão em inglês model-free. O grande problema dessa abordagem convencional é a baixa eficiência de amostragem: para descobrir como combater ameaças com eficácia, o sistema necessita realizar milhões de tentativas repetitivas diretamente na rede real ou simulada, o que consome enorme poder computacional e tempo.
Para superar essa barreira, o CyberWorld segue a estrutura do tipo Dreamer. Em vez de interagir a todo instante com o ambiente real, a inteligência artificial aprende primeiro a dinâmica interna do sistema digital e passa a criar trajetórias imaginadas. Funciona de forma similar a um jogador de xadrez que não precisa mover as peças fisicamente no tabuleiro para entender o que pode acontecer: ele visualiza as jogadas mentalmente antes de agir. Com essa capacidade de previsão, as políticas de defesa são treinadas dentro desse próprio modelo simulado, poupando a necessidade de testes exaustivos e desgastantes no tráfego verdadeiro da rede.

O que constitui exatamente o "mundo" digital dentro desse modelo é uma questão essencial para o projeto. Em segurança da informação, um sistema pode ser traduzido de diferentes formas. Os pesquisadores projetaram o modelo para aprender a dinâmica cibernética oculta a partir de quatro representações fundamentais da rede defendida:
- Vetores simples, que agrupam características numéricas do estado dos computadores;
- Grafos, que mapeiam a topologia e as ligações estruturais entre os equipamentos;
- Formatos textuais, que organizam registros e descrições dos eventos operacionais;
- Abordagens multimodais, que combinam diferentes tipos de dados em uma visão unificada.
A partir dessas representações, os algoritmos aprendem como o estado da rede evolui diante de incidentes. As regras de defesa são então aprimoradas dentro das trajetórias criadas por esse modelo latente, permitindo reagir prontamente a comportamentos suspeitos.
Os resultados práticos mostraram um avanço expressivo de desempenho e velocidade em comparação com as tecnologias convencionais. Em testes cobrindo quatro estratégias de ataque avaliáveis do ambiente CyberWheel, a versão do CyberWorld baseada em grafos superou a linha de controle neutra em relação a estratégias após registrar entre 3,6 mil e 15,8 mil passos de interação com o ambiente. Em contrapartida, algoritmos tradicionais sem modelo prévio, como o PPO (sigla em inglês para Proximal Policy Optimization), exigiram milhões de passos para tentar atingir resultados equivalentes.
| Abordagem | Passos de interação para superar o controle |
|---|---|
| PPO tradicional (sem modelo) | Milhões de passos |
| CyberWorld (baseado em grafos) | 3,6 mil a 15,8 mil passos |
O estudo também avaliou o comportamento do sistema sob diferentes arquiteturas e tamanhos de rede. A representação estruturada em grafos ofereceu maior robustez contra invasões que dependem diretamente do arranjo e da topologia dos nós interconectados. Enquanto isso, representações mais simples mantiveram-se competitivas em termos de desempenho geral.
Em relação à escalabilidade, os testes revelaram que o número de episódios necessários para alcançar a marca de controle permaneceu praticamente constante mesmo com o aumento do tamanho da rede, que variou de 15 até 100 computadores hospedeiros nos experimentos bem-sucedidos. Os autores apontam que a dinâmica cibernética aprendida estabelece uma base escalável para defesas autônomas, destacando a representação do mundo digital como o eixo central de projeto para garantir proteção estável em infraestruturas computacionais.

