Pular para o conteúdo
    Notícia

    CyberWorld cria defesa cibernética autônoma com alta eficiência

    Estrutura usa modelos de mundo para treinar defesas digitais com menos dados e simulações internas eficientes.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    29 de set. de 2026 · 3 min de leitura

    Diagrama esquemático de rede digital com nós interconectados por linhas finas em tons de azul-petróleo e pontos de destaque em âmbar sobre fundo claro.
    Representação esquemática de arquitetura em rede voltada para simulações e defesas cibernéticas autônomas.

    Pesquisadores apresentaram uma nova abordagem voltada para a segurança digital que utiliza inteligência artificial para proteger redes com muito mais rapidez no uso de dados. Apresentado em 25 de setembro de 2026 pelos cientistas Ryozo Masukawa, Sanggeon Yun, Raheeb Hassan, Hyunwoo Oh, SungHeon Jeong e Mohsen Imani, o projeto chamado CyberWorld (abre em nova aba) aplica o conceito de modelos de mundo para viabilizar defesas cibernéticas autônomas eficientes.

    A proteção autônoma contra invasões tradicionalmente utiliza o aprendizado por reforço profundo, uma técnica na qual o programa toma decisões, observa os acertos ou erros e ajusta suas táticas com o tempo. Esse processo tradicional atua de forma direta no ambiente sem possuir um modelo prévio da realidade, método conhecido na área técnica pela expressão em inglês model-free. O grande problema dessa abordagem convencional é a baixa eficiência de amostragem: para descobrir como combater ameaças com eficácia, o sistema necessita realizar milhões de tentativas repetitivas diretamente na rede real ou simulada, o que consome enorme poder computacional e tempo.

    Para superar essa barreira, o CyberWorld segue a estrutura do tipo Dreamer. Em vez de interagir a todo instante com o ambiente real, a inteligência artificial aprende primeiro a dinâmica interna do sistema digital e passa a criar trajetórias imaginadas. Funciona de forma similar a um jogador de xadrez que não precisa mover as peças fisicamente no tabuleiro para entender o que pode acontecer: ele visualiza as jogadas mentalmente antes de agir. Com essa capacidade de previsão, as políticas de defesa são treinadas dentro desse próprio modelo simulado, poupando a necessidade de testes exaustivos e desgastantes no tráfego verdadeiro da rede.

    Diagrama esquemático comparando fluxo direto de interação em rede contra projeção de cenários simulados internamente em tons de azul-petróleo e âmbar sobre fundo claro
    Comparativo entre o aprendizado por tentativa direta e a antecipação de cenários por meio de simulações internas.

    O que constitui exatamente o "mundo" digital dentro desse modelo é uma questão essencial para o projeto. Em segurança da informação, um sistema pode ser traduzido de diferentes formas. Os pesquisadores projetaram o modelo para aprender a dinâmica cibernética oculta a partir de quatro representações fundamentais da rede defendida:

    • Vetores simples, que agrupam características numéricas do estado dos computadores;
    • Grafos, que mapeiam a topologia e as ligações estruturais entre os equipamentos;
    • Formatos textuais, que organizam registros e descrições dos eventos operacionais;
    • Abordagens multimodais, que combinam diferentes tipos de dados em uma visão unificada.

    A partir dessas representações, os algoritmos aprendem como o estado da rede evolui diante de incidentes. As regras de defesa são então aprimoradas dentro das trajetórias criadas por esse modelo latente, permitindo reagir prontamente a comportamentos suspeitos.

    Os resultados práticos mostraram um avanço expressivo de desempenho e velocidade em comparação com as tecnologias convencionais. Em testes cobrindo quatro estratégias de ataque avaliáveis do ambiente CyberWheel, a versão do CyberWorld baseada em grafos superou a linha de controle neutra em relação a estratégias após registrar entre 3,6 mil e 15,8 mil passos de interação com o ambiente. Em contrapartida, algoritmos tradicionais sem modelo prévio, como o PPO (sigla em inglês para Proximal Policy Optimization), exigiram milhões de passos para tentar atingir resultados equivalentes.

    AbordagemPassos de interação para superar o controle
    PPO tradicional (sem modelo)Milhões de passos
    CyberWorld (baseado em grafos)3,6 mil a 15,8 mil passos

    O estudo também avaliou o comportamento do sistema sob diferentes arquiteturas e tamanhos de rede. A representação estruturada em grafos ofereceu maior robustez contra invasões que dependem diretamente do arranjo e da topologia dos nós interconectados. Enquanto isso, representações mais simples mantiveram-se competitivas em termos de desempenho geral.

    Em relação à escalabilidade, os testes revelaram que o número de episódios necessários para alcançar a marca de controle permaneceu praticamente constante mesmo com o aumento do tamanho da rede, que variou de 15 até 100 computadores hospedeiros nos experimentos bem-sucedidos. Os autores apontam que a dinâmica cibernética aprendida estabelece uma base escalável para defesas autônomas, destacando a representação do mundo digital como o eixo central de projeto para garantir proteção estável em infraestruturas computacionais.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo