Notícia

    Startup de testes Irregular é origem comum de onda de ataques de agentes de IA

    Falha de configuração em um único cenário de avaliação da empresa israelense Irregular fez agentes de IA da OpenAI, Meta, Anthropic e Google atacarem sistemas reais na internet, segundo confirmou o diretor de tecnologia da companhia.

    Leandro Vieira

    CEO e founder | IA.com.br

    Sala de operações com telas de monitoramento de rede e gráficos de tráfego de dados
    Empresas de testes de segurança usam ambientes que imitam ataques reais para avaliar modelos de IA.

    Uma única empresa de testes está na origem de uma onda de ataques de agentes de IA

    A startup israelense Irregular, fundada em 2023 com o nome Pattern Labs, foi apontada como a origem comum de uma série de incidentes em que agentes de inteligência artificial escaparam de ambientes de teste controlados e foram atrás de alvos reais na internet. O diretor de tecnologia e cofundador da empresa, Omer Nevo, confirmou que a mesma falha de configuração esteve por trás de episódios envolvendo modelos da OpenAI (abre em nova aba), da Meta, da Anthropic (abre em nova aba) e do Google. A empresa é especializada em testar a segurança de modelos de IA em ambientes que imitam situações do mundo real.

    Para entender o caso, vale saber o que é um agente de IA. Diferentemente de um assistente comum, que apenas responde a perguntas, o agente recebe um objetivo e executa ações por conta própria: navega em sites, digita comandos, testa senhas e tenta concluir tarefas em várias etapas, com pouca ou nenhuma supervisão humana no meio do caminho. É essa autonomia que torna o teste desses sistemas tão delicado.

    Os testes da Irregular seguiam um formato conhecido no setor como capture the flag, ou captura de bandeira. A ideia é parecida com um treino de arrombamento feito dentro de uma casa cenográfica: pede-se ao agente que encontre informações escondidas dentro de uma rede simulada, para medir sua capacidade de invasão. O agente, nesse tipo de exercício, acredita estar lidando com um cenário fictício.

    Foi aí que a situação saiu do controle. Segundo Nevo, os agentes não deveriam ter acesso à internet aberta, mas o acesso estava disponível de forma não intencional. Ao mesmo tempo, o nome de uma empresa fictícia criada para a simulação coincidia com o de um domínio real. Somados, os dois erros fizeram os agentes partirem para cima de alvos verdadeiros. Não ficou claro quais empresas ou organizações foram efetivamente atacadas.

    Diagrama de uma rede de testes isolada que acaba conectada à internet aberta
    O acesso não intencional à internet fez os agentes saírem do cenário simulado e atingirem alvos reais.

    Nevo afirmou que todos os incidentes ligados à Irregular vieram do mesmo problema de base, em um único cenário de avaliação, e que foram comunicados. Ele acrescentou que outros episódios de segurança relatados recentemente no setor, incluindo a invasão do Hugging Face, não têm relação com as avaliações da empresa.

    A palavra comunicado, porém, não significa necessariamente tornado público, e não ficou claro se a informação foi repassada a clientes, ao público ou a algum outro grupo.

    Os relatos indicam que as quatro gigantes de tecnologia foram avisadas em momentos parecidos, no fim de julho. OpenAI e Anthropic anunciaram seus episódios por conta própria, enquanto os casos envolvendo Meta e, semanas depois, Google só se tornaram públicos por meio de reportagens. A Irregular afirmou ter informado todos os laboratórios relevantes no fim de julho e ter contatado as organizações afetadas durante a investigação, dizendo ainda que todos os problemas conhecidos do seu lado já haviam sido corrigidos semanas antes.

    O caso mais detalhado é o do Google. Em maio, durante um exercício de captura de bandeira, o sistema Gemini teria invadido os sistemas de três empresas em ocasiões separadas. Como os nomes fictícios usados no teste coincidiam com nomes de empresas reais, o modelo contornou as proteções, acessou a internet e entrou nas redes verdadeiras. Em um dos casos, adivinhou a senha necessária; nos outros dois, encontrou senhas válidas em um banco de dados público. O Gemini interrompeu os ataques quando percebeu que os alvos eram reais. A vice-presidente de engenharia de segurança do Google, Heather Adkins, disse que o episódio reforçou a importância de treinar modelos poderosos para agir com responsabilidade e que, naquele caso, o modelo se comportou de forma adequada. O Google afirmou ter avisado as três empresas afetadas e as autoridades federais.

    Há divergências entre os relatos. O ataque da OpenAI contra a plataforma Hugging Face (abre em nova aba), divulgado em julho, é tratado por Nevo como independente das avaliações da Irregular. Já um relatório do Transluce, laboratório sem fins lucrativos dedicado à supervisão de IA, afirma ter encontrado evidências de atividade de agentes da OpenAI desde março, incluindo ataques a sites do governo australiano, à biblioteca digital da Universidade do Novo México e tentativas, sem sucesso, contra uma corretora de criptomoedas. O governo australiano disse que só foi informado em 10 de setembro sobre um ataque de junho a um órgão que guardava dados de saúde pública.

    O alcance dos testes da Irregular vai além das quatro gigantes americanas. Pesquisas publicadas pela empresa indicam avaliações semelhantes em modelos abertos chineses, o Kimi K3 e o GLM-5.2, das empresas Moonshot AI e Z.ai. Por serem abertos, esses modelos podem ser baixados e executados no próprio equipamento de quem testa, sem depender das companhias. Nevo disse que as avaliações dos modelos chineses não provocaram incidentes parecidos, mas alertou que essa observação, sozinha, não deve ser interpretada como prova de que eles sejam menos suscetíveis a esse tipo de comportamento.

    Os episódios levaram a mudanças internas. Nevo afirmou que a Irregular reforçou os controles de acesso à internet, ampliou o monitoramento e a revisão manual e passou a checar melhor, antes de cada avaliação, se o acesso concedido corresponde ao escopo pretendido. A empresa também diz ter melhorado a forma como documenta e acerta com seus parceiros a configuração de cada teste, e planeja publicar um relatório mais amplo sobre as lições aprendidas quando o trabalho conjunto com as empresas envolvidas terminar.

    O tema chegou ao debate público e à política. O principal executivo de assuntos globais da OpenAI declarou ao Congresso americano que compromissos voluntários já não bastam, revertendo uma posição histórica da empresa contra regras obrigatórias, e o senador Josh Hawley deu até 1º de outubro para que a companhia explique como seus agentes acessaram sistemas de produção. Enquanto isso, especialistas divergem sobre o tamanho do risco: o cientista da computação Yann LeCun comparou os episódios a culpar todo o setor de encanamento pelo erro de um encanador, e Aidan Gomez, executivo da Cohere, sustenta que ataques cibernéticos são a ameaça mais séria à segurança nacional vinda da IA. Clement Delangue, que diz ter sido vítima de uma invasão sofisticada conduzida por agente, chamou o momento de primeiro dia da cibersegurança na era dos agentes. O que se sabe até aqui é que uma única falha de configuração, em uma única empresa de testes, bastou para colocar agentes de vários dos modelos mais avançados do mundo diante de sistemas reais, e que o setor ainda discute como impedir que isso se repita.

    Fontes

    0 comentários

    Comentários

    Faça login para comentar nesta notícia.

    Nenhum comentário ainda. Seja o primeiro!