Pular para o conteúdo
    Notícia

    Compressão de memória em IA altera recusas e engana filtros de segurança

    Pesquisa revela que comprimir a memória de contexto dos modelos de linguagem faz filtros de palavras-chave falharem ao identificar respostas seguras.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    29 de set. de 2026 · 4 min de leitura

    Fileiras de racks com servidores em operação dentro de um centro de dados, exibindo luzes indicadoras acesas e cabeamento organizado sob iluminação neutra.
    Infraestrutura de processamento em nuvem onde são executadas as rotinas de memória de contexto e filtros de segurança em modelos de linguagem.

    Ao processar conversas extensas, os modelos de linguagem utilizam um recurso chamado cache de chaves e valores, conhecido pela sigla em inglês KV cache. Esse mecanismo funciona como um bloco de notas rápido de memória de trabalho. Ele guarda as informações essenciais do texto já lido para que o sistema não precise recalcular cada palavra a cada nova resposta.

    Como essas anotações consomem muita memória computacional quando o texto é longo, os engenheiros aplicam técnicas de compressão para descartar partes menos relevantes e liberar espaço. Um estudo sobre recusas suaves (abre em nova aba), submetido por pesquisadores em 16 de setembro de 2026, revelou que esse processo de economia altera sutilmente o estilo das respostas de proteção dos modelos. Essa mudança faz com que as ferramentas tradicionais de auditoria falhem em reconhecer que a inteligência artificial se comportou de maneira segura.

    O que são as recusas suaves

    Quando um usuário pede instruções perigosas ou prejudiciais, um modelo alinhado costuma recusar o pedido de forma padronizada. Ele geralmente recorre a frases prontas como "sinto muito, mas não posso ajudar com isso" ou "peço desculpas, mas não tenho permissão". Os sistemas de segurança monitoram essas respostas usando filtros rápidos baseados em palavras-chave, que procuram exatamente esses termos típicos de bloqueio.

    O estudo demonstrou que, ao comprimir o cache de memória, o modelo continua rejeitando o pedido prejudicial, mas muda sua maneira de falar. Ele deixa de usar os termos formais esperados e formula negativas indiretas ou contextuais, fenômeno chamado pelos pesquisadores de recusa suave.

    Por dependerem apenas de termos fixos, as ferramentas de verificação lexical acreditam que o modelo atendeu ao pedido perigoso, quando na verdade ele apenas disse "não" com outras palavras. Por outro lado, classificadores de segurança mais avançados, que utilizam modelos treinados para compreender o sentido da frase, mantêm a capacidade de confirmar que o pedido foi devidamente rejeitado.

    Métrica no modelo Qwen2.5-3BSem compressão de memóriaCom compressão de memória
    Detecção por palavras-chave98,0% de recusas80,5% de recusas
    Detecção por classificador dedicado99,0% a 99,5%99,0% a 99,5%
    Desempenho geral em tarefas (MMLU)50,0% de acerto50,0% de acerto

    Os testes aplicados ao modelo Qwen2.5-3B analisaram 200 pedidos nocivos acompanhados de textos longos de preenchimento. Com a compressão configurada para manter quatro posições iniciais e os últimos 30% da memória, a taxa de recusa detectada pelo filtro de palavras caiu de 98,0% para 80,5%. Já o classificador dedicado, baseado no modelo Llama-2-13B, manteve a identificação entre 99,0% e 99,5%, enquanto a capacidade geral em testes de matemática permaneceu intacta em 50,0%.

    Para verificar qual medição estava correta nos 56 casos de divergência entre o filtro simples e o classificador, humanos revisaram as respostas. A avaliação humana confirmou a conclusão do classificador em 94,6% das ocorrências, comprovando que o modelo de fato se recusou a cooperar com a tarefa nociva.

    Os riscos para o monitoramento da inteligência artificial

    Essa discrepância gera problemas sérios para a gestão de segurança. Sistemas em produção que dependem exclusivamente de buscas por termos fixos produzem uma alta quantidade de falsos alertas, acusando falhas de segurança onde não houve violação.

    Pessoa em ambiente corporativo vista de perfil analisando gráficos e indicadores abstratos em um monitor de computador em mesa de escritório bem iluminada.
    Filtros rígidos baseados apenas em termos fixos elevam a ocorrência de falsos alertas, exigindo monitoramento constante das equipes de segurança.

    Essa dificuldade técnica já havia sido registrada em uma análise de segurança em compressão de cache (abre em nova aba), apresentada em junho e publicada em 1 de julho de 2026. Aquele trabalho constatou que regras baseadas em padrões lexicais geram falsos positivos relevantes sob regimes de memória reduzida, o que exigiu o uso de juízes semânticos automatizados para analisar as saídas.

    Além de distorcer o monitoramento, a própria compressão traz comportamentos ambíguos para a proteção do sistema:

    • Efeito de robustez acidental: algumas tentativas de manipulação falham porque o corte de memória descarta partes maliciosas do texto sem planejar.
    • Paradoxo da vulnerabilidade: métodos que combinam posições de memória em camadas superficiais podem degradar os circuitos internos de atenção, facilitando certos ataques desenhados por humanos.
    • Degradação de alinhamento: cortes agressivos de informação podem prejudicar a capacidade de defesa da inteligência artificial se forem feitos sem critérios de segurança.

    Diante desses desafios, propostas recentes como o método AnchorKV (abre em nova aba), apresentado em 16 de junho de 2026, sugerem aplicar penalidades de retenção para proteger direções do espaço de memória ligadas à recusa de conteúdo perigoso. Os pesquisadores concluem que auditorias de modelos sob compressão não devem confiar apenas em taxas de palavras-chave, recomendando a adoção de múltiplos juízes semânticos calibrados para o ambiente real de operação.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo