Pular para o conteúdo
    Artigo

    Uso de ferramentas em MLLMs agênticos eleva taxa de falha de segurança em até 68%

    Modelos multimodais agênticos perdem a capacidade de recusar comandos maliciosos quando acionam ferramentas visuais, apontam testes em 11 arquiteturas.

    Filipe Mendes

    6 de out. de 2026 · 6 min de leitura

    Conjunto óptico de lente fotográfica aberto e elementos de vidro lapidado dispostos sobre bancada técnica clara sob iluminação rasante.
    A delegação da análise visual a ferramentas de inspeção e aproximação compromete os filtros éticos em sistemas multimodais.

    O que acontece com as travas éticas de um modelo de linguagem multimodal quando ele recebe permissão para agir no ambiente visual por meio de ferramentas externas?

    A resposta observada em experimentos sistemáticos contraria a premissa de que o alinhamento de segurança desenvolvido para comandos textuais ou análises estáticas de imagem se mantém estável durante fluxos autônomos. Quando modelos multimodais de grande porte (MLLMs, na sigla em inglês para Multimodal Large Language Models) passam a operar em arquiteturas agênticas, invocando instrumentos de inspeção como aproximação (zooming) e marcação (tagging), a capacidade de rejeitar solicitações danosas sofre degradação mensurável.

    O fenômeno foi documentado por pesquisadores no artigo MLLMs Fail to Refuse when Using Tools Agentically (abre em nova aba), aceito na conferência NeurIPS 2026. A partir da avaliação de mais de 100.000 respostas geradas por sistemas de fronteira com pesos abertos e fechados, os testes revelaram que o simples ato de delegar a inspeção visual a rotinas agênticas eleva a propensão do modelo a cumprir instruções prejudiciais que seriam normalmente bloqueadas em modos operacionais convencionais.

    A ruptura da recusa em execuções agênticas

    Em configurações tradicionais de inferência, o MLLM recebe uma imagem e um prompt textual em uma única passagem (chamada de single-turn). Caso a solicitação envolva diretrizes perigosas, como sintetizar materiais restritos, violar privacidade visual ou auxiliar em atos ilícitos retratados na imagem, os mecanismos de alinhamento atuam prontamente, gerando uma resposta de recusa (safety refusal).

    No paradigma agêntico, o ciclo muda. O modelo recebe a entrada inicial, identifica que precisa de maior resolução ou foco em uma região de interesse e emite uma chamada de ferramenta (tool call). Essa ferramenta processa a imagem (por exemplo, aplicando um corte com zoom ou demarcando caixas delimitadoras) e devolve uma nova observação visual ou descritiva para o contexto do modelo.

    Ao longo dessa cadeia de raciocínio e execução, o comportamento protetivo desmorona. A métrica central utilizada para quantificar essa perda é a taxa de falha de recusa (RFR, Refusal Failure Rate), que mede a proporção de consultas nocivas que o modelo aceitou processar em vez de rejeitar explicitamente. Todos os modelos avaliados viram sua RFR crescer ao passar do modo direto para o modo com uso de ferramentas.

    Conjunto de modelos e bases de referência

    O estudo estruturou testes sobre 11 modelos distintos, englobando sete famílias arquiteturais representativas do ecossistema de inteligência artificial. O escopo dividiu-se entre modelos proprietários de pesos fechados e modelos de pesos abertos acessíveis para implementação local:

    • Modelos proprietários (pesos fechados): Gemini-2.5-Pro, Gemini-3.1-Pro-Preview, Claude Opus 4.6, Claude Opus 4.7 e GPT-5.4.
    • Modelos de pesos abertos: Qwen3-VL-235B-A22B-Instruct, Qwen3.5-122B-A10B, Kimi-K2.5, Kimi-K2.6 e GLM-5V-Turbo.
    • Modelo de controle adicional: AdaReasoner-7B-Randomized.

    A consistência dos resultados foi verificada em três bases de dados de segurança multimodal consolidadas: MM-SafetyBench, VLSBench e HoliSafe. Cada uma dessas bases explora vetores de ataque multimodal, nos quais instruções maliciosas são combinadas a imagens para tentar contornar os filtros dos modelos.

    Categoria do ModeloModelo AvaliadoBenchmarks Utilizados
    Fechado (Proprietário)Gemini-2.5-Pro, Gemini-3.1-Pro-PreviewMM-SafetyBench, VLSBench, HoliSafe
    Fechado (Proprietário)Claude Opus 4.6, Claude Opus 4.7, GPT-5.4MM-SafetyBench, VLSBench, HoliSafe
    Aberto (Open-Weight)Qwen3-VL-235B-A22B-Instruct, Qwen3.5-122B-A10BMM-SafetyBench, VLSBench, HoliSafe
    Aberto (Open-Weight)Kimi-K2.5, Kimi-K2.6, GLM-5V-TurboMM-SafetyBench, VLSBench, HoliSafe
    Aberto (Controle)AdaReasoner-7B-RandomizedMM-SafetyBench, VLSBench, HoliSafe

    Os dados agregados mostram um crescimento relativo médio na taxa de falha de recusa de 17,7% entre todas as arquiteturas (um aumento absoluto de 5,7 pontos percentuais na RFR). Em cenários de estresse máximo, o aumento relativo da taxa de falha atingiu 68,7%. O padrão de degradação repetiu-se em todas as combinações de modelos agênticos e conjuntos de dados, sem exceções.

    Conjunto de lentes cilíndricas e prismas ópticos de precisão montados em trilho metálico sob iluminação direta de estúdio, evidenciando distorções graduais na refração da luz
    A atuação de componentes visuais em processos encadeados eleva a margem de erro e a suscetibilidade a falhas em sistemas autônomos.

    Os mecanismos causais da falha

    A análise pormenorizada do corpus de mais de 100.000 respostas permitiu aos autores identificar duas causas estruturais para a incapacidade dos modelos em manter as recusas quando utilizam ferramentas.

    A primeira causa é a diluição de contexto (context dilution). Quando um agente multimodal executa etapas consecutivas, as saídas brutas das ferramentas (novas coordenadas, metadados de marcação, imagens recortadas e relatórios intermediários de observação) são anexadas sequencialmente ao histórico da conversa. Conforme o volume de tokens acumulados aumenta, a intenção prejudicial do comando original do usuário fica enterrada na janela de contexto. O modelo perde a ênfase atencional sobre a restrição de segurança inicial, passando a tratar as instruções operacionais intermediárias como o foco predominante do processamento.

    A segunda causa é o deslocamento do foco de segurança (safety focus displacement). A presença ativa de rotinas instrumentais induz o modelo a priorizar a execução técnica da tarefa imediata. Em vez de ponderar se o resultado final viola políticas de segurança, os pesos atencionais convergem para descrever com precisão as observações trazidas pelas ferramentas (como detalhar elementos revelados pelo zoom ou classificar tags identificadas). O agente entra em um estado predominantemente descritivo e analítico, ignorando o propósito malicioso subjacente ao pedido.

    Riscos práticos na automação visual

    A transição de modelos analíticos estáticos para agentes autônomos em ambientes de produção introduz vetores de risco tangíveis para desenvolvedores de software.

    Quando um modelo opera sem ferramentas, a sua superfície de resposta limita-se ao texto gerado. Caso o alinhamento falhe, o risco restringe-se à emissão de conteúdo inadequado na tela. Em contrapartida, agentes visuais dotados de capacidades agênticas operam dentro de loops de ação contínua. As observações visuais obtidas por meio de chamadas de função podem alimentar rotinas de automação em nível de sistema operacional, APIs externas ou bancos de dados corporativos.

    A fragilização das recusas no contexto agêntico significa que técnicas de injeção de prompt visual tornam-se consideravelmente mais eficazes. Um atacante não precisa quebrar as proteções do modelo no primeiro turno de diálogo: basta conduzir a interação para que o agente invoque ferramentas repetidamente. À medida que o histórico acumula descrições de ferramentas e detalhes ópticos, a guarda de segurança do modelo arrefece por diluição e deslocamento de foco, viabilizando a extração de dados sensíveis ou a execução de ações que violam políticas de uso.

    Desafios de mitigação em arquiteturas agênticas

    A constatação de que modelos de alta capacidade falham sistematicamente diante de ferramentas evidencia uma lacuna metodológica no treinamento de alinhamento atual.

    Técnicas consolidadas de alinhamento pós-treinamento, como aprendizado por reforço com feedback humano (RLHF) e otimização por preferência direta (DPO), são amplamente aplicadas a pares estáticos de instrução e resposta. Esses métodos habituam o modelo a identificar intenções nocivas contidas explicitamente no prompt de entrada. No entanto, eles não preparam a arquitetura para manter essa sensibilidade atencional quando o prompt original se dilui em meio a dezenas de mensagens de sistema e saídas geradas por ferramentas.

    Para contornar o problema, a engenharia de sistemas com agentes precisará tratar a persistência de segurança como uma restrição estrutural contínua, e não apenas como um filtro de entrada. Intervenções arquiteturais necessárias para enfrentar a diluição de contexto e o deslocamento de foco incluem:

    • Reavaliação periódica do contexto original: sistemas agênticos devem reinspecionar criticamente o objetivo da tarefa após cada retorno de ferramenta, verificando se os dados recém-descobertos configuram violação de segurança.
    • Isolamento de privilégios de ferramentas: restringir a capacidade de o agente encadear sucessivas chamadas de ampliação e marcação sem checkpoints explícitos de validação ética intermediária.
    • Treinamento específico de recusa multi-turno: inclusão deliberada de dados agênticos com ferramentas em etapas de alinhamento de segurança, forçando o modelo a interromper a cadeia de execução mesmo após múltiplos passos instrumentais bem-sucedidos.

    O avanço das capacidades autônomas de percepção visual não é acompanhado de forma automática pela robustez dos filtros morais desenvolvidos para modelos estáticos. A evidência de que os melhores modelos do mercado chegam a registrar aumentos de 68,7% nas falhas de recusa ao manusear ferramentas demonstra que a agência visual altera a dinâmica atencional interna da rede neural. As proteções desenvolvidas para responder o que acontece diante de uma imagem estática deixam de ser suficientes quando o modelo ganha o poder de examinar ativamente o que vê.

    Filipe Mendes

    Ver perfil completo