Pular para o conteúdo
    Artigo

    Stance drift: estudo quantifica como LLMs distorcem o tom humano em textos mediados por IA

    Pesquisadores modelam o stance drift como transição probabilística e revelam que nenhum modelo supera 70% de fidelidade de posicionamento sob configuração padrão.

    Filipe Mendes

    6 de out. de 2026 · 4 min de leitura

    Mesa de trabalho de madeira com relatórios técnicos impressos, marcações manuais com caneta de tinta preta e caneta esferográfica pousada sobre as folhas de papel.
    Documentos impressos de deliberações técnicas com anotações e revisões manuais sobre o tom de textos.

    Sistemas de inteligência artificial alteram a postura ideológica e o grau de convicção dos textos que intermedeiam. Essa transformação ocorre sem aviso e sem necessidade de alteração factual explícita. O fenômeno, identificado formalmente como stance drift (desvio de posicionamento), estabelece uma barreira mensurável na fidelidade de mensagens em ambientes nos quais modelos de linguagem redigem, reescrevem ou condensam argumentos humanos.

    A delegação da escrita cotidiana para modelos de linguagem natural transformou fluxos de trabalho em redações de e-mails, relatórios científicos, coberturas jornalísticas e deliberações de políticas públicas. Frequentemente, assume-se que um agente conversacional atua como transmissor neutro ou como mero polidor gramatical. Contudo, pesquisas recentes documentadas no estudo arXiv:2610.04620 (abre em nova aba) demonstram que passar uma tese argumentativa por camadas de processamento generativo altera o vetor de opinião original entre o emissor e o receptor.

    Pilha de relatórios impressos e laudas com anotações e marcações sutis sobre uma mesa de madeira clara em ambiente de pesquisa, iluminada por luz natural suave.
    Documentos impressos e relatórios passam por sucessivas revisões editoriais, processo em que a mediação textual pode alterar o tom e a intenção original dos autores.

    O modelo formal do pipeline de mediação

    Para transformar uma impressão subjetiva em uma grandeza auditável, o processo de comunicação mediada por inteligência artificial é modelado como uma cadeia de dois estágios: geração e extração. No primeiro estágio, um modelo recebe um tópico e um direcionamento específico de posicionamento humano, gerando um texto argumentativo correspondente. No segundo estágio, outro modelo examina o texto gerado e extrai qual postura foi articulada.

    Essa dinâmica opera matematicamente como uma transição de estados probabilística sobre cinco categorias ordinais estruturadas em escala do tipo Likert:

    • Totalmente favorável (Strongly favor)
    • Favorável (Favor)
    • Neutro (Neutral)
    • Desfavorável (Against)
    • Totalmente desfavorável (Strongly against)

    A probabilidade condicional de o estágio de extração apontar uma categoria j, dado que o texto original foi condicionado à categoria inicial i, gera uma matriz estocástica de transição. A fidelidade global do sistema é sintetizada pelo Stance Preservation Rate (SPR), definido formalmente como a probabilidade média de a postura extraída coincidir de modo idêntico com a postura original:

    SPR = (1 / K) * ∑ P(Postura Extraída = k | Postura Inicial = k)

    Quando o SPR atinge o valor 1,0, a mensagem preserva integralmente a intenção original. Índices baixos indicam que o sistema atua como um canal ruidoso que dispersa, amplifica ou inverte opiniões no trânsito.

    Os limites empíricos observados

    Testes executados em 112 proposições de debate revelaram taxas de retenção substancialmente inferiores às expectativas de consistência textual. Sob configuração padrão de parâmetros, nenhum dos nove modelos de linguagem avaliados conseguiu superar a marca de 0,7 de SPR. Relatórios preliminares apresentados em ambiente acadêmico na The Chinese University of Hong Kong (abre em nova aba) indicam taxas médias de preservação que oscilam abaixo de 60% em múltiplos contextos operacionais.

    O desvio não é aleatório; ele obedece a comportamentos estatísticos definidos. As distorções concentram-se em três padrões estruturais principais:

    Padrão de DesvioDinâmica de TransiçãoConsequência no Texto
    PolarizaçãoMigração de categorias moderadas para os extremos da escalaPosições matizadas tornam-se assertivas e agressivas
    Desvio da NeutralidadeAbandono do ponto central neutro em direção a posições pró ou contraIncapacidade algorítmica de manter ambivalência deliberada
    Inversão (Flipping)Transição direta entre espectros opostos (favorável para desfavorável)Contradição frontal com a intenção expressa pelo usuário

    Essas transições mostram que o comportamento do alinhamento estatístico das redes neurais tende a repelir formulações ambíguas e a forçar o discurso em direção a polos de maior densidade probabilística nos dados de treinamento.

    Avaliação de estratégias de mitigação

    Diversas heurísticas de engenharia de prompt foram submetidas a ensaios controlados para verificar se a correção do stance drift poderia ser alcançada sem reengenharia de arquitetura. Foram testadas abordagens como:

    1. Aprendizado em contexto (in-context learning com poucos exemplos direcionados)
    2. Extração múltipla acompanhada de embaralhamento das opções da escala Likert
    3. Instruções diretas de asserção imperativa no prompt de sistema
    4. Mecanismos iterativos de reflexão (reflection prompts)

    Quase todas as intervenções apresentaram ganhos marginais insuficientes para estabilizar a dispersão. O único avanço mensurável ocorreu ao aplicar prompts de reflexão associados a esforço médio de raciocínio no GPT-5.4. Sob essa configuração computacionalmente intensiva, o modelo elevou seu SPR para 0,775.

    O ganho de 0,775 não eliminou o problema estrutural: a polarização continuou respondendo pela maior fatia do desvio, retendo 0,119 de toda a massa de transição probabilística. Mesmo dedicando ciclos extras para verificação reflexiva de hipóteses antes de emitir a resposta, o sistema converteu quase 12% das mensagens com tonalidade moderada em manifestações extremistas.

    O gargalo dividido entre geração e extração

    Um impasse analítico comum reside em atribuir a perda de postura a um dos dois vértices do fluxo: o redator automático fracassa ao construir o argumento ou o classificador erra ao tentar interpretar o texto produzido?

    Uma investigação exploratória conduzida sobre uma proposição singular, comparando a extração via LLM com anotações realizadas por leitores humanos, indicou que a deterioração não pertence exclusivamente a uma ponta. O fenômeno surge tanto na etapa de geração quanto na de extração. O primeiro modelo suaviza ou endurece qualificadores semânticos de modo descalibrado; o segundo modelo, por sua vez, sobrepõe seus próprios vieses probabilísticos durante a leitura e classifica o tom com distorções adicionais. O canal de transmissão sofre atenuação simétrica nas duas interfaces.

    Essa partilha de erros afeta a forma como pipelines corporativos de síntese e extração são projetados. Se um assistente automatizado sumariza relatórios de comitês técnicos para tomada de decisão em políticas públicas, nuances cruciais de hesitação e ponderação podem se perder antes de atingirem a mesa executiva. Se outro modelo é encarregado de classificar feedback público em consultas democráticas, o risco de superdimensionar posicionamentos radicais ou apagar manifestações neutras torna-se um artefato matemático do próprio método de mediação.

    O controle sobre nuances de autoria, autonomia argumentativa e fidelidade semântica depende de limites de engenharia que os prompts atuais ainda não conseguem garantir. Modelos de linguagem processam mensagens como vetores dentro de paisagens estatísticas próprias, e essas geometrias raramente coincidem com a precisão exigida pelo julgamento humano.

    Filipe Mendes

    Ver perfil completo