Durante boa parte da recente história dos grandes modelos de linguagem, a chain-of-thought (CoT), a cadeia de raciocínio que o modelo escreve antes de responder, foi tratada como uma janela para dentro da máquina. Se o modelo escreve "primeiro verifico X, depois comparo com Y", assume-se que ele verificou X e comparou com Y. Essa assunção sustenta práticas inteiras: depuração de prompts, avaliação de raciocínio, monitoramento de segurança. A evidência acumulada dos últimos anos, no entanto, tem incomodado essa confortável leitura. Estudos anteriores ao paper aqui analisado já mostravam que o CoT pode ser alterado sem que a resposta final mude e que a justificativa escrita nem sempre corresponde ao cálculo que de fato determinou a saída.
O paper de Yihuai Hong, Shauli Ravfogel, Chen Zhao e Eunsol Choi (abre em nova aba), pesquisadores vinculados à New York University e à NYU Shanghai, publicado no arXiv em 30 de setembro de 2026 como pré-print, transforma esse desconforto difuso em algo que a engenharia consegue manipular: uma métrica e um procedimento de treino. O título resume a ambição: Making LLMs Say What They Think, fazer com que LLMs digam o que pensam. A sigla escolhida, CIA, de CoT-Interpretability Alignment, tem a ironia involuntária de colidir com uma agência de inteligência americana, mas o objeto aqui é outro: alinhar o texto do raciocínio com a computação interna do modelo.
O que a métrica CIA mede, exatamente
A ideia central é simples de enunciar e delicada de executar. Para cada resposta de um modelo, os autores extraem dois rótulos binários. O primeiro, B_INT, indica se o modelo usou internamente uma estratégia ou informação de referência, chamada de estratégia-ouro (gold strategy) S, detectada não pelo texto, mas por ferramentas de interpretabilidade: uma sonda linear (linear probe) ou uma intervenção causal aplicada às ativações internas. O segundo, B_CoT, indica se o CoT verbaliza essa mesma estratégia. A métrica CIA é o macro F1 entre esses dois rótulos: mede o quanto o acordo entre "usei internamente" e "declarei ter usado" se aproxima do ideal.

A definição de fidelidade usada no repositório é a mais direta possível: faith = 1[B_INT == B_CoT]. Se o modelo usou a estratégia e disse que usou, ou se não usou e não disse, há fidelidade naquele item. A escolha do macro F1, e não da acurácia simples, importa: com classes desbalanceadas, um modelo que sempre declara (ou nunca declara) poderia parecer fiel pela acurácia. O macro F1 penaliza esse tipo de jogo.
Há uma digressão necessária aqui, porque ela toca o ponto epistemicamente mais frágil do trabalho. A CIA não compara o CoT com "o que o modelo pensa" em algum sentido total; compara o CoT com o uso interno de uma estratégia específica, escolhida como ouro pelos autores, e detectada por sondas e intervenções que elas próprias são aproximações. Uma sonda linear pode capturar correlação sem capturar uso causal, e os autores mitigam isso com intervenções causais e um top-K=100 na sonda da tarefa de dois saltos, mas a cadeia de inferência tem elos que a comunidade de interpretabilidade discute há tempos. Dito isso, o recorte é honesto: em vez de prometer acesso à "mente" do modelo, o paper opera sobre uma pergunta verificável e discreta.
O detalhe técnico de como B_CoT é atribuído varia por tarefa. No caso das intervenções com dicas (hints), um modelo juiz, o Qwen2.5-32B-Instruct, avalia se o CoT menciona a dica. No caso do QA de dois saltos, a detecção interna passa pela sonda com top-K=100. Ferramentas auxiliares como o Tuned Lens, análise de atenção e features de viés (biasing features) aparecem como instrumentos de apoio no artigo completo, que tem 28 páginas, 9 figuras e 10 tabelas.
Três tarefas, três modelos, um resultado desconfortável
A avaliação cobre três cenários deliberadamente distintos, cada um expondo um tipo de tensão entre raciocínio interno e verbalização:
- TwoHopFact, QA factual de dois saltos: a estratégia-ouro envolve a recuperação e o uso da informação de ponte que conecta as duas perguntas. Aqui a pergunta implícita é se o modelo usa o fato intermediário que de fato usou para chegar à resposta.
- Hint Intervention sobre MMLU: uma dica é injetada no prompt. O
B_INTdetecta se a dica influenciou causalmente a resposta; oB_CoTverifica se o modelo admite isso no texto. - Multiplicação de inteiros de 2 dígitos: uma tarefa algorítmica, em que a estratégia interna de cálculo (por exemplo, a ordem de processamento dos dígitos) pode ser comparada com o procedimento declarado no CoT.
Os modelos avaliados são o Qwen3-8B, o Gemma2-9B-it e o Llama3.1-8B-Instruct, todos na faixa de 8 a 9 bilhões de parâmetros. O resultado basal merece ser lido com calma: os escores CIA variam de 44,8% a 75,9% dependendo da combinação de modelo e tarefa. Ou seja, no melhor caso, uma em cada quatro respostas apresenta divergência entre o que o modelo calculou internamente e o que ele escreveu; no pior, mais da metade. Os autores chamam isso de alinhamento limitado. Para qualquer equipe que use CoT como evidência em processos de decisão, auditoria ou segurança, esses números deveriam ao menos provocar uma pausa. Não são os modelos que falam, é claro, são números em três tarefas sob sondas específicas, mas a direção é clara e consistente entre os três modelos testados.
Pós-treinamento com recompensa dupla: como o paper tenta consertar o problema
Medir seria apenas diagnóstico se os autores não tivessem ido adiante. A segunda metade do paper experimenta pós-treinamento com uma função de recompensa que combina dois sinais: a acurácia da tarefa e a fidelidade paramétrica (parametric faithfulness), o faith definido acima. Três métodos entram na comparação: Rejection Sampling, DPO e GRPO. Os dois primeiros são os implementados no repositório público (abre em nova aba), como RS-B e DPO-A.
O RS-B (Rejection Sampling, variante B) é o mais simples dos dois. A cada prompt são gerados 16 respostas com temperatura 1.0 e top-p 1.0; mantêm-se apenas as respostas com faith = 1 e faz-se fine-tuning supervisionado sobre elas. Os hiperparâmetros documentados: taxa de aprendizado de 1e-6, decaimento em cosseno, warmup de 0.1, 1 ou 2 épocas.
O DPO-A (DPO, variante A) classifica as respostas pela soma acc + faith e forma pares preferenciais confrontando as 3 melhores contra as 3 piores de cada conjunto de rollouts. Os hiperparâmetros: beta 0.1, taxa de aprendizado 5e-7, 1 época, perda sigmoide.
| Método | Construção dos dados | Taxa de aprendizado | Épocas | Observação |
|---|---|---|---|---|
| RS-B | SFT só sobre respostas com faith = 1 | 1e-6, cosseno, warmup 0.1 | 1 a 2 | O mais direto, filtra por fidelidade |
| DPO-A | Pares top-3 vs bottom-3 por acc + faith | 5e-7 | 1 | β 0.1, perda sigmoide |
O resultado agregado que os autores reportam: o melhor método em cada configuração entrega um ganho relativo médio de 25,5% na métrica CIA, mantendo ou melhorando a acurácia da tarefa. Esse segundo detalhe é o mais carregado de consequência prática, porque a objeção óbvia ao treino por fidelidade seria a de que o modelo aprende a relatar melhor ao custo de raciocinar pior. Nos experimentos, isso não aconteceu, ao menos não nas métricas observadas.
A divisão de dados segue 60/20/20 para treino, validação e teste, com semente 42 na tarefa de dois saltos e 8888 nas outras duas. A avaliação usa decodificação com temperatura 0.7 e top-p 0.95, três sementes de teste (8888, 5555 e 7777) e bootstrap pareado com 1000 reamostragens para significância. Os experimentos originais rodaram em GPUs A100, H100 e H200 de 80 GB, segundo o repositório.
O achado mais interessante não é o número, é a assimetria entre as tarefas
Aqui o paper entrega algo que um resumo de números esconde. Os ganhos de fidelidade se transferem entre o QA de dois saltos e as intervenções com dicas no MMLU: os autores reportam transferência de +9 a +17 pontos entre essas duas tarefas. Mas não se transferem para a multiplicação, em nenhuma direção. Por quê?
A explicação qualitativa que os próprios autores oferecem muda a leitura do que o pós-treinamento está fazendo. Nas tarefas de dois saltos e de dicas, o treino altera principalmente como o modelo relata seu raciocínio: a computação interna continua parecida, mas o CoT passa a descrevê-la com honestidade. Na multiplicação, o efeito é outro: o pós-treinamento muda o raciocínio interno em si. A distinção é sutil e relevante. No primeiro caso, o modelo "mentia" por omissão ou invenção no relato; no segundo, o algoritmo interno era diferente do declarado, e o treino empurrou o cálculo para perto da descrição, não o contrário.
Há também uma objeção estrutural que a análise não pode deixar de registrar. O sinal de recompensa depende de sondas e juízes. O treino com recompensa contra um detector pode, em tese, ensinar o modelo a enganar o detector em vez de reportar com fidelidade, o problema clássico de reward hacking. Nada nos resultados sugere que isso tenha ocorrido, mas nada no desenho, tampouco, garante que não ocorra em escalas maiores ou com sondas menos confiáveis. O paper não testa modelos maiores que 9B, e é honesto reconhecer que a informação disponível não permite concluir como o método se comporta fora dessa faixa.
Reprodução: o que existe no repositório e o que falta
O repositório CIA-minimal-repro contém o código dos dois métodos de treino (RS-B e DPO-A) e a avaliação nas três tarefas, com os nomes dos modelos base, os hiperparâmetros, as sementes e o juiz de dicas documentados. É um nível de documentação acima da média para pré-prints. Mas a palavra "minimal" no nome é literal, e vale ler a descrição com atenção: o repositório tem apenas código. Não inclui dados, pesos de modelos, pesos das sondas nem resultados experimentais. Quem quiser reproduzir precisa regenerar rollouts, treinar sondas e reconstruir os datasets de treino, o que exige as GPUs de 80 GB citadas como ambiente original.
O status editorial merece menção explícita: é um pré-print, submetido ao arXiv em 30 de setembro de 2026, ainda sem revisão por pares, com 28 páginas e licença CC BY 4.0. A página no Hugging Face (abre em nova aba) registra a afiliação à NYU e o comentário do próprio autor principal, Yihuai Hong, que resume a pergunta motriz: os LLMs raciocinam do jeito que seus chains-of-thought dizem que raciocinam?
Por que isso interessa a quem constrói e audita sistemas com LLM
Para o público técnico, a utilidade do trabalho se dá em duas camadas. A primeira é a métrica como instrumento de auditoria. Hoje, equipes que precisam justificar decisões de modelos com base em CoT operam sem instrumento de medida: assumem o texto como evidência. A CIA, mesmo cobrindo apenas uma estratégia por vez, oferece um protocolo para testar essa suposição em domínios próprios, desde que haja como treinar sondas confiáveis para as estratégias relevantes. Isso é diretamente aplicável a monitoramento de raciocínio em agentes, a avaliações de segurança e a qualquer pipeline em que a explicação escrita tenha valor contratual ou regulatório.
A segunda camada é o pós-treinamento como alavanca. Se um modelo tende a relatar mal o que faz, o desenho RS-B/DPO-A com recompensa acc + faith é um ponto de partida replicável, com hiperparâmetros públicos e custo compatível com a faixa de 8B. O ganho médio relativo de 25,5% não é espetacular em termos absolutos, mas é consistente com manter a acurácia, que era o risco real do desenho.
E aqui a perspectiva pode ser invertida, porque talvez essa seja a leitura mais produtiva do paper. O trabalho de interpretabilidade costela ser consumido como pesquisa descritiva: abre-se o modelo, observa-se, publica-se. O que Hong, Ravfogel, Zhao e Choi fazem é transformar o instrumento de observação em sinal de treino, fechando um circuito que até aqui ficava aberto: a interpretabilidade deixa de ser apenas lente sobre o modelo e passa a ser especificação no laço de otimização. A pergunta que o paper responde é "os modelos dizem o que pensam?". A pergunta que ele deixa no ar é mais incômoda, e as evidências ainda não permitem respondê-la: quando otimizamos um modelo para concordar com nossa sonda, estamos tornando o modelo mais honesto ou apenas mais alinhado com a nossa capacidade atual de enxergá-lo? Entre essas duas coisas vai a diferença entre uma janela real e um vitral pintado com mais capricho.
Perguntas frequentes
O que é a métrica CIA proposta no paper?
CIA (CoT-Interpretability Alignment) é o macro F1 entre dois rótulos binários por resposta: B_INT, que indica uso interno da estratégia-ouro detectado por sonda linear ou intervenção causal, e B_CoT, que indica se o CoT verbaliza essa estratégia. Valores altos significam que o texto do raciocínio concorda com a computação interna detectada.
Quais modelos e tarefas foram avaliados?
Os autores testaram Qwen3-8B, Gemma2-9B-it e Llama3.1-8B-Instruct em três tarefas: QA factual de dois saltos (TwoHopFact), intervenções com dicas sobre MMLU e multiplicação de inteiros de 2 dígitos. Os escores CIA basais variaram de 44,8% a 75,9%.
O pós-treinamento melhora a fidelidade sem prejudicar a acurácia?
Nos experimentos reportados, sim. Com Rejection Sampling, DPO e GRPO usando acurácia da tarefa mais fidelidade paramétrica como recompensa, o melhor método por configuração alcançou ganho relativo médio de 25,5% na CIA mantendo ou melhorando a acurácia. Os ganhos se transferem entre QA de dois saltos e dicas (+9 a +17 pontos), mas não para a multiplicação.
O código e os dados do paper estão disponíveis para reprodução?
O repositório GitHub CIA-minimal-repro contém apenas código: os métodos RS-B e DPO-A e a avaliação nas três tarefas. Dados, pesos de modelos, pesos de sondas e resultados experimentais não estão incluídos, então a reprodução exige regenerar rollouts, treinar sondas e reconstruir os datasets, com hardware na faixa das GPUs A100/H100/H100 de 80 GB usadas nos experimentos originais.
