78%: é a proporção de gestores que, na pesquisa da agência de comunicação Highwire conduzida em agosto de 2026, admitiram ter usado IA para redigir, editar, resumir ou informar feedbacks e avaliações de desempenho nos 12 meses anteriores. A amostra tinha 1.034 profissionais corporativos americanos, em empresas com 100 ou mais funcionários, sendo 321 gestores e 713 colaboradores individuais. O número não mede satisfação nem intenção de adoção: mede quantas pessoas delegaram, ao menos em parte, a produção do documento mais delicado que escrevem no ano. Segundo a Highwire, a maioria dos gestores notou que a IA acelerou a preparação do feedback, embora a empresa reconheça não ter perguntado o que mais eles observaram.
A mesma pesquisa trouxe um segundo número, menor e mais revelador: apenas 16% dos funcionários não gestores disseram ter sido informados de que IA influenciou sua avaliação. Se 78% usam e 16% avisam, a maior parte do uso acontece sem que o avaliado saiba. Parte do hiato talvez caiba em nuances de interpretação, já que organizar ideias com um modelo pode não parecer, para todo gestor, "usar IA". Mas a distância entre os dois percentuais é grande demais para caber inteira nisso.
Para quem trabalha com sistemas, a questão central não é ética em abstrato, e sim de valor informativo. Uma avaliação de desempenho é um artefato de comunicação comprimida: ela condensa meses de observação em poucas frases, e a qualidade dessas frases é evidência de quanta atenção houve de fato. Quando um modelo escreve o resumo, a superfície fica melhor. A questão é se o conteúdo subjacente se mantém.

Três pesquisas, três contagens
Os dados disponíveis não convergem, e a divergência é instrutiva:
| Pesquisa | Quem respondeu | Uso de IA em avaliações | Sinal complementar |
|---|---|---|---|
| Highwire (ago/2026) | 1.034 profissionais corporativos (321 gestores) | 78% dos gestores usaram IA em feedbacks no último ano | 16% dos funcionários foram avisados |
| Headway (2026) | 1.000 gestores | 33% usaram IA para feedback ou avaliação, contra 41% um ano antes | 57% ensaiaram conversas difíceis com IA |
| Omni Calculator (jun/2026) | 913 funcionários | 27% identificaram IA na própria avaliação | 52% suspeitaram de feedback vindo de IA |
A diferença entre 78%, 33% e 27% é, ou melhor, parece ser, mais de método que de fato. A pesquisa da Omni Calculator (abre em nova aba), feita com 913 funcionários entre 8 e 15 de junho de 2026 via plataforma Prolific, pergunta pela detecção: você notou IA na sua avaliação? A da Headway pergunta pela confissão do gestor, com um recorte mais restrito de tarefa. A da Highwire usa a definição mais ampla, que inclui "informar" o feedback, o que captura desde colar o texto no ChatGPT até pedir sugestão de estrutura. Quanto mais larga a pergunta, maior o número; quanto mais dependente da percepção alheia, menor.
Nenhuma contagem é a "certa". O que resiste ao atravessar as três é o desenho básico: IA no meio do ciclo de feedback é comum, e aviso é raro. A pesquisa da Omni Calculator reforça o ponto por outra via: metade dos funcionários (50%) diz que o gestor já usou IA para responder pergunta ou tomar decisão que deveria ter resolvido sozinho, e 42% relatam que isso ocorreu mais de uma vez.
A hipótese confortável, e o que a complica
A hipótese natural, se você acredita em ferramentas de produtividade, é que a IA funciona como um editor: o gestor mantém o julgamento, ganha tempo e entrega algo mais claro. Os dados recebem essa hipótese pela metade. Na pesquisa da Highwire, 54% dos respondentes dizem que o feedback ficou mais específico e acionável. Mas 34% dizem que ficou mais genérico, e 32%, menos útil. Os grupos não são necessariamente os mesmos respondentes, então não há contradição formal; há apenas a constatação de que a experiência está dividida, e dividida de forma que não se explica por puro ruído.
A Omni Calculator mede o custo invisível: descobrir que a mensagem veio de um modelo faz 36% dos funcionários confiar menos no julgamento do gestor, 42% acharem o gestor menos competente, e 68% perceberem menos toque pessoal. São efeitos relatados, não medidas objetivas de qualidade. Ainda assim, eles indicam onde o problema realmente mora: não na velocidade, e sim na reação quando o processo aparece.
A análise de Caroline Castrillon na Forbes nomeia o risco com precisão: o feedback assistido por IA pode ficar mais polido sem ficar mais específico, preciso ou útil. Uma avaliação deveria dizer o que você faz bem, onde precisa melhorar e o que fazer em seguida. Polimento sem conteúdo é justamente o tipo de falha que um modelo linguístico produz com fluência, porque polimento é o que ele sabe fazer.
Há um padrão aqui que quem revisa código reconhece na hora. Um comentário genérico de review ("cuidado com a legibilidade") vale pouco; um comentário que aponta um arquivo, uma linha e uma alternativa vale muito, porque prova que alguém leu. A mesma lógica se aplica a avaliações de desempenho. Quem recebe feedback genérico não fica chateado apenas com o estilo: entende, corretamente, que a observação por trás dele era rasa ou inexistente.
Thalia-Maria Tourikis, especialista em prevenção de burnout da Headway, resume a objeção em termos de emoção:
"A perfeição da IA soa superficial e não tem o mesmo impacto."
Ela acrescenta que conversas difíceis podem até se organizar com ajuda de ferramentas, mas que confiar em automação o momento da interação perde justamente o que nele há de humano: confiança e empatia. É um argumento de coach, não um dado, mas os números de confiança da Omni Calculator dão a ele alguma sustentação empírica.
Revisando a hipótese
Vale revisar. A primeira leitura dos dados seria "gestores estão se tornando preguiçosos e o feedback piorou". Os números não sustentam essa versão forte: a maioria relata feedback mais específico, e a maior parte do efeito relatado é de ganho de tempo. A segunda leitura, mais fiel aos dados, é que a IA deslocou o problema de lugar. A qualidade média talvez não tenha caído; o que mudou é que a avaliação agora carrega menos evidência sobre o avaliador, e os avaliados sabem disso. Descobrir que a frase sobre a sua evolução técnica saiu de um modelo é, no mínimo, esquisito, e 36% das pessoas reagem reduzindo a confiança.
Um detalhe da pesquisa da Headway aponta para onde o uso vai além da redação: 31% dos gestores usaram IA para lidar com conflitos de equipe e 27% para redigir conversas desconfortáveis. Ou seja, o modelo não está apenas formatando o documento final; em uma parte relevante dos casos, está presente na preparação das conversas em que se decide promoção, plano de melhoria e desligamento. A pesquisa da Highwire registra que quase 1 em cada 4 funcionários já ensaia conversas difíceis com ferramentas de IA, o que mostra que a prática atravessa a hierarquia nos dois sentidos.
O que fazer com isso
Para quem recebe avaliação, há perguntas que se sustentam nos dados:
- Perguntar, diretamente, qual é a política de uso de IA em feedbacks. Se não existe, a pergunta em si já força a conversa que a pesquisa mostra não estar acontecendo.
- Tratar feedback genérico como informação sobre o processo do gestor, não sobre o seu desempenho, e pedir exemplos concretos até o texto deixar de caber em qualquer pessoa.
- Notar o contraste entre forma e conteúdo: fluência sem referência específica a projetos, incidentes ou entregas é o sintoma mais confiável de redação assistida.
Para tech leads e gestores técnicos, o desenho bom se resume a separar estrutura de conteúdo. IA ajuda em estrutura: esqueleto do documento, checklist de tópicos, tom adequado. Conteúdo, não: exemplos, métricas e próximos passos precisam vir da observação real, e o avaliado precisa saber o que veio de onde. O critério prático é simples de enunciar e caro de cumprir: se você não conseguir defender cada frase da avaliação sem abrir o chat do modelo, a avaliação não é sua.
Falta um horizonte regulatório definido. Na União Europeia, o AI Act enquadra sistemas de IA usados em decisões de emprego como alto risco, com obrigações de supervisão e transparência, mas o contorno exato do "sistema" que inclui um gestor redigindo com assistência de modelo ainda é território em aberto. Nos Estados Unidos, não há exigência equivalente. Por ora, a transparência depende de política interna, e a maioria das empresas está atrás da curva que os próprios números desenham: uso alto, aviso baixo.
A conclusão que os dados sugerem é menos dramática do que a manchete. A IA não destruiu a avaliação de desempenho; ela barateou a aparência de cuidado. Quem quiser que a avaliação continue valendo alguma coisa, dos dois lados da mesa, vai ter de reconstruir manualmente a parte que o modelo não consegue fabricar: a prova de que houve atenção.
