O supervisor humano de um agente autônomo está virando uma tela com dois botões. Aprovar. Rejeitar. A interface é honesta sobre a geometria do problema: quando um agente executa tarefas por conta própria, alguém precisa decidir se cada ação prossegue, e essa decisão, comprimida ao mínimo, cabe em um bit. O que mudou em 2026 não foi o formato do botão. Foi a aparição de uma categoria de modelo cuja função declarada é julgar as ações do agente no lugar do humano, e devolver a pergunta apenas quando o próprio modelo conclui que não sabe respondê-la.
A causa tem nome e data. Em 15 de setembro de 2026, a TypeSafe lançou o Jev (abre em nova aba) em acesso antecipado, como API fechada, restrita a texto e a 32 mil tokens de contexto. Em 1º de outubro, a Cloudflare (abre em nova aba) respondeu com dois pesos abertos sob licença Apache 2.0, hospedados no Workers AI: o Clef, de 27 bilhões de parâmetros, e o Clef-flash, de 9 bilhões. No mesmo dia, um terceiro modelo entrou na classe: o Decider, de 2 bilhões, também aberto. Segundo a Digital Applied, todos usam bases Qwen. Entre o primeiro e o último lançamento, passaram-se dezesseis dias.
Um modelo que não fala
Um modelo de decisão não gera texto. Ele recebe um bloco de estado (o pacote de informações que descreve a situação: um ticket de suporte, a chamada de ferramenta que o agente propõe executar) e um esquema de perguntas com tipos fixos de resposta: sim ou não, uma escolha dentro de uma lista, uma nota em uma escala. Em um único forward pass, ou seja, uma única passada de inferência, o modelo devolve uma probabilidade para cada opção. Não há prosa para interpretar.

Essa é a diferença estrutural em relação ao modelo generativo. Se um LLM comum avaliasse a mesma ação, escreveria uma justificativa, e algum código teria de ler aquilo e convertê-lo em decisão. O erro voltaria pela porta da linguagem. O esquema tipado fecha essa porta: o que era um problema de leitura vira um problema de limiar. Acima de certa probabilidade, executa; numa faixa intermediária, pede humano; abaixo, descarta. Os números da faia ficam nas mãos de quem integra o modelo, não de quem o treinou.
Os diferenciais entre os três são prosaicos e relevantes. O Jev é fechado, lê só texto e aceita 32 mil tokens. O Clef aceita texto e imagens, com contexto de 64 mil tokens (65.536, na contagem exata da página do próprio Jev), e carrega 27 bilhões de parâmetros; o Clef-flash troca parte da capacidade por velocidade. Os diferenciais, aliás, são o argumento comercial da categoria, e o Workers AI é onde a Cloudflare os hospeda.
A aposta declarada
O resumo da aposta cabe numa frase da Cloudflare, dita no anúncio do Clef:
"A human does not necessarily need to be in the loop for agentic decisions anymore."
Em tradução livre: um humano não precisa mais, necessariamente, estar no loop das decisões tomadas por agentes. A empresa complementa que os agentes podem coletar contexto programaticamente, decidir e agir, ou adiar a decisão para uma pessoa quando necessário. O time de inteligência de ameaças da própria Cloudflare já testa o modelo para classificar sites. Repare no desenho da promessa: o humano não é removido do sistema. Ele é rebaixado a recurso de exceção, acionado quando um modelo acha que o caso merece gente.
Exceção é a palavra operativa. No desenho clássico de human-in-the-loop (a pessoa presente nos pontos críticos de um processo automatizado), o humano vistoria etapas. No desenho dos modelos de decisão, o humano comparece quando o software o convoca. A diferença parece pequena e é enorme: quem convoca passou a ser uma camada de software com latência de milissegundos.
Números de fornecedor, lidos com cuidado
Desconfie de benchmark publicado por quem lança o produto; a regra vale aqui. Ainda assim, os números da Cloudflare merecem leitura, porque incluem derrotas, e porque são reproduzidos até na página de comparação do próprio Jev, com a ressalva honesta de que são vendor-reported (relatados pelo fornecedor).
| Métrica | Jev | Clef | Clef-flash |
|---|---|---|---|
| BFCL Case, exatidão em chamada de função | 95,75 | 98,47 | 98,76 |
| BANKING-77, Macro-F1 em intenção de atendimento | 79,74 | 94,20 | - |
| When2Call, acurácia em decidir quando acionar ajuda | 80,97 | 72,37 | - |
| Latência mediana, medida pela Cloudflare | 524,1 ms | 209,3 ms | 38,8 ms |
| Workflow de processamento de faturas | 61,8 | 64,7 | - |
| Workflow de atendimento ao cliente | 76,0 | 76,3 | - |
A primeira leitura é cética, e justificada: quem mediu foi quem lançou. Mas o BANKING-77 é difícil de esconder, 79,74 de Macro-F1 contra 94,20 são 14,5 pontos, diferença de categoria, e vale revisar a desconfiança. Só que o When2Call a devolve com juros: 80,97 do Jev contra 72,37 do Clef, uma vantagem de 8,6 pontos para o modelo fechado exatamente no teste que mede a decisão de acionar ajuda externa. Os workflows de ponta a ponta, faturas e atendimento, terminam praticamente empatados. A Digital Applied registra ainda que, no índice agregado batizado com o nome do rival, o Jev Decision Index, a Cloudflare coloca o Clef à frente. Ganhar no índice que leva o nome do concorrente é uma cortesia rara no mercado.
A conclusão provisória não é "quem venceu". É que ninguém venceu por goleada: a categoria é real, a hegemonia ainda não.
O humano como exceção
O lugar da exceção aparece num guia publicado pela Hugging Face (abre em nova aba) para uso do Jev em agentes. O fluxo recomendado é uma sequência:
- Pedido do usuário
- Construtor de estado
- Permissões e regras duras
- Camada de decisão (rotear, pontuar risco, checar intenção, pedir revisão humana)
- Orquestrador
A pessoa está definida com precisão de engenharia: dentro da camada de decisão, como um destino possível, ao lado de "executar" e "descartar".
E aqui a observação aparentemente secundária volta. O When2Call, a métrica de saber quando pedir ajuda, é justamente onde o Clef fica pior nos números do próprio fornecedor. No desenho em que um modelo decide quando incomodar o humano, a habilidade crítica do guarda é a menos demonstrada. Ironia factual, disponível na tabela acima.
Decisão não é autorização
O mesmo guia estabelece um princípio que merece ser copiado para a parede: nenhum modelo deve ter, ao mesmo tempo, compreensão, decisão, autorização e execução. E acrescenta que o resultado do Jev não deve ser tratado como autorização. O modelo pode julgar se o usuário pediu mesmo a exclusão de um registro, ou se a requisição parece de alto risco; cabe a regras determinísticas e a sistemas de permissão decidir se a execução é permitida.
Isso redescreve o trabalho humano. O botão de aprovar não existe para o humano julgar a qualidade do modelo; existe como última camada de uma pilha de autorização. Quem aprova raramente vê o estado bruto. Vê o que o construtor de estado resolveu mostrar: um resumo, uma pergunta tipada, talvez uma pontuação de risco. O resto desaparece atrás de um botãozinho. E a qualidade da supervisão, que parecia propriedade do supervisor, revela-se propriedade do desenvolvedor: está no esquema, no limiar, na política.
O que cabe (e o que não cabe) em um botão
Reduzido a aprovar e rejeitar, o humano herda três problemas conhecidos. O primeiro é o automation bias, a tendência documentada de concordar com recomendações automáticas: depois de algumas centenas de aprovações, a gente aprova em lote, sem reler. O segundo é o deskilling, a perda da competência de ler o contexto completo, exatamente a competência que o botão pressupõe. O terceiro é o vácuo de responsabilidade: quando um agente aprovado causa dano, a cadeia tem muitos elos (quem desenhou o esquema, quem calibrou o limiar, quem clicou, quem treinou o modelo), e cada elo carrega um pedaço da decisão; nenhum carrega a decisão inteira.
Os 38,8 milissegundos do Clef-flash cabem num parêntese final. É o tempo que o modelo gasta para decidir. Uma pessoa leva mais do que isso só para mover o cursor até o botão. A assimetria é o argumento comercial da categoria e também o seu risco: o sistema fica rápido demais para a parte mais lenta do circuito, que é a pessoa.
Se a máquina já decide quando a nossa decisão é necessária, o botão de aprovação ainda é supervisão, ou é apenas a assinatura que o sistema coleta para se legitimar? Nenhum benchmark publicado até aqui mede essa diferença.
