Pular para o conteúdo
    Artigo

    Aprovar ou rejeitar: Jev e Clef encolhem a supervisão humana de agentes de IA

    Modelos de decisão como Jev, Clef e Clef-flash transformam a supervisão de agentes autônomos em probabilidades e rebaixam o humano a camada de autorização. A análise examina a arquitetura recomendada, os benchmarks de fornecedor e os limites do botão de aprovação.

    Filipe Mendes

    7 de out. de 2026 · 7 min de leitura

    Seguir no Google
    Sala de controle escura com painéis eletrônicos desligados ao fundo; sob um único facho de luz fria, uma pessoa de costas, ombros curvados, sentada diante de um console metálico com dois grandes botões físicos, um vermelho e um verde, com a
    Em uma sala de comando cada vez mais vazia, decidir entre aprovar ou rejeitar cabe a um único gesto humano — e a um botão.

    O supervisor humano de um agente autônomo está virando uma tela com dois botões. Aprovar. Rejeitar. A interface é honesta sobre a geometria do problema: quando um agente executa tarefas por conta própria, alguém precisa decidir se cada ação prossegue, e essa decisão, comprimida ao mínimo, cabe em um bit. O que mudou em 2026 não foi o formato do botão. Foi a aparição de uma categoria de modelo cuja função declarada é julgar as ações do agente no lugar do humano, e devolver a pergunta apenas quando o próprio modelo conclui que não sabe respondê-la.

    A causa tem nome e data. Em 15 de setembro de 2026, a TypeSafe lançou o Jev (abre em nova aba) em acesso antecipado, como API fechada, restrita a texto e a 32 mil tokens de contexto. Em 1º de outubro, a Cloudflare (abre em nova aba) respondeu com dois pesos abertos sob licença Apache 2.0, hospedados no Workers AI: o Clef, de 27 bilhões de parâmetros, e o Clef-flash, de 9 bilhões. No mesmo dia, um terceiro modelo entrou na classe: o Decider, de 2 bilhões, também aberto. Segundo a Digital Applied, todos usam bases Qwen. Entre o primeiro e o último lançamento, passaram-se dezesseis dias.

    Um modelo que não fala

    Um modelo de decisão não gera texto. Ele recebe um bloco de estado (o pacote de informações que descreve a situação: um ticket de suporte, a chamada de ferramenta que o agente propõe executar) e um esquema de perguntas com tipos fixos de resposta: sim ou não, uma escolha dentro de uma lista, uma nota em uma escala. Em um único forward pass, ou seja, uma única passada de inferência, o modelo devolve uma probabilidade para cada opção. Não há prosa para interpretar.

    Painel industrial em parede metálica escura à noite, com botão verde apagado, indicador âmbar aceso no centro e botão vermelho desgastado à direita; ao fundo, cadeira de escritório vazia desfocada na penumbra.
    Na sala de operações vazia, o indicador âmbar aceso entre os botões de aprovação e rejeição resume o novo papel humano: autorizar apenas quando o sistema convocar.

    Essa é a diferença estrutural em relação ao modelo generativo. Se um LLM comum avaliasse a mesma ação, escreveria uma justificativa, e algum código teria de ler aquilo e convertê-lo em decisão. O erro voltaria pela porta da linguagem. O esquema tipado fecha essa porta: o que era um problema de leitura vira um problema de limiar. Acima de certa probabilidade, executa; numa faixa intermediária, pede humano; abaixo, descarta. Os números da faia ficam nas mãos de quem integra o modelo, não de quem o treinou.

    Os diferenciais entre os três são prosaicos e relevantes. O Jev é fechado, lê só texto e aceita 32 mil tokens. O Clef aceita texto e imagens, com contexto de 64 mil tokens (65.536, na contagem exata da página do próprio Jev), e carrega 27 bilhões de parâmetros; o Clef-flash troca parte da capacidade por velocidade. Os diferenciais, aliás, são o argumento comercial da categoria, e o Workers AI é onde a Cloudflare os hospeda.

    A aposta declarada

    O resumo da aposta cabe numa frase da Cloudflare, dita no anúncio do Clef:

    "A human does not necessarily need to be in the loop for agentic decisions anymore."

    Em tradução livre: um humano não precisa mais, necessariamente, estar no loop das decisões tomadas por agentes. A empresa complementa que os agentes podem coletar contexto programaticamente, decidir e agir, ou adiar a decisão para uma pessoa quando necessário. O time de inteligência de ameaças da própria Cloudflare já testa o modelo para classificar sites. Repare no desenho da promessa: o humano não é removido do sistema. Ele é rebaixado a recurso de exceção, acionado quando um modelo acha que o caso merece gente.

    Exceção é a palavra operativa. No desenho clássico de human-in-the-loop (a pessoa presente nos pontos críticos de um processo automatizado), o humano vistoria etapas. No desenho dos modelos de decisão, o humano comparece quando o software o convoca. A diferença parece pequena e é enorme: quem convoca passou a ser uma camada de software com latência de milissegundos.

    Números de fornecedor, lidos com cuidado

    Desconfie de benchmark publicado por quem lança o produto; a regra vale aqui. Ainda assim, os números da Cloudflare merecem leitura, porque incluem derrotas, e porque são reproduzidos até na página de comparação do próprio Jev, com a ressalva honesta de que são vendor-reported (relatados pelo fornecedor).

    MétricaJevClefClef-flash
    BFCL Case, exatidão em chamada de função95,7598,4798,76
    BANKING-77, Macro-F1 em intenção de atendimento79,7494,20-
    When2Call, acurácia em decidir quando acionar ajuda80,9772,37-
    Latência mediana, medida pela Cloudflare524,1 ms209,3 ms38,8 ms
    Workflow de processamento de faturas61,864,7-
    Workflow de atendimento ao cliente76,076,3-

    A primeira leitura é cética, e justificada: quem mediu foi quem lançou. Mas o BANKING-77 é difícil de esconder, 79,74 de Macro-F1 contra 94,20 são 14,5 pontos, diferença de categoria, e vale revisar a desconfiança. Só que o When2Call a devolve com juros: 80,97 do Jev contra 72,37 do Clef, uma vantagem de 8,6 pontos para o modelo fechado exatamente no teste que mede a decisão de acionar ajuda externa. Os workflows de ponta a ponta, faturas e atendimento, terminam praticamente empatados. A Digital Applied registra ainda que, no índice agregado batizado com o nome do rival, o Jev Decision Index, a Cloudflare coloca o Clef à frente. Ganhar no índice que leva o nome do concorrente é uma cortesia rara no mercado.

    A conclusão provisória não é "quem venceu". É que ninguém venceu por goleada: a categoria é real, a hegemonia ainda não.

    O humano como exceção

    O lugar da exceção aparece num guia publicado pela Hugging Face (abre em nova aba) para uso do Jev em agentes. O fluxo recomendado é uma sequência:

    1. Pedido do usuário
    2. Construtor de estado
    3. Permissões e regras duras
    4. Camada de decisão (rotear, pontuar risco, checar intenção, pedir revisão humana)
    5. Orquestrador

    A pessoa está definida com precisão de engenharia: dentro da camada de decisão, como um destino possível, ao lado de "executar" e "descartar".

    E aqui a observação aparentemente secundária volta. O When2Call, a métrica de saber quando pedir ajuda, é justamente onde o Clef fica pior nos números do próprio fornecedor. No desenho em que um modelo decide quando incomodar o humano, a habilidade crítica do guarda é a menos demonstrada. Ironia factual, disponível na tabela acima.

    Decisão não é autorização

    O mesmo guia estabelece um princípio que merece ser copiado para a parede: nenhum modelo deve ter, ao mesmo tempo, compreensão, decisão, autorização e execução. E acrescenta que o resultado do Jev não deve ser tratado como autorização. O modelo pode julgar se o usuário pediu mesmo a exclusão de um registro, ou se a requisição parece de alto risco; cabe a regras determinísticas e a sistemas de permissão decidir se a execução é permitida.

    Isso redescreve o trabalho humano. O botão de aprovar não existe para o humano julgar a qualidade do modelo; existe como última camada de uma pilha de autorização. Quem aprova raramente vê o estado bruto. Vê o que o construtor de estado resolveu mostrar: um resumo, uma pergunta tipada, talvez uma pontuação de risco. O resto desaparece atrás de um botãozinho. E a qualidade da supervisão, que parecia propriedade do supervisor, revela-se propriedade do desenvolvedor: está no esquema, no limiar, na política.

    O que cabe (e o que não cabe) em um botão

    Reduzido a aprovar e rejeitar, o humano herda três problemas conhecidos. O primeiro é o automation bias, a tendência documentada de concordar com recomendações automáticas: depois de algumas centenas de aprovações, a gente aprova em lote, sem reler. O segundo é o deskilling, a perda da competência de ler o contexto completo, exatamente a competência que o botão pressupõe. O terceiro é o vácuo de responsabilidade: quando um agente aprovado causa dano, a cadeia tem muitos elos (quem desenhou o esquema, quem calibrou o limiar, quem clicou, quem treinou o modelo), e cada elo carrega um pedaço da decisão; nenhum carrega a decisão inteira.

    Os 38,8 milissegundos do Clef-flash cabem num parêntese final. É o tempo que o modelo gasta para decidir. Uma pessoa leva mais do que isso só para mover o cursor até o botão. A assimetria é o argumento comercial da categoria e também o seu risco: o sistema fica rápido demais para a parte mais lenta do circuito, que é a pessoa.

    Se a máquina já decide quando a nossa decisão é necessária, o botão de aprovação ainda é supervisão, ou é apenas a assinatura que o sistema coleta para se legitimar? Nenhum benchmark publicado até aqui mede essa diferença.

    Filipe Mendes

    Ver perfil completo