No dia 1 de outubro de 2026, a Cloudflare apresentou seus primeiros modelos próprios de inteligência artificial treinados para tomada de decisão: o Clef e o Clef-flash. Ao contrário de assistentes virtuais comuns que criam textos longos, poemas ou redações, esses modelos foram criados com um propósito bem focado. Eles recebem informações e escolhem a resposta correta entre opções pré-definidas.
Essa categoria recebe o nome de modelo de decisão. Para entender a ideia com um exemplo do cotidiano, pense em uma prova de múltipla escolha. Enquanto uma inteligência artificial convencional escreveria uma redação dissertativa, o modelo de decisão atua como o corretor que analisa o enunciado e calcula a probabilidade matemática de cada alternativa estar certa, selecionando a opção mais adequada com extrema agilidade.
Como os modelos funcionam na prática
O funcionamento segue uma regra direta. O sistema recebe um estado inicial, que pode incluir texto simples, dados estruturados em formato JSON, imagens ou vídeo. Junto desse material, o usuário envia perguntas estruturadas. Essas perguntas podem ser de sim ou não, listas de múltipla escolha ou notas em formato de pontuação.
A tecnologia avalia o conjunto e atribui uma porcentagem de probabilidade para cada alternativa permitida. Na prática visual, ambos os modelos contam com suporte para processar até quatro imagens por requisição. Isso permite que uma empresa envie a foto de um recibo ou de um produto e pergunte se o documento é autêntico ou qual categoria de defeito aquele item apresenta.
Além disso, os dois modelos possuem compatibilidade total com a Jev-API e a System One API, da empresa Typesafe. Isso significa que sistemas criados para o ecossistema Jev podem adotar os modelos da Cloudflare sem necessidade de reescrever códigos complexos.
Velocidade, especificações técnicas e custos
A família foi dividida em duas opções para atender a necessidades distintas de processamento. O Clef é a versão principal, baseada na arquitetura Qwen3.8-27B com 27 bilhões de parâmetros, voltada para decisões com o máximo de precisão. Já o Clef-flash é baseado na arquitetura Qwen3.5-9B com 9 bilhões de parâmetros, projetado para situações em que a rapidez extrema é indispensável.
Parâmetros funcionam como pequenas conexões neurais que definem a capacidade de aprendizado do modelo. A janela de contexto de ambos comporta 65.536 tokens (cerca de 64 mil unidades de texto ou dados), o dobro da capacidade do Jev, que opera com 32 mil tokens. A latência, que é o tempo decorrido entre o envio da pergunta e a chegada da resposta, é um dos maiores destaques da novidade.

| Modelo | Parâmetros | Latência Mediana | Latência p95 | Custo por 1M tokens de entrada |
|---|---|---|---|---|
| Clef | 27 bilhões | 209,3 ms | 238,6 ms | $ 0,24 |
| Clef-flash | 9 bilhões | 38,8 ms | 122,4 ms | $ 0,09 |
| Jev | Não informado | 524,1 ms | 536,0 ms | Não informado |
Os números mostram que o Clef foi 2,5 vezes mais rápido que o concorrente Jev na mediana dos testes realizados pela Cloudflare, enquanto o Clef-flash foi 13 vezes mais veloz. Na cobrança do serviço, a Cloudflare definiu tarifas apenas para os dados de entrada, sem cobrança sobre tokens de resposta, já que os modelos realizam apenas uma etapa de pontuação direta sem gerar blocos de texto contínuo.
Em testes de tarefas reais, a família Clef liderou sete de dez avaliações de referência comparativas. No teste bancário BANKING77, que avalia a identificação correta de intenções de clientes, o Clef alcançou 94,20 pontos, o Clef-flash atingiu 90,93 pontos e o Jev marcou 79,74 pontos. No indicador geral de fluxos de trabalho da Typesafe, o Clef superou o Jev em três de quatro áreas analisadas: processamento de faturas, atendimento ao cliente e resposta a incidentes de segurança.
Como acessar e próximos passos
Os desenvolvedores contam com dois caminhos principais para usar as novidades. Pela internet, os modelos já estão disponíveis no catálogo do Cloudflare Workers AI (abre em nova aba) por meio das identificações @cf/cloudflare/clef e @cf/cloudflare/clef-flash. Para quem deseja hospedar e rodar a aplicação em servidores próprios, a empresa publicou os pesos de forma totalmente aberta no repositório Hugging Face sob a licença de código aberto Apache 2.0.
Junto ao lançamento, a empresa anunciou um serviço de ajuste fino por reforço, voltado a calibrar a ferramenta para tarefas empresariais específicas. No dia do lançamento, a executiva Michelle Chen detalhou nas redes sociais como essa personalização vai se integrar à infraestrutura da companhia:
também! anunciamos um novo produto de ajuste fino por reforço (RL). queremos ajudar a fazer o clef se adequar melhor aos seus casos de uso e mostrar a vocês nossa visão que estamos construindo com nossos blocos básicos existentes da @cloudflare: ai gateway para coleta de dados, contêineres para ambientes seguros de RL e workers ai para implantar modelos. entrem em contato se quiserem ser parceiros de design aqui.
Esse atendimento começou de forma personalizada com engenheiros especializados e ganhará uma modalidade de autoatendimento no futuro, permitindo que equipes técnicas integrem fluxos de classificação automatizada aos seus sistemas.

