A Cloudflare (abre em nova aba) lançou na sexta-feira, 9 de outubro de 2026, o Clef-omni, um modelo de inteligência artificial que aceita áudio e vídeo como entrada, além de texto e imagens. No mesmo anúncio, a empresa cortou o preço do Clef-flash de US$ 0,09 para US$ 0,038 por milhão de tokens de entrada, uma redução de quase 60%, e informou que o modelo Clef ficou até duas vezes mais rápido. As três mudanças valem para quem usa os modelos na plataforma Workers AI e para quem baixa os pesos abertos no Hugging Face (abre em nova aba).
São três movimentos paralelos:
- Lançamento: o Clef-omni chega aceitando arquivos de áudio nos formatos WAV ou MP3 e vídeo em MP4 ou WebM, junto com texto e imagens. O preço de entrada é de US$ 0,15 por milhão de tokens de entrada.
- Corte de preço: o Clef-flash cai de US$ 0,09 para US$ 0,038 por milhão de tokens de entrada. Segundo a Cloudflare, o objetivo era deixá-lo mais barato que o Jev, um modelo concorrente citado na comparação.
- Velocidade: o Clef ficou de 1,7 a 2 vezes mais rápido na versão hospedada. A melhora não veio de pesos novos, mas de otimizações na camada que serve o modelo, incluindo o uso do framework SGLang na versão 0.5.22.
O que é um modelo de decisão
Antes dos números, convém entender o que a família Clef faz, porque ela não é um chatbot. Os três modelos da linha não escrevem texto livre. Eles recebem uma situação e um conjunto de perguntas com opções fixas, e devolvem, em uma única passagem, a probabilidade de cada resposta permitida para cada pergunta.
Um exemplo concreto ajuda. Se um sistema precisa classificar mensagens de clientes em categorias como "dúvida sobre cobrança", "pedido de reembolso" ou "elogio", o modelo não redige uma resposta: ele aponta a probabilidade de cada categoria e o software decide o que fazer com o resultado. Os benchmarks publicados pela Cloudflare sugerem exatamente esse tipo de uso, com testes de classificação de intenções bancárias e de atendimento.

Preços e janela de contexto
A cobrança dos modelos hospedados usa tokens, que são os pedaços em que o texto é dividido para o modelo processar. Tanto texto quanto imagem, áudio e vídeo são convertidos em tokens de entrada. A tabela abaixo resume os valores informados pela Cloudflare no anúncio:
| Modelo | Preço por milhão de tokens de entrada | Janela de contexto hospedada |
|---|---|---|
| Clef-flash | US$ 0,038 (antes US$ 0,09) | 24 mil tokens |
| Clef-omni | US$ 0,15 (lançamento) | 64 mil tokens |
| Clef | US$ 0,24 (sem mudança) | 64 mil tokens |
A janela de contexto é a quantidade de informação que o modelo consegue considerar em uma única requisição. Aqui há um detalhe que merece atenção: junto com o corte de preço, a janela hospedada do Clef-flash caiu de 64 mil para 24 mil tokens. A Cloudflare justifica a mudança com dados de uso próprios, segundo os quais apenas 0,24% das requisições passam de 24 mil tokens de entrada.
Quem precisar de contexto maior tem uma saída, mas com custo próprio: os pesos do Clef-flash no Hugging Face não mudaram e continuam treinados para suportar até 256 mil tokens quando auto-hospedados, ou seja, quando a empresa roda o modelo em servidores próprios em vez da plataforma da Cloudflare. O mesmo vale para o Clef-omni, cujo arquivo técnico indica um limite padrão de 64 mil tokens configurável.
Velocidade anunciada, com números que não coincidem
As alegações de latência, o tempo de resposta do modelo, vieram em dois documentos oficiais publicados no mesmo dia, e os números divergem. O post do blog da Cloudflare afirma que decisões só com texto levam cerca de 130 milissegundos na mediana, imagens cerca de 150 ms, clipes de áudio algumas centenas de milissegundos e um vídeo de 21 segundos com som cerca de 1,5 segundo. Já o registro de mudanças do Workers AI, também de 9 de outubro, cita cerca de 20 ms para texto, menos de 100 ms para imagem ou áudio e cerca de 300 ms para o mesmo clipe de vídeo.
Os dois números não podem estar certos ao mesmo tempo sob a mesma medida. Como se tratam de alegações da própria empresa, sem indicação clara das condições de teste que explicariam a diferença, o leitor deve tratá-las com cautela até que medições independentes existam. Ainda assim, a direção da melhora no Clef tem apoio em uma tabela de desempenho divulgada nos dois documentos: em requisições de cerca de 3,4 mil tokens, a mediana caiu de 616 ms para 305 ms, uma aceleração de 2 vezes.
Pesos abertos e o que a licença permite
O Clef-omni foi lançado com pesos abertos no Hugging Face, o repositório público de modelos, sob a licença Apache-2.0. Na prática, essa licença é das mais permissivas usadas em inteligência artificial: permite uso comercial, modificação do modelo, o chamado fine-tuning, e auto-hospedagem, sem exigir que o código do produto final seja aberto. Para empresas, isso significa que não há cláusula restringindo uso corporativo nos termos listados na página do modelo.
Há, porém, um requisito prático. A base do Clef-omni é o modelo Qwen3-Omni-30B-A3B-Instruct, uma arquitetura do tipo "mistura de especialistas", em que apenas uma parte dos parâmetros é ativada a cada processamento. São 30 bilhões de parâmetros no total, com cerca de 3 bilhões ativos. Segundo a ficha do modelo, os testes da própria Cloudflare usaram uma GPU H200, e o modelo precisa de cerca de 64 GB de memória de GPU no formato bfloat16. Em outras palavras: a licença é aberta, mas rodar o modelo fora da Workers AI exige hardware caro e fora do alcance de um computador comum.
Desempenho: números da própria empresa, sem avaliação independente
A Cloudflare publicou benchmarks atribuídos a ela mesma nos quais o Clef-omni lidera a família em três testes: 94,8 de macro-F1 no BANKING77, 97,7 no CLINC150+OOS e 57,8 no Amazon ESCI. Macro-F1 é uma medida que combina precisão e cobertura em tarefas de classificação. Nos mesmos testes internos, o modelo não lidera tudo: no BFCL, o Clef-flash marcou 98,76 contra 98,2 do Clef-omni, e no PhishNChips o melhor da família foi o Clef, com 79,60, contra 73,2 do novo modelo.
Vale registrar que nenhum dos dois documentos oficiais cita avaliação independente que confirme ou conteste esses resultados. Também vale lembrar que o modelo tinha acabado de ser publicado: a página do Hugging Face registrava 108 downloads no mês, o que é natural para um lançamento de horas, mas indica que ainda não há base de uso externo para julgá-lo em campo.
E no Brasil?
Os anúncios não trazem restrições regionais específicas nem preços em reais. O que se sabe é que o modelo está disponível no catálogo do Workers AI sob o identificador @cf/cloudflare/clef-omni, seguindo a mesma API dos outros modelos da família, e que os preços são publicados em dólar. Para um desenvolvedor brasileiro, o custo em moeda local vai depender do câmbio e das condições de cobrança da plataforma, que não foram detalhadas nos documentos do lançamento. Quem quiser evitar a conta variável da moeda tem o caminho dos pesos abertos, desde que tenha acesso ao hardware necessário descrito acima.
Perguntas frequentes
O Clef-omni serve para conversar com o usuário?
Não. Os modelos da família Clef não geram texto livre: eles recebem perguntas com opções fixas de resposta e devolvem a probabilidade de cada opção em uma única passagem. O uso típico é classificar, rotear e decidir dentro de softwares, não conversar.
Posso usar o Clef-omni de graça?
Os pesos estão abertos no Hugging Face sob licença Apache-2.0, o que permite baixar, modificar e usar comercialmente sem pagar licença. Rodar o modelo, porém, exige cerca de 64 GB de memória de GPU segundo a própria documentação, ou usar a versão hospedada no Workers AI, que cobra por token consumido.
Quanto custa o Clef-flash depois do corte?
US$ 0,038 por milhão de tokens de entrada na versão hospedada, ante US$ 0,09 antes. O corte veio acompanhado de uma redução da janela de contexto hospedada, que passou de 64 mil para 24 mil tokens, embora os pesos continuem suportando até 256 mil tokens se auto-hospedados.
Os resultados de desempenho são independentes?
Não. Os benchmarks divulgados nos anúncios de 9 de outubro são atribuídos à própria Cloudflare, e nenhum dos documentos cita avaliação independente. Além disso, os números de latência divergem entre o blog da empresa e o registro do Workers AI, o que reforça a necessidade de medições externas.

