Artigo

    Jev e Kev comparadas lado a lado

    Um teste lado a lado colocou o modelo fechado Jev e a reprodução aberta Kev atrás do mesmo endpoint. A acurácia fica próxima em tarefas estreitas, mas a contagem de tokens e o desempenho em conhecimento geral divergem entre as medições.

    Filipe Mendes

    Duas estações de trabalho lado a lado em um escritório de tecnologia, com monitores exibindo painéis de comparação de modelos e anotações em papel sobre a mesa
    Estações lado a lado usadas no teste que comparou o modelo fechado Jev e a reprodução aberta Kev sob o mesmo endpoint

    A TypeSafe lançou o Jev (abre em nova aba) em 15 de setembro de 2026. Ele não é um modelo de conversa: em vez de escrever texto, lê um bloco de estado, como um ticket de suporte, e responde perguntas com formatos definidos, devolvendo uma probabilidade para cada alternativa. A empresa não publicou a arquitetura nem os dados de treinamento. Em cerca de uma semana surgiram perto de 30 reproduções abertas, reconstruídas apenas a partir do contrato público da interface de programação, a API.

    Uma dessas cópias é o Kev 4B (abre em nova aba), de Jared Palmer, uma das mais discutidas. Para saber o quão perto uma reprodução chega do original, um teste lado a lado hospedou o Kev na União Europeia e o colocou atrás do mesmo endereço de rede que o Jev já usava. Depois, os dois receberam exatamente as mesmas perguntas. O resultado foi publicado em 25 de setembro de 2026.

    O que é um modelo de decisão

    A ideia central é simples. Muitas tarefas de software não precisam de texto: um agente precisa apenas decidir para qual equipe mandar um pedido, se um documento é relevante ou se uma ação deve ser escalada. Um modelo de decisão recebe o estado atual e perguntas com tipos de resposta. O tipo Choice pede a escolha entre opções. O tipo Score pede uma nota em uma escala ordenada. O tipo Noul pede um sim ou não, com a probabilidade associada. O modelo devolve a resposta já estruturada, sem gerar frases que o programa teria de interpretar depois.

    É como a diferença entre pedir a alguém que escreva um parágrafo explicando se um cliente quer reembolso e entregar um formulário de múltipla escolha para essa mesma pessoa marcar. O formulário é mais rápido de preencher e de conferir. O preço de lista registrado no teste era de US$ 0,042 por milhão de tokens de entrada, com a saída gratuita nos dois modelos.

    O que a comparação encontrou

    Em 362 perguntas escritas depois do lançamento dos dois modelos, a acurácia dos dois ficou dentro de 2 pontos percentuais em todas as tarefas, uma diferença considerada dentro da margem de erro para um conjunto desse tamanho. A velocidade também foi parecida: o Kev respondeu em cerca de 220 milissegundos e o Jev em cerca de 275 milissegundos. A diferença mais concreta apareceu na contagem de tokens: para a mesma solicitação e o mesmo preço de lista, o Jev soma cerca de 257 tokens de entrada extras fixos em cada chamada.

    Para evitar que o teste usasse dados já vistos no treinamento, as perguntas vieram de textos publicados depois do lançamento dos dois modelos: artigos científicos recentes, perguntas de comunidades de programação e issues do GitHub. O Kev foi treinado em vários conjuntos públicos conhecidos, como AG News, Banking77, BoolQ, MNLI, SST-5, avaliações do Yelp, IMDb e Amazon, DBpedia, TREC, ARC, OpenBookQA e CommonsenseQA. Por isso, usar esses conjuntos daria vantagem ao Kev.

    Divergências entre as medições

    Nem todo relato aponta para o mesmo lado. Uma medição relata que o Kev 9B marcou 0,837 contra 0,857 do Jev em um conjunto de fontes novas, mas venceu no roteamento de tickets de suporte, com 0,952 contra 0,897. Nessa mesma medição, um benchmark independente de 49 tarefas de classificação colocou o Jev em 0,966 de acurácia macro contra 0,704 do melhor participante aberto. Já uma comparação com o Nimble, do Bespoke Labs, registrou 90,12% para o Nimble e 93,21% para o Jev em um conjunto de 324 exemplos. Os tamanhos do Kev também divergem entre os relatos: há menção a versões de 0,5B, 0,6B, 4B e 8B, e a versões de 0,8B, 4B e 9B.

    A base usada pelo Kev é descrita de formas diferentes. Um relato afirma que ele parte do Qwen3.5-4B-Base, com uma pequena cabeça de leitura. Outro diz que ele parte do Qwen2.5-0.5B, com um adaptador LoRA, técnica que treina poucos parâmetros extras em vez do modelo inteiro. Um terceiro afirma que ele usa pesos Qwen3.5 nas versões de 0,8B, 4B e 9B. Em comum, os relatos descrevem licença Apache 2.0 e compatibilidade com a API tipada do Jev.

    Alternativas abertas

    Além do Kev, o campo aberto inclui outras propostas. O Laya (abre em nova aba) é um modelo de decisão multilíngue de cerca de 421 milhões de parâmetros, instalável por um comando, com versão que cobre mais de 100 idiomas. O SemIf (abre em nova aba) não treina modelo nenhum: lê as probabilidades diretamente de um Qwen3.5-4B congelado. O NanoJev (abre em nova aba) é um modelo de 0,6B voltado a laços de controle em tempo real. E o Nimble (abre em nova aba), do Bespoke Labs, usa Qwen3.5-9B com adaptador LoRA e dados de treinamento públicos.

    O que isso significa na prática

    A conclusão geral é que o campo aberto reproduz bem a interface do Jev, mas só em parte a qualidade. A TypeSafe afirma que seu modelo é de 20 a 200 vezes mais rápido e de 40 a 400 vezes mais barato em fluxos avaliados, mas essa é uma alegação da empresa, não um número verificado de forma independente. Para quem precisa de decisões frequentes e de custo controlado, as alternativas abertas oferecem acesso aos pesos, à hospedagem e ao ajuste fino. Para decisões que exigem conhecimento amplo ou raciocínio em várias etapas, os relatos indicam que a distância ainda é grande.

    Fontes

    0 comentários

    Comentários

    Faça login para comentar neste artigo.

    Nenhum comentário ainda. Seja o primeiro!