"We squeezed it into a 7.89 GB file that runs on standard llama.cpp."
A frase é da equipe da Underdog (abre em nova aba), publicada em 7 de outubro de 2026, e resume o produto: sete vezes menos espaço que o modelo original. A segunda parte da alegação é a que chama atenção. Segundo a própria empresa, o Saluki 27B, uma quantização 2-bit do Qwen3.8-27B, supera o modelo completo de cerca de 54 GB em tool calling, a capacidade de invocar ferramentas externas de forma estruturada (funções, APIs, consultas a banco de dados). Se correto, o resultado contraria a intuição comum de que compressão agressiva custa capacidade.
O modelo está disponível no Hugging Face (abre em nova aba) sob licença Apache 2.0, que permite uso comercial sem restrições declaradas no cartão do modelo. A pergunta que interessa a quem desenvolve é outra: a vitória em tool calling foi medida como? E quanto do desempenho original sobreviveu ao aperto?
De onde vem o arquivo de 7,89 GB
Quantização é a técnica de armazenar os pesos do modelo com menos bits por parâmetro. O original usa BF16 (16 bits por peso, ponto flutuante); o Saluki usa um esquema de cerca de 2 bits, com alguma variação por camada. O formato é GGUF, o contêiner padrão do ecossistema llama.cpp, e o cartório do arquivo diz que ele roda em versões não modificadas dessa biblioteca, sem código proprietário no meio do caminho.

Segundo o artigo do Marktechpost de 9 de outubro de 2026, o produto empilha três camadas. Na base, o Qwen3.8-27B: modelo denso de 27 bilhões de parâmetros, 64 camadas, atenção linear Gated DeltaNet misturada com atenção com portas, contexto nativo de 262.144 tokens, conforme o cartão do modelo da Qwen. No meio, o GGUF do ISTA-DASLab, cujo menor arquivo IQ2_XS ocupa 8,4 GB a 2,50 bits por peso. No topo, uma passada própria da Underdog que chega a 7,89 GB, o arquivo batizado de IQ2-mix, com etiqueta imatrix (matriz de importância, uma calibração que informa quais pesos merecem mais precisão). A receita dessa passada final não foi publicada.
Isso importa. O valor do produto está exatamente na etapa cujo método a empresa não abriu: o que distinguiria o Saluki de uma quantização 2-bit qualquer é um ajuste específico para preservar tool calling, e esse ajuste não pode ser auditado nem reproduzido por terceiros. Quem baixa o arquivo pode verificar o tamanho e o funcionamento. Quem quiser verificar o porquê do desempenho, não tem como, por enquanto.
O benchmark que sustenta a vitória, e seus limites
A alegação central se apoia no Underdog Bench, descrito nos dois documentos da empresa com detalhe razoável. São 120 tarefas extraídas do BFCL v4 (Berkeley Function Calling Leaderboard, tabela pública de referência em chamadas de função), 24 em cada uma das cinco categorias de uso de ferramentas, congeladas em 27 de setembro de 2026, antes de qualquer modelo avaliado ter passado pelo teste. Durante a avaliação, o modo de raciocínio (thinking) fica desligado e a temperatura em zero, o que reduz variabilidade.
Os números, no mesmo harness (o mesmo código de avaliação e pontuação):
| Indicador | Valor (tarefas de 120) |
|---|---|
| Saluki 2-bit (7,89 GB) | 88 |
| Mia 2-bit EXL3 (9,1 GB) | 85 |
| Qwen3.8-27B completo (~54 GB) | 84 |
| ISTA 2-bit IQ2_XS (8,4 GB) | 76 |
| Ternary Bonsai 2 (5,95 GB) | 70 |
Fonte: Underdog, Underdog Bench (BFCL v4, thinking off, temperatura 0), out/2026
Quatro pontos de vantagem sobre o original, portanto, e uma margem sobre outras quantizações 2-bit do mercado. A empresa própria modera a leitura: a página diz que 120 tarefas é um teste modesto e que parte da diferença provavelmente é variação de execução em execução. Essa confissão é incomum e conta a favor da credibilidade; quatro tarefas em 120 pode ser ruído.
Há um segundo dado, mais difícil de descartar. Em 100 tarefas paralelas do BFCL v4 (várias chamadas de ferramenta na mesma resposta), com o verificador oficial em pontuação estrita: Mia 69, Saluki 42, modelo completo 35, Ternary Bonsai 2 em 11. Aqui a vantagem é de sete pontos, e a distribuição dos concorrentes sugere que não é acaso puro. O cartão do modelo reconhece, porém, que cerca de um quinto das respostas do Saluki em chamadas paralelas tem pequenos deslizes de formatação. Relaxando a tolerância a esses deslizes, o Saluki sobe para 55 de 100. O modelo completo não recebeu esse tratamento mais tolerante nos dados públicos, o que torna a comparação nas duas regras assimétrica.
O contraponto consistente aparece quando se olha quem fez o quê. A empresa que construiu o modelo também construiu o benchmark, o harness e a regra de congelamento. O congelamento anterior ao teste elimina o ajuste fino de respostas ao exame, mas não substitui replicação independente: até a data desta análise, não há confirmação de terceiros para as notas do Saluki. O Marktechpost observa ainda que cada fornecedor usa seu próprio harness, o que impede comparar as notas do Saluki com as pontuações públicas do modelo completo em outras suítes. Um exemplo concreto: o 91,5 do original no IFEval veio do cartão do modelo Ternary Bonsai 2, de outro harness, e o número público não informa se é pontuação loose ou strict. É com esse 91,5 que o 93,5 do Saluki é frequentemente juxtaposto.
A defesa mais robusta da alegação não é o placar, e sim a sobreposição: das 84 tarefas que o modelo completo resolveu, o Saluki ainda resolve 76 (90%). A compressão não destruiu a competência; ela preservou a maior parte dela. "Supera" é a palavra da empresa. "Retém 90% num teste modesto" é o que os dados sustentam com mais segurança.
Onde a versão 2-bit perde, e por quanto
Aqui o quadro é mais bem documentado do que a vitória. O cartão do modelo lista as quedas:
| Benchmark | Saluki | Completo | Mesma metodologia? |
|---|---|---|---|
| AIME 2025 (avg@4) | 79,2 | 96,7 | Não |
| AIME 2026 (avg@4) | 80,0 | 94,6 | Não |
| MuSR | 67,5 | 79,6 | Não |
| MBPP+ | 78,0 | 83,9 | Não |
| IFEval prompt-loose | 93,5 | 91,5 | Não |
| IFBench prompt-loose | 72,7 | 71,0 | Não |
| Underdog Bench (de 120) | 88 | 84 | Sim |
| SWE-bench Verified (de 50) | 30 | 33 | Sim |
Fonte: cartão do modelo no Hugging Face e página da Underdog, outubro de 2026.
A média de retenção declarada é de 96% ao longo de nove benchmarks. O detalhe está no plural: 96% de média esconde perdas concentradas. Em matemática de competição (AIME), o Saluki mantém 82% a 85% da nota do original, segundo o próprio cartão; o resumo do Marktechpost fala em quedas de 12 a 18 pontos em matemática competitiva e raciocínio de múltiplas etapas. Em MuSR, uma suíte de raciocínio narrativo em várias etapas, a perda é de 12 pontos. Em MBPP+, geração de código Python, são quase 6.
O padrão faz sentido mecânico. Quantização introduz erro nos pesos; erro pequeno por passo se acumula ao longo de cadeias longas de inferência. Tool calling tem saída estruturada e curta, com validadores que checam o formato; uma cadeia de raciocínio matemático de dezenas de passos amplifica cada desvio. A empresa parece ter negociado exatamente essa troca, protegendo o que cabe em arquivo pequeno e cedendo no que exige profundidade.
O ponto mais fraco declarado é outro: enigmas de instrução letra a letra, tarefas de compliance literal com o texto do pedido. E o modo de raciocínio (thinking) vem ligado por padrão, com alternância por requisição, o mesmo comportamento do Qwen3.8 original.
O que é preciso para rodar
O arquivo principal é apenas texto. Quem quiser visão precisa de um segundo arquivo mmproj, em F16 (928 MB) ou Q8_0 (629 MB); sem ele, o modelo não recebe imagens, e a versão de 7 de outubro não processa visão de outra forma.
Para o mercado brasileiro, o dado relevante é de acesso, não de preço: rodar um modelo de 27 bilhões de parâmetros em hardware de consumo, sem aluguel de GPU em nuvem e sem envio de dados a API externa, muda a equação para agentes locais. Não há preços de varejo brasileiros confirmados nas fontes deste texto, e não faz sentido transportar tabelas de preços estrangeiras; o que se pode afirmar é que um arquivo de 7,89 GB cabe em SSD comum e que inferência em CPU é tecnicamente viável, embora lenta em termos gerais, pois o desempenho em CPU depende de cada máquina.
Quem deve trocar, e sob quais condições
A decisão prática tem três variáveis: carga de trabalho, hardware e tolerância a erro.
Faz sentido quando o sistema é dominado por orquestração de ferramentas: um agente que consulta calendário, CRM, banco interno, com respostas curtas e formatadas. Nesse perfil, os dados dizem que o Saluki não apenas retém a capacidade do original como talvez a supere, mesmo considerando a ressalva do benchmark próprio. Quem roda em laptop de 16 GB ganha uma categoria de aplicação que antes pedia GPU de servidor.
Quase faz sentido em correção de código: no SWE-bench Verified com 50 issues, o Saluki fechou 30 contra 33 do original, e corrigiu 27 das 33 que o modelo completo resolvia. A diferença existe, é pequena e medida no mesmo harness.
Não faz sentido quando a carga é matemática de competição, tutoria que exige raciocínio profundo ou problemas de múltiplas etapas com margem apertada de erro. A queda de 17 pontos no AIME 2025 não é ruído; é uma mudança de patamar. Nesse caso, as alternativas são pagar a API do modelo completo, usar uma quantização mais generosa (a Mia, a 2,0 bits por peso em 9,1 GB, fica entre o Saluki e o original no Underdog Bench) ou aceitar o modelo completo quando a memória existir.
Há uma condição transversal: o rigor do validador. Se o orquestrador rejeita qualquer desvio de formato em chamadas paralelas, um em cada cinco respostas do Saluki pode falhar por deslize pequeno. Se o parser tolera variações triviais, parte dessas falhas desaparece no dado da própria empresa (42 passa a 55 de 100). Isso é decisão de arquitetura do lado do usuário, não do modelo.
Vale a pena? O que os dados sustentam
O arquivo é real, o download é aberto, a licença permite uso comercial, e o tamanho de 7,89 GB pode ser conferido por qualquer pessoa com llama.cpp instalado. Essa parte do argumento da Underdog não depende de confiança.
A parte que depende é o verbo "supera". A vitória vem de um benchmark desenhado pela própria empresa, com congelamento honesto do conjunto de tarefas e com a ressalva, escrita pela própria equipe, de que o teste é modesto e a margem pode ser variação estatística. Nenhum laboratório independente replicou os números até aqui. A leitura sóbria é que o Saluki provavelmente retém a maior parte da competência em tool calling do original, que em chamadas paralelas a vantagem sobre o modelo completo é plausível, e que "supera" é uma formulação de marketing construída em cima de uma diferença de quatro tarefas. A leitura otimista exigiria replicação de terceiros, que não existe no momento.
O contraste do início se fecha com ele mesmo: "we squeezed it into 7,89 GB". O aperto foi bem-sucedido, os ganhos em tamanho são mensuráveis, e as perdas foram declaradas com mais clareza do que a maioria dos lançamentos do setor declara. Para o desenvolvedor com 16 GB de RAM e um agente de ferramentas para construir, o Saluki é uma opção concreta hoje. Para quem precisa de raciocínio profundo, o original segue valendo os 54 GB. Entre os dois, a escolha é de arquitetura, não de fé.
Perguntas frequentes
O Saluki 27B permite uso comercial?
Sim. O modelo é distribuído sob licença Apache 2.0, conforme o cartão no Hugging Face, que permite uso comercial. Os créditos do projeto indicam base no Qwen3.8-27B e no GGUF do ISTA-DASLab, ambos também Apache 2.0.
Que hardware é necessário para rodar o modelo?
O arquivo GGUF ocupa 7,89 GB e roda em llama.cpp sem modificações. A página da Underdog afirma execução em laptop de 16 GB de RAM. É preciso somar o espaço do KV cache, que varia com o tamanho de contexto usado, e, para visão, o arquivo mmproj adicional (928 MB ou 629 MB).
A alegação de superar o original em tool calling foi verificada por terceiros?
Não. Os números vêm do Underdog Bench, benchmark próprio da empresa, congelado em 27 de setembro de 2026, antes dos testes. Até a data desta análise, não há replicação independente, e a própria Underdog reconhece que o teste é modesto e que parte da diferença pode ser variação de execução.
O modelo aceita imagens?
Não no arquivo principal, que é apenas texto. A versão de 7 de outubro de 2026 não processa imagens; quem precisar de visão deve baixar o arquivo mmproj adicional em F16 (928 MB) ou Q8_0 (629 MB).
