Faltava um modelo que falasse português brasileiro de verdade. Não um GPT ajustado com fine-tuning em cima de um corpus misto e uma camada de instruções, mas um modelo treinado desde o pré-treinamento contínuo em corpus brasileiro. A Maritaca AI (abre em nova aba) fez isso. A pergunta que este texto tenta responder não é se a empreitada deu certo — os relatórios técnicos da própria empresa indicam que deu, em parte. É outra: o quanto dessa construção resolve um problema real de quem desenvolve no Brasil, e o quanto ela apenas desloca a dependência para uma camada diferente.
O que existe, medido
O relatório técnico da Sabiá-3 (abre em nova aba) na versão de abril de 2025 descreve o modelo como treinado em corpus centrado no Brasil, com ganhos declarados sobre a Sabiá-2 Medium sobretudo em tarefas de raciocínio intensivo. A empresa afirma desempenho médio comparável ao de frontier LLMs a um custo três a quatro vezes menor por token, na tabela datada de 14 de outubro de 2024.
Os números da própria Maritaca, nessa tabela, colocam a Sabiá-3 a US$ 0,83 por milhão de tokens de entrada e US$ 1,67 de saída. A GPT-4o, versão de agosto de 2024, aparecia a US$ 2,50 e US$ 10,00. Claude 3.5 Sonnet, US$ 3,00 e US$ 15,00. A Sabiazinho-3, irmã mais barata, entrava a US$ 0,17 e US$ 0,50.
Numa bateria de 93 exames brasileiros aplicados depois de meados de 2023, a acurácia média relatada foi: Sabiá-3 79,0%, GPT-4o 80,8%, Claude 3.5 Sonnet 81,6%, Llama-3.1 405B 76,9%, Sabiazinho-3 73,7% e Sabiá-2 Medium 66,4%. A Sabiá-3 aparece na frente em CPNU (90,6% contra 88,5% da GPT-4o) e igual ou melhor que a Llama-3.1 405B em 62% dos exames. A GPT-4o lidera em medicina. O relatório sinaliza risco de contaminação no comparativo com a Claude, cujo corte de conhecimento é de abril de 2024.
Fato documentado: existe um LLM com foco declarado em português brasileiro, com preço por token em dólar publicado pela própria fornecedora e com resultados de exames nacionais divulgados. Interpretação minha: a barra de qualidade não é trivial. Chegar perto de GPT-4o em ENADE e similares não é pouco para um time que não tem o orçamento das grandes laboratórios. Isso deveria importar mais para quem decide tecnologia no Brasil do que costuma importar.
Onde o enredo muda: seguir instruções e agir
Aí entra o contraponto que o próprio relatório expõe sem disfarce. A Sabiá-3 vai bem em exames — perguntas fechadas, resposta verificável, contexto curto. Vai mal exatamente nas tarefas que sustentam produto: seguir instruções exatas e executar ações em múltiplos passos.
No IFEval em inglês, versão loose: Sabiá-3 78,0, contra GPT-4o 88,4, GPT-4o Mini 83,9 e até Llama-3.1 8B 80,5. No formato strict, a distância cresce. No BFCL (function calling), acurácia geral de 56,50% contra 69,58% da GPT-4o. Em multi-turn, 7,00% contra 41,00%. No AgentBench OA, 2,9 contra 3,7 da GPT-4o e 3,1 da GPT-4o Mini.
Repare no dado de multi-turn. Sete por cento contra quarenta e um. Isso não é uma diferença de polimento. É a diferença entre um modelo que consegue conversar com um sistema e um que trava na segunda volta quando precisa manter estado, escolher ferramenta e continuar coerente.
O relatório conclui pedindo espaço para melhorar exatamente isso: tarefas multi-etapa e cumprimento exato de instruções. O modelo que não existia foi feito. O modelo que executa fluxo agêntico com confiabilidade, em português, ainda estava em falta no momento daquele documento.
Por que isso importa mais para quem constrói produto
Quem desenvolve no Brasil faz uma escolha prática. Preciso de um modelo que entenda gíria, contrato, bula de remédio, jurisprudência do STJ, conversa de WhatsApp, sotaque escrito de cliente. Preciso que ele responda rápido e barato. Preciso também que ele não invente na hora de chamar a API de pagamento ou preencher formulário.
A Sabiá-3 atende a primeira metade. A segunda continuava carente, pelos números da própria fabricante. Isso muda o desenho de arquitetura. Modelo bom em exames brasileiros não é automaticamente bom em agente. A tentação de usar por patriotismo técnico — "é nosso, é mais barato, usa esse" — esbarra em multi-turn de 7%.
O caminho é outro. Para tarefas de entendimento, classificação, resumo, extração em português brasileiro, o custo baixo e o foco de corpus pesam a favor. Para orquestração de ferramentas, varredura de repositório com edição iterativa, pipeline que precisa manter contexto entre turnos, o desenvolvedor precisa medir no próprio caso de uso, não no benchmark agregado.
A quarta geração fecha parte do buraco
Os documentos mais recentes mostram que a lacuna foi endereçada. O relatório da Sabiá-4 (abre em nova aba), indexado em agosto de 2026, descreve um pipeline de quatro estágios: pré-treinamento contínuo em corpus português e jurídico, extensão de contexto longo, fine-tuning supervisionado e alinhamento por preferência. A Maritaca (abre em nova aba) anunciou a Sabiá-4 e a Sabiazinho-4 em janeiro de 2026, com ganhos declarados em domínio jurídico, contexto longo, seguir instruções e capacidades agênticas.
Nas tabelas da própria empresa, a comparação é entre Sabiá-4 e Sabiá-3.1. Capacidades agênticas: 72,2 contra 43,1. OAB Bench: 7,49 contra 7,21 e 7,30 da GPT-4.1. Magis Bench: 5,08, atrás da GPT-4.1 com 5,55. Brazilian Laws: 97,4 contra 77,8 e 80,8. Custo de rodar essa suíte, em reais conforme publicado, Sabiá-4 R$ 80,49, Sabiá-3.1 R$ 62,15, GPT-4.1 R$ 182,49.
O salto agêntico de 43,1 para 72,2 é a informação relevante para quem foi assustado pelo multi-turn de 7%. Mas cuidado com a leitura. São medições da fornecedora, comparando gerações diferentes, algumas delas contra um modelo que não é o mesmo da tabela original. Não é a mesma Sabiá-3 do relatório de 2024 renascida em laboratório independente.
Preço por milhão de tokens no relatório da Sabiá-4: Sabiá-3.1 a US$ 0,93 de entrada e US$ 1,85 de saída; Sabiá-4 a US$ 0,93 e US$ 3,70; Sabiazinho-4 a US$ 0,19 e US$ 0,74. O preço de US$ 0,83/US$ 1,67 anunciado para a Sabiá-3 em outubro de 2024 não reaparece, e não há preço público identificado para aquele checkpoint original.
A lição pouco confortável
Construir o modelo que não existia em português brasileiro é um feito. Construir, manter e evoluir esse modelo para que ele sobreviva à próxima geração de concorrentes é outro. A família Sabiá mostra os dois lados: existe espaço para um LLM brasileiro relevante, e existe um abismo entre ser bom em prova e ser bom em produção.
Para o desenvolvedor, a decisão deixou de ser ideológica. É uma conta de custo, cobertura linguística, e maturidade nas capacidades que importam para o produto. A Sabiá-4, pelos números da Maritaca, é outra conversa em relação à Sabiá-3 no quesito agêntico. Ainda é conversa da própria empresa, medida em BRL na própria tabela, com metodologia própria. Medir no seu domínio continua sendo o que separa escolha informada de torcida.
Perguntas frequentes
A Sabiá-3 é gratuita ou paga?
É paga via API. O relatório de abril de 2025 lista US$ 0,83 por milhão de tokens de entrada e US$ 1,67 de saída para a Sabiá-3, e US$ 0,17 e US$ 0,50 para a Sabiazinho-3, valores datados de 14 de outubro de 2024 pela Maritaca.
Qual a diferença entre Sabiá-3 e Sabiá-4?
A Sabiá-4 foi anunciada em janeiro de 2026 pela Maritaca com foco em domínio jurídico, contexto longo, seguir instruções e capacidades agênticas. O relatório técnico descreve um pipeline de quatro estágios, incluindo pré-treinamento contínuo em corpus português e jurídico e extensão de contexto para 128K tokens.
Por que a Sabiá-3 vai bem em exames mas mal em tarefas multi-turn?
Em exames, a resposta é fechada e verificável. Em multi-turn, o modelo precisa manter estado, escolher ferramenta e continuar coerente entre chamadas. O relatório da Sabiá-3 registra 7,00% de acurácia no BFCL multi-turn contra 41,00% da GPT-4o e recomenda melhorar tarefas multi-etapa.
Os números de benchmark da Maritaca são confiáveis?
São alegações da própria empresa, sem replicação independente nas informações publicadas. O relatório da Sabiá-3 sinaliza até risco de contaminação no comparativo com a Claude, por causa do corte de conhecimento de abril de 2024. Use como referência inicial, não como verdade final.
