Até 6 de outubro, quem precisava de um modelo barato da Anthropic trabalhava com o Haiku 4.5 (abre em nova aba): janela de 200 mil tokens, preço único por milhão de tokens e nenhum controle sobre o esforço de raciocínio. Em 7 de outubro de 2026, a empresa trocou esse quadro com o anúncio do Claude Haiku 5.5, descrito por ela como o modelo pequeno mais rápido e capaz já lançado. A mudança não é apenas de capacidade. A forma de cobrar, a janela de contexto e o tokenizador mudaram juntos, e os três afetam diretamente a conta de quem constrói sobre a API.
O que foi anunciado em 7 de outubro
A página de lançamento (abre em nova aba) posiciona o Haiku 5.5 como o menor membro da família 5.5, ao lado do Sonnet 5.5 e do Opus 5.5, voltado a tarefas de alto volume e sensíveis a custo: sumarização, compaction (a compressão do histórico de uma conversa para liberar espaço na janela de contexto), consultas a banco de dados, classificação e roteamento. A Anthropic afirma que ele é o modelo mais rápido da linha, com uma ressalva no próprio anúncio: o título de velocidade vale na velocidade padrão de cada modelo; em Fast Mode, os modelos Opus continuam mais rápidos.
Os números de custo aparecem com atribuição clara: a empresa estima cerca de 75% de redução média em relação ao Haiku 4.5. Essa média esconde duas camadas que interessam a quem orçamenta sistemas.
A primeira é o preço escalonado, estruturado como as faixas do Imposto de Renda: cada requisição paga a tarifa da faixa correspondente ao seu tamanho, não uma tarifa única. Solicitações de até 100 mil tokens custam 90% menos que o Haiku 4.5; acima disso, 50% menos. Segundo a nota de rodapé do anúncio, 90% das requisições no Haiku 4.5 caíam na faixa menor, o que sustenta a média de 75%.
| Preço por milhão de tokens | Haiku 5.5 (até 100k) | Haiku 5.5 (acima de 100k) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| Entrada | US$ 0,10 | US$ 0,50 | US$ 1,00 | US$ 2,00 |
| Saída | US$ 0,50 | US$ 2,50 | US$ 5,00 | US$ 10,00 |
| Leitura de cache | US$ 0,01 | US$ 0,05 | US$ 0,10 | US$ 0,10 |
| Escrita de cache 5 min | US$ 0,125 | US$ 0,625 | US$ 1,25 | US$ 2,50 |
A segunda camada é o tokenizador. A documentação da plataforma (abre em nova aba) informa que o Haiku 5.5 usa o tokenizador mais recente, o mesmo dos modelos Claude 4.7 em diante, e que um mesmo texto rende aproximadamente 30% mais tokens que no Haiku 4.5. Quem migrar código sem recalibrar contagens de contexto e estimativas de custo vai medir menos economia do que a tabela sugere. A própria Anthropic reconhece isso ao dizer que a média de 75% já incorpora o efeito do tokenizador.
Desempenho: números do fabricante e verificação externa
Os benchmarks divulgados no lançamento mostram saltos grandes sobre o Haiku 4.5. No Terminal-Bench 4.0, a Anthropic reporta 39,2% contra 0,0% da geração anterior. No OSWorld 2.1 (subconjunto offline), 72,4% contra 15,7%. No FrontierCode 1.1 Main, 46,4%, à frente dos 42,4% que a empresa atribui ao GPT-6 Luna, e atrás dos 52,1% do Sonnet 5.5 rodando em esforço Xhigh. São medidas do fabricante, com metodologia escolhida por ele.
A checagem independente disponível vem da Artificial Analysis (abre em nova aba), que atribui 43 pontos ao Haiku 5.5 em seu próprio índice de inteligência, medido em esforço máximo. Isso coloca o modelo ligeiramente à frente do GLM-5.3 Flash (42), do Gemini 3.8 Flash (41) e do GPT-6 Luna (38), comparável ao Kimi K3 (44) e 13 pontos atrás do Sonnet 5.5.
| Indicador | Valor (pontos no índice) |
|---|---|
| Sonnet 5.5 | 56 |
| Kimi K3 | 44 |
| Haiku 5.5 | 43 |
| GLM-5.3 Flash | 42 |
| Gemini 3.8 Flash | 41 |
| GPT-6 Luna | 38 |
Fonte: Artificial Analysis, outubro de 2026, medição própria em esforço máximo
Há uma divergência documentada entre as duas medições: no Terminal-Bench 4.0, a Artificial Analysis reporta 33% para o Haiku 5.5, contra os 39,2% da página da Anthropic. Diferenças de configuração de execução, versão do ambiente e número de tentativas explicam gaps desse tipo em benchmarks agénticos, e o leitor técnico deve tratar qualquer número de lançamento como ponto de partida, não como garantia de comportamento no seu domínio.
Detalhes de API que mudam o código
A documentação técnica traz decisões de implementação que valem mais que os números de marketing para quem vai integrar o modelo:
- Janela de contexto de 1 milhão de tokens, alta para um modelo pequeno, com saída máxima de 128 mil tokens em modo síncrono.
- Pensamento adaptativo ligado por padrão, controlado pelo parâmetro
effort. É o primeiro Haiku com esse controle, o que permite ajustar custo contra inteligência por tarefa, como o post da AWS (abre em nova aba) também destaca. - Batch API com 50% de desconto em entrada e saída, e até 300 mil tokens de saída com o cabeçalho beta
output-300k-2026-03-24. - Blocos de thinking válidos apenas na conta que os gerou ou em conta vinculada, o que impede reutilizar contextos de raciocínio entre clientes ou ambientes não ligados.
- Corte de conhecimento em junho de 2026 para dados de treinamento.
- Descontinuação não antes de 7 de outubro de 2027, prazo mínimo de estabilidade para planejamento.
O papel do Haiku na arquitetura de agentes
O desenho do produto deixa claro o uso pretendido: o Haiku 5.5 não disputa a fronteira, e sim o volume. A combinação de janela de 1 milhão de tokens com leitura de cache a US$ 0,01 por milhão muda a matemática do padrão mais comum em sistemas agénticos atuais, em que um modelo grande orquestra e modelos pequenos executam tarefas de apoio.
Três funções se destacam nesse papel. A primeira é compaction: resumir o histórico de uma sessão longa e devolvê-la comprimida ao modelo principal, tarefa em que janela grande e preço baixo de entrada se somam. A segunda é roteamento: classificar requisições e encaminhá-las ao modelo adequado, com latência baixa o suficiente para não degradar a experiência. A terceira é subagente de código, função nomeada explicitamente no anúncio, em que o Haiku revisa arquivos, classifica documentos longos e devolve resultados estruturados para o Opus 5.5 ou o Sonnet 5.5 consolidarem.
O esforço adaptativo amplia o alcance desse desenho. Uma mesma aplicação pode rodar classificação simples em esforço mínimo e análise de documentos em esforço alto, sem trocar de modelo, pagando por requisição o que cada tarefa exige.
No movimento inverso, a Anthropic também reduziu o preço de leitura de cache do Sonnet 5.5 pela metade, de US$ 0,20 para US$ 0,10 por milhão, o que segundo a empresa corta cerca de 20% do custo na maioria das tarefas agênticas. A semana do lançamento trouxe ainda créditos mensais de API para assinantes: US$ 100 no Max 5x, US$ 200 no Max 20x e até US$ 500 somados no plano Team, válidos em qualquer modelo.
Acesso a partir do Brasil
O Claude.ai oferece o Haiku 5.5 nos planos Free, Pro, Max, Team e Enterprise, na web e nos aplicativos iOS e Android, além do Claude Code. Para quem integra via API, o modelo está disponível nativamente na Claude Platform e, em nuvem, no Amazon Bedrock, no Google Cloud e no Microsoft Foundry. No Bedrock, a AWS destaca residência de dados regional e integração com IAM, CloudTrail, CloudWatch e Guardrails, o que importa para equipes brasileiras com exigências de conformidade.
Sobre custos locais, o quadro é objetivo: a Anthropic não publica preços em reais nem informações específicas sobre qualidade em português. A cobrança da API é em dólares americanos, e o valor final em BRL depende do câmbio e de eventuais tarifas do cartão ou do provedor de nuvem usados. As tabelas em dólar deste artigo continuam sendo a referência correta para estimar gastos; qualquer conversão exige cotação datada, que não consta do anúncio.
Para equipes que já usam o Haiku 4.5, o caminho de migração tem três verificações obrigatórias: remover temperature, top_p e top_k das chamadas; recalibrar estimativas de tokens pelo aumento de cerca de 30% na contagem; e mapear o perfil de tamanho das requisições, porque a economia real depende de quantas delas ficam abaixo da linha de 100 mil tokens. Feito isso, a documentação garante disponibilidade por pelo menos um ano, com o modelo ativo desde o dia 7 de outubro de 2026.
Perguntas frequentes
Quando o Claude Haiku 5.5 foi lançado e onde está disponível?
Foi lançado em 7 de outubro de 2026. Está disponível no Claude.ai nos planos Free, Pro, Max, Team e Enterprise, no Claude Code, na API da Claude Platform e nas nuvens Amazon Bedrock, Google Cloud e Microsoft Foundry.
Como funciona o preço escalonado do Haiku 5.5?
Requisições de até 100 mil tokens pagam US$ 0,10 por milhão de tokens de entrada e US$ 0,50 de saída; acima de 100 mil tokens, os valores sobem para US$ 0,50 e US$ 2,50. Segundo a Anthropic, 90% das requisições do Haiku 4.5 ficavam na faixa mais barata.
O tokenizador novo afeta a comparação de custo com o Haiku 4.5?
Sim. A documentação informa que o mesmo texto gera cerca de 30% mais tokens no Haiku 5.5 que no Haiku 4.5, então a economia por tarefa é menor que a diferença bruta de preço por milhão de tokens.
Há preços oficiais em reais ou restrições específicas para o Brasil?
Não. A Anthropic não publica preços em BRL nem informações específicas sobre o mercado brasileiro. A API é cobrada em dólares, e o custo final em reais depende do câmbio e das tarifas do meio de pagamento ou provedor de nuvem escolhido.
