Pular para o conteúdo
    ArtigoModelos e ferramentas

    Claude Haiku 5.5 chega com preço escalonado e contexto de 1 milhão de tokens

    Análise do lançamento do Claude Haiku 5.5 em 7 de outubro de 2026: preço em faixas, tokenizador novo, benchmarks da Anthropic e verificação independente, detalhes de API e condições de acesso a partir do Brasil.

    Filipe Mendes

    9 de out. de 2026 · 7 min de leitura

    Seguir no Google
    Close de uma tabela de preços escalonados impressa em papel sobre uma mesa de escritório, com faixas de valores por milhão de tokens destacadas por luz suave.
    Faixas de preço por milhão de tokens do Claude Haiku 5.5, lançado em 7 de outubro de 2026, definem o custo conforme o volume usado.

    Até 6 de outubro, quem precisava de um modelo barato da Anthropic trabalhava com o Haiku 4.5 (abre em nova aba): janela de 200 mil tokens, preço único por milhão de tokens e nenhum controle sobre o esforço de raciocínio. Em 7 de outubro de 2026, a empresa trocou esse quadro com o anúncio do Claude Haiku 5.5, descrito por ela como o modelo pequeno mais rápido e capaz já lançado. A mudança não é apenas de capacidade. A forma de cobrar, a janela de contexto e o tokenizador mudaram juntos, e os três afetam diretamente a conta de quem constrói sobre a API.

    O que foi anunciado em 7 de outubro

    A página de lançamento (abre em nova aba) posiciona o Haiku 5.5 como o menor membro da família 5.5, ao lado do Sonnet 5.5 e do Opus 5.5, voltado a tarefas de alto volume e sensíveis a custo: sumarização, compaction (a compressão do histórico de uma conversa para liberar espaço na janela de contexto), consultas a banco de dados, classificação e roteamento. A Anthropic afirma que ele é o modelo mais rápido da linha, com uma ressalva no próprio anúncio: o título de velocidade vale na velocidade padrão de cada modelo; em Fast Mode, os modelos Opus continuam mais rápidos.

    Os números de custo aparecem com atribuição clara: a empresa estima cerca de 75% de redução média em relação ao Haiku 4.5. Essa média esconde duas camadas que interessam a quem orçamenta sistemas.

    A primeira é o preço escalonado, estruturado como as faixas do Imposto de Renda: cada requisição paga a tarifa da faixa correspondente ao seu tamanho, não uma tarifa única. Solicitações de até 100 mil tokens custam 90% menos que o Haiku 4.5; acima disso, 50% menos. Segundo a nota de rodapé do anúncio, 90% das requisições no Haiku 4.5 caíam na faixa menor, o que sustenta a média de 75%.

    Preço por milhão de tokensHaiku 5.5 (até 100k)Haiku 5.5 (acima de 100k)Haiku 4.5Sonnet 5.5
    EntradaUS$ 0,10US$ 0,50US$ 1,00US$ 2,00
    SaídaUS$ 0,50US$ 2,50US$ 5,00US$ 10,00
    Leitura de cacheUS$ 0,01US$ 0,05US$ 0,10US$ 0,10
    Escrita de cache 5 minUS$ 0,125US$ 0,625US$ 1,25US$ 2,50

    A segunda camada é o tokenizador. A documentação da plataforma (abre em nova aba) informa que o Haiku 5.5 usa o tokenizador mais recente, o mesmo dos modelos Claude 4.7 em diante, e que um mesmo texto rende aproximadamente 30% mais tokens que no Haiku 4.5. Quem migrar código sem recalibrar contagens de contexto e estimativas de custo vai medir menos economia do que a tabela sugere. A própria Anthropic reconhece isso ao dizer que a média de 75% já incorpora o efeito do tokenizador.

    Desempenho: números do fabricante e verificação externa

    Os benchmarks divulgados no lançamento mostram saltos grandes sobre o Haiku 4.5. No Terminal-Bench 4.0, a Anthropic reporta 39,2% contra 0,0% da geração anterior. No OSWorld 2.1 (subconjunto offline), 72,4% contra 15,7%. No FrontierCode 1.1 Main, 46,4%, à frente dos 42,4% que a empresa atribui ao GPT-6 Luna, e atrás dos 52,1% do Sonnet 5.5 rodando em esforço Xhigh. São medidas do fabricante, com metodologia escolhida por ele.

    A checagem independente disponível vem da Artificial Analysis (abre em nova aba), que atribui 43 pontos ao Haiku 5.5 em seu próprio índice de inteligência, medido em esforço máximo. Isso coloca o modelo ligeiramente à frente do GLM-5.3 Flash (42), do Gemini 3.8 Flash (41) e do GPT-6 Luna (38), comparável ao Kimi K3 (44) e 13 pontos atrás do Sonnet 5.5.

    Índice de Inteligência da Artificial Analysis (esforço máximo)
    Unidade: pontos no índice. Escala a partir de zero.
    IndicadorValor (pontos no índice)
    Sonnet 5.556
    Kimi K344
    Haiku 5.543
    GLM-5.3 Flash42
    Gemini 3.8 Flash41
    GPT-6 Luna38

    Fonte: Artificial Analysis, outubro de 2026, medição própria em esforço máximo

    Há uma divergência documentada entre as duas medições: no Terminal-Bench 4.0, a Artificial Analysis reporta 33% para o Haiku 5.5, contra os 39,2% da página da Anthropic. Diferenças de configuração de execução, versão do ambiente e número de tentativas explicam gaps desse tipo em benchmarks agénticos, e o leitor técnico deve tratar qualquer número de lançamento como ponto de partida, não como garantia de comportamento no seu domínio.

    Detalhes de API que mudam o código

    A documentação técnica traz decisões de implementação que valem mais que os números de marketing para quem vai integrar o modelo:

    • Janela de contexto de 1 milhão de tokens, alta para um modelo pequeno, com saída máxima de 128 mil tokens em modo síncrono.
    • Pensamento adaptativo ligado por padrão, controlado pelo parâmetro effort. É o primeiro Haiku com esse controle, o que permite ajustar custo contra inteligência por tarefa, como o post da AWS (abre em nova aba) também destaca.
    • Batch API com 50% de desconto em entrada e saída, e até 300 mil tokens de saída com o cabeçalho beta output-300k-2026-03-24.
    • Blocos de thinking válidos apenas na conta que os gerou ou em conta vinculada, o que impede reutilizar contextos de raciocínio entre clientes ou ambientes não ligados.
    • Corte de conhecimento em junho de 2026 para dados de treinamento.
    • Descontinuação não antes de 7 de outubro de 2027, prazo mínimo de estabilidade para planejamento.

    O papel do Haiku na arquitetura de agentes

    O desenho do produto deixa claro o uso pretendido: o Haiku 5.5 não disputa a fronteira, e sim o volume. A combinação de janela de 1 milhão de tokens com leitura de cache a US$ 0,01 por milhão muda a matemática do padrão mais comum em sistemas agénticos atuais, em que um modelo grande orquestra e modelos pequenos executam tarefas de apoio.

    Três funções se destacam nesse papel. A primeira é compaction: resumir o histórico de uma sessão longa e devolvê-la comprimida ao modelo principal, tarefa em que janela grande e preço baixo de entrada se somam. A segunda é roteamento: classificar requisições e encaminhá-las ao modelo adequado, com latência baixa o suficiente para não degradar a experiência. A terceira é subagente de código, função nomeada explicitamente no anúncio, em que o Haiku revisa arquivos, classifica documentos longos e devolve resultados estruturados para o Opus 5.5 ou o Sonnet 5.5 consolidarem.

    O esforço adaptativo amplia o alcance desse desenho. Uma mesma aplicação pode rodar classificação simples em esforço mínimo e análise de documentos em esforço alto, sem trocar de modelo, pagando por requisição o que cada tarefa exige.

    No movimento inverso, a Anthropic também reduziu o preço de leitura de cache do Sonnet 5.5 pela metade, de US$ 0,20 para US$ 0,10 por milhão, o que segundo a empresa corta cerca de 20% do custo na maioria das tarefas agênticas. A semana do lançamento trouxe ainda créditos mensais de API para assinantes: US$ 100 no Max 5x, US$ 200 no Max 20x e até US$ 500 somados no plano Team, válidos em qualquer modelo.

    Acesso a partir do Brasil

    O Claude.ai oferece o Haiku 5.5 nos planos Free, Pro, Max, Team e Enterprise, na web e nos aplicativos iOS e Android, além do Claude Code. Para quem integra via API, o modelo está disponível nativamente na Claude Platform e, em nuvem, no Amazon Bedrock, no Google Cloud e no Microsoft Foundry. No Bedrock, a AWS destaca residência de dados regional e integração com IAM, CloudTrail, CloudWatch e Guardrails, o que importa para equipes brasileiras com exigências de conformidade.

    Sobre custos locais, o quadro é objetivo: a Anthropic não publica preços em reais nem informações específicas sobre qualidade em português. A cobrança da API é em dólares americanos, e o valor final em BRL depende do câmbio e de eventuais tarifas do cartão ou do provedor de nuvem usados. As tabelas em dólar deste artigo continuam sendo a referência correta para estimar gastos; qualquer conversão exige cotação datada, que não consta do anúncio.

    Para equipes que já usam o Haiku 4.5, o caminho de migração tem três verificações obrigatórias: remover temperature, top_p e top_k das chamadas; recalibrar estimativas de tokens pelo aumento de cerca de 30% na contagem; e mapear o perfil de tamanho das requisições, porque a economia real depende de quantas delas ficam abaixo da linha de 100 mil tokens. Feito isso, a documentação garante disponibilidade por pelo menos um ano, com o modelo ativo desde o dia 7 de outubro de 2026.

    Perguntas frequentes

    Quando o Claude Haiku 5.5 foi lançado e onde está disponível?

    Foi lançado em 7 de outubro de 2026. Está disponível no Claude.ai nos planos Free, Pro, Max, Team e Enterprise, no Claude Code, na API da Claude Platform e nas nuvens Amazon Bedrock, Google Cloud e Microsoft Foundry.

    Como funciona o preço escalonado do Haiku 5.5?

    Requisições de até 100 mil tokens pagam US$ 0,10 por milhão de tokens de entrada e US$ 0,50 de saída; acima de 100 mil tokens, os valores sobem para US$ 0,50 e US$ 2,50. Segundo a Anthropic, 90% das requisições do Haiku 4.5 ficavam na faixa mais barata.

    O tokenizador novo afeta a comparação de custo com o Haiku 4.5?

    Sim. A documentação informa que o mesmo texto gera cerca de 30% mais tokens no Haiku 5.5 que no Haiku 4.5, então a economia por tarefa é menor que a diferença bruta de preço por milhão de tokens.

    Há preços oficiais em reais ou restrições específicas para o Brasil?

    Não. A Anthropic não publica preços em BRL nem informações específicas sobre o mercado brasileiro. A API é cobrada em dólares, e o custo final em reais depende do câmbio e das tarifas do meio de pagamento ou provedor de nuvem escolhido.

    Filipe Mendes

    Ver perfil completo