For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/pt/articles/claude-haiku-5-pricing-benchmarks-gpt-6-l-8951f544.md.
A Anthropic lançou o **Claude Haiku 5.5**, seu modelo pequeno mais rápido e de menor custo até o momento.

A Anthropic lançou o Claude Haiku 5.5, seu modelo pequeno mais rápido e de menor custo até o momento.
O modelo foi lançado oficialmente em 7 de outubro de 2026 e foi projetado para trabalhos em que velocidade, volume e custo são mais importantes do que usar o modelo mais potente possível em todas as solicitações.
A Anthropic posiciona o Haiku 5.5 para tarefas como:
O número que mais chama atenção é o preço para prompts curtos:
Entrada:
US$ 0,10 / 1 milhão de tokens
Saída:
US$ 0,50 / 1 milhão de tokens
para prompts de até 100.000 tokens.
Esse valor corresponde a um décimo do preço listado para entrada e saída do Haiku 4.5 e a um vigésimo do preço padrão de entrada e saída do Sonnet 5.5.

A redução de preço não significa que todo fluxo de trabalho real ficará 90% mais barato.
A própria estimativa da Anthropic é mais conservadora: depois de considerar os preços para contexto longo e o novo tokenizador, a empresa afirma que o Haiku 5.5 custa cerca de 75% menos, em média, para ser executado do que o Haiku 4.5.
A parte mais surpreendente é que o modelo não é apenas mais barato.
Em várias avaliações publicadas pela Anthropic, o Haiku 5.5 supera amplamente o Haiku 4.5 e também supera o GPT-6 Luna, da OpenAI, com preço semelhante, em todos os benchmarks nos quais a Anthropic publicou um resultado do Luna.
Isso ainda não transforma o Haiku 5.5 em substituto do Sonnet 5.5 ou do Opus 5.5 para programação difícil e trabalho aberto com agentes.
A Anthropic recomenda explicitamente seus modelos maiores para essas tarefas.
A melhor forma de entender o Haiku 5.5 é como um operador de alto volume que finalmente se tornou forte o suficiente para executar tarefas de agentes muito mais sérias do que os modelos Haiku anteriores.
A estrutura de preços tem dois níveis.
Para prompts de até 100.000 tokens de entrada:
| Tipo de token | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| Leitura do cache | US$ 0,01 / 1 milhão | US$ 0,10 / 1 milhão | US$ 0,10 / 1 milhão |
| Gravação no cache | US$ 0,125 / 1 milhão | US$ 1,25 / 1 milhão | US$ 2,50 / 1 milhão |
| Entrada | US$ 0,10 / 1 milhão | US$ 1,00 / 1 milhão | US$ 2,00 / 1 milhão |
| Saída | US$ 0,50 / 1 milhão | US$ 5,00 / 1 milhão | US$ 10,00 / 1 milhão |
Para prompts com mais de 100.000 tokens de entrada, o Haiku 5.5 passa a usar:
Leitura do cache:
US$ 0,05 / 1 milhão
Gravação no cache:
US$ 0,625 / 1 milhão
Entrada:
US$ 0,50 / 1 milhão
Saída:
US$ 2,50 / 1 milhão

O processamento em lote aplica um desconto de 50% aos tokens de entrada e saída.
A Anthropic também afirma que cerca de 90% das solicitações ao modelo Haiku anterior estavam abaixo do limite de 100 mil tokens, razão pela qual o nível mais barato é tão relevante para implantações típicas de alto volume.
As tarifas anunciadas para prompts curtos são 90% menores do que as do Haiku 4.5.
Mas a Anthropic estima que a redução média real seja de aproximadamente 75%.
Há dois motivos principais.
Quando um prompt ultrapassa 100.000 tokens de entrada, as tarifas do Haiku 5.5 aumentam cinco vezes.
O modelo ainda é mais barato do que o Haiku 4.5 nesse ponto, mas a redução passa a ser de 50%, em vez de 90%.
O Haiku 5.5 usa o novo tokenizador empregado pelo Claude 4.7 e pelos modelos posteriores.
O guia de migração da Anthropic afirma que o mesmo texto de entrada produz aproximadamente:
30% mais tokens
no Haiku 5.5 do que no Haiku 4.5.
O aumento exato depende do conteúdo.
Isso afeta:
max_tokensPor isso, os desenvolvedores não devem pegar uma contagem de tokens do Haiku 4.5 e simplesmente multiplicá-la pelo novo preço por token do Haiku 5.5.
O texto precisa ser contado novamente com o novo modelo.
Para solicitações padrão com contexto curto, os dois modelos são diretamente comparáveis em preço por token.
Atualmente, a OpenAI lista o GPT-6 Luna com:
Entrada:
US$ 0,10 / 1 milhão
Entrada em cache:
US$ 0,01 / 1 milhão
Gravações no cache:
US$ 0,125 / 1 milhão
Saída:
US$ 0,50 / 1 milhão
Esses valores correspondem às tarifas do Haiku 5.5 para prompts curtos.
Mas os limites de preço para contexto longo são muito diferentes.
O nível mais caro começa quando o prompt ultrapassa:
100.000 tokens de entrada
Depois disso:
Entrada:
US$ 0,50 / 1 milhão
Leitura do cache:
US$ 0,05 / 1 milhão
Saída:
US$ 2,50 / 1 milhão
O preço para contexto longo da OpenAI começa acima de:
272.000 tokens de entrada
e então muda para:
Entrada:
US$ 0,20 / 1 milhão
Entrada em cache:
US$ 0,02 / 1 milhão
Saída:
US$ 0,75 / 1 milhão
Portanto, o artigo de origem está correto ao distinguir contextos curtos e longos.
Para prompts com menos de 100 mil tokens, os preços padrão são muito semelhantes.
Para prompts muito longos, o Luna atualmente tem uma tarifa de contexto longo consideravelmente menor e só ativa esse nível quando o prompt é muito maior.
Isso pode alterar significativamente as decisões de roteamento de modelos para documentos extensos ou históricos grandes de agentes.
A Anthropic aproveitou o lançamento do Haiku 5.5 para reduzir outro custo importante.
As leituras de cache do Claude Sonnet 5.5 caíram de:
US$ 0,20 / 1 milhão de tokens
para:
US$ 0,10 / 1 milhão de tokens
A Anthropic estima que isso reduza o custo do Sonnet 5.5 em aproximadamente 20% na maioria dos fluxos de trabalho com agentes, porque as leituras de cache podem representar uma grande parcela dos tokens em agentes de longa duração.
Isso torna a família de modelos mais claramente segmentada:
Haiku 5.5
→ trabalho mais barato, rápido e de maior volume
Sonnet 5.5
→ trabalho bem delimitado e programação mais robustos
Opus 5.5
→ trabalho aberto mais difícil e agentes complexos
A tabela de benchmarks é onde a melhoria geracional se torna mais evidente.

A Anthropic informa:
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 offline | 72,4% | 15,7% | 48,9% | 83,9% |
| HLE, sem ferramentas | 45,9% | 10,2% | — | 56,9% |
| HLE, com ferramentas | 57,4% | 18,7% | — | 64,5% |
| Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| FrontierCode 1.1 Main | 46,4% | — | 42,4% | 52,1% Xhigh |
| Chartography | 46,4% | 6,4% | 29,1% | 61,6% |
Na tabela publicada pela Anthropic, o Haiku 5.5 supera o GPT-6 Luna em todas as linhas nas quais há uma pontuação do Luna.
Esse é um resultado relevante, considerando que os dois modelos compartilham os mesmos preços de entrada e saída para contexto curto.
Ainda assim, essas são comparações de benchmarks publicadas pela Anthropic.
Elas não devem ser transformadas em uma afirmação universal de que o Haiku 5.5 é melhor do que o Luna para todos os fluxos de trabalho.
Os resultados em produção dependem de:
A melhoria mais forte entre gerações aparece no OSWorld 2.1, uma avaliação de agentes que usam computadores.
O Haiku 4.5 obteve:
15,7%
O Haiku 5.5 alcança:
72,4%
O Sonnet 5.5 continua acima, com:
83,9%
enquanto o GPT-6 Luna aparece com:
48,9%

A curva de desempenho em relação ao custo é particularmente interessante.
O gráfico da Anthropic mostra que uma configuração do Haiku com esforço médio já pode superar o melhor ponto do Luna apresentado nessa avaliação, com um custo medido por tentativa mais baixo.
Isso não torna os dois modelos idênticos em capacidades ou preço.
Mas mostra por que a Anthropic está posicionando o Haiku 5.5 para uso de navegador e outras tarefas de agentes sensíveis à latência.
No GDPval-AA v2.1, o Haiku 5.5 alcança:
1620 Elo
em comparação com:
Haiku 4.5:
735
GPT-6 Luna:
1437
Sonnet 5.5:
1840

No esforço médio padrão, a pontuação é menor do que o resultado máximo do Haiku, mas o custo também cai significativamente.
Essa flexibilidade é nova para a família Haiku.
O Claude Haiku 5.5 é o primeiro modelo da classe Haiku com uma configuração de esforço ajustável.
Os níveis disponíveis são:
low
medium
high
xhigh
max
A API do Claude usa como padrão:
medium
Isso permite que os desenvolvedores troquem profundidade de raciocínio por custo e latência.
Para uma tarefa de roteamento ou classificação, low pode ser suficiente.
Para uma tarefa de extração ou de agente mais difícil, um nível de esforço maior pode usar mais capacidade computacional.

Isso também explica por que um único número de benchmark nem sempre conta toda a história.
A pontuação do Haiku 5.5 depende do nível de esforço escolhido para a tarefa.
O artigo de origem é cuidadoso nesse ponto, e os dados oficiais confirmam essa análise.
No Terminal-Bench 4.0:
Haiku 5.5:
39,2%
GPT-6 Luna:
16,4%
Sonnet 5.5:
70,6%
No FrontierCode 1.1 Main:
Haiku 5.5:
46,4%
GPT-6 Luna:
42,4%
Sonnet 5.5:
52,1% em Xhigh
A melhoria do Haiku é substancial, especialmente em relação ao resultado de 0,0% do Haiku 4.5 apresentado no Terminal-Bench.
Mas a Anthropic afirma explicitamente que o Sonnet 5.5 e o Opus 5.5 continuam sendo escolhas melhores para programação complexa com agentes.
Isso dá ao Haiku um papel mais claro:
Haiku:
execução de subtarefas delimitadas
Sonnet:
programação complexa e bem definida
Opus:
planejamento mais difícil e trabalho aberto com agentes
A Anthropic recomenda o Haiku 5.5 para trabalhos como:
A Anthropic o chama de modelo Claude mais rápido na velocidade padrão.
Ele só funciona mais lentamente do que o Opus quando o Opus é colocado no Fast Mode, que tem preço separado.
Isso torna o Haiku 5.5 útil sempre que a latência tiver valor direto para o produto.
A Anthropic publicou várias avaliações de clientes junto com o lançamento.
Esses são testes relatados pelos clientes, não garantias universais de desempenho.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
A Asana avaliou o Haiku 5.5 em seu conjunto de testes de AI Teammates.
As tarefas incluíam:
A Asana relatou uma redução superior a 30% na latência de conclusão das tarefas e uma inferência de até 2,5 vezes mais rápida por turno do agente, em comparação com o modelo que utilizava.

A Box informou que o Haiku 5.5 obteve uma pontuação 11 pontos maior do que o Haiku 4.5 nos testes iniciais, com aproximadamente metade da latência.
A empresa destacou cargas de trabalho analíticas, como:
A AlphaSense testou 400 consultas de perguntas sobre documentos.
A empresa relatou uma pontuação de avaliação de:
Haiku 5.5:
0,84
Haiku 4.5:
0,76
A relevância está na escala.
A AlphaSense afirma que esse tipo de fluxo de trabalho de perguntas em documentos processa cerca de 8 milhões de chamadas por semana em produção, fazendo com que pequenas mudanças em custo e latência sejam operacionalmente importantes.
Um dos casos de uso mais claros não é substituir um modelo maior, mas trabalhar abaixo dele.
Um modelo maior pode:
entender a tarefa geral
→ dividi-la em subproblemas
→ atribuir trabalhos específicos
O Haiku 5.5 pode então executar esses trabalhos em paralelo.
Esse padrão permite que o sistema use a capacidade mais cara do modelo apenas onde ela é necessária.
A Cognition afirma que o Haiku 5.5 agora está disponível como modelo copiloto dentro do Devin Fusion.
Com o Opus 5.5 como modelo líder e o Haiku 5.5 como copiloto, a Cognition relata uma pontuação de 66,2 no FrontierCode, reduzindo simultaneamente custo e latência.

Esse é um bom exemplo de roteamento hierárquico de modelos:
Opus 5.5
→ planejamento
→ decisões difíceis
→ integração
Haiku 5.5
→ subtarefas paralelas
→ recuperação de informações
→ implementação delimitada
→ trabalho repetitivo
O resultado não é simplesmente “usar um modelo mais barato”.
É “usar o modelo caro apenas para o trabalho que realmente precisa dele”.
A empresa de IA financeira Rogo descreve um padrão semelhante.
Um modelo maior pode criar uma apresentação enquanto um subagente Haiku 5.5 pesquisa um documento 10-K e extrai o valor da receita por segmento necessário para um slide.

Esse é exatamente o tipo de trabalho delimitado e repetível para o qual o Haiku foi projetado:
pergunta específica
+
fonte conhecida
+
alto volume
+
requisito de baixa latência
O artigo de origem inclui uma demonstração para desenvolvedores da Anthropic envolvendo uma tarefa de projeto de queda de ovo.
O Opus 5.5 trabalhando sozinho, segundo o relato:
levou 3 minutos e 37 segundos
testou 25 projetos
custou US$ 0,47
Quando o Opus usou dez subagentes Haiku 5.5, o artigo informa:
58 segundos
86 projetos testados
US$ 0,14 de custo total
A imagem original da BAAI para esse resultado não carregou de forma confiável durante a preparação e, por isso, não foi reproduzida aqui.
Esse exemplo deve ser entendido como uma demonstração da Anthropic sobre uma arquitetura específica de agentes, e não como uma garantia geral de velocidade quatro vezes maior ou de redução de custo.
Seu objetivo é ilustrar o paralelismo.
Quando uma tarefa pode ser decomposta de forma clara, muitos agentes pequenos e rápidos podem explorar mais possibilidades simultaneamente do que um único modelo caro trabalhando de forma sequencial.
A documentação atual de modelos da Anthropic lista:
| Especificação | Claude Haiku 5.5 |
|---|---|
| ID do modelo | claude-haiku-5-5 |
| Janela de contexto | 1.000.000 de tokens |
| Saída máxima | 128.000 tokens |
| Saída máxima da API Batch, beta | 300.000 tokens |
| Entrada | Texto, imagens |
| Saída | Texto |
| Raciocínio | Adaptativo |
| Esforço padrão | medium |
| Data de corte do conhecimento confiável | Junho de 2026 |
| Data de lançamento | 7 de outubro de 2026 |
A janela de contexto de 1 milhão de tokens é o padrão.
Não é necessário nenhum cabeçalho beta especial apenas para usar toda a janela de contexto.
Esta é uma das seções práticas mais importantes do artigo de origem.
O guia oficial de migração da Anthropic confirma várias diferenças que alteram o comportamento ou podem exigir mudanças.
Para a API do Claude:
claude-haiku-4-5
→
claude-haiku-5-5
O ID do Haiku 5.5 é fixo e não usa um sufixo de data.
O mesmo texto contém aproximadamente 30% mais tokens com o novo tokenizador.
Os desenvolvedores devem recalcular:
max_tokensO Haiku 4.5 podia usar:
{
"thinking": {
"type": "enabled",
"budget_tokens": 8000
}
}
O Haiku 5.5 usa raciocínio adaptativo.
Uma solicitação que envie a configuração manual antiga com budget_tokens retorna um erro 400.
Os desenvolvedores devem usar o raciocínio adaptativo e controlar a profundidade com o parâmetro effort.
A Anthropic recomenda omitir:
temperature
top_p
top_k
das solicitações ao Haiku 5.5.
Valores diferentes do padrão podem retornar erros 400.
O prompt e o esforço devem ser usados para controlar o comportamento.
O Haiku 5.5 não oferece suporte ao padrão antigo em que a mensagem final é um turno do assistente que o modelo continua.
Para formatos estruturados, a Anthropic recomenda saídas estruturadas ou esquemas de ferramentas.
Para integrações de uso de computador da API do Claude e do Google Cloud, o guia de migração recomenda passar para:
computer_toolset_20260801
O conjunto de ferramentas atual expõe ações como:
como ferramentas-membro de um único conjunto de ferramentas de computador.
A Anthropic recomenda isolamento forte e controles de acesso para ambientes de uso de computador.
As aplicações devem tratar:
refusal
model_context_window_exceeded
como estados explícitos.
Uma recusa de segurança não é o mesmo que uma falha comum de infraestrutura que possa ser repetida.
O guia de migração do Haiku 5.5 da Anthropic afirma que o Priority Tier não é compatível com o novo modelo.
Equipes com compromissos existentes de Priority Tier para o Haiku 4.5 devem planejar a capacidade separadamente.
A Anthropic fornece uma habilidade integrada de migração da API do Claude.
No Claude Code, o comando apresentado no artigo de origem é válido:
/claude-api migrate this project to claude-haiku-5-5
O guia oficial de migração afirma que a habilidade pode:
Ela solicita que o usuário confirme o escopo da migração antes de editar os arquivos.
Isso é útil para repositórios maiores nos quais a chamada à API esteja espalhada por vários arquivos.
A Anthropic afirma que seus SDKs de Python e TypeScript agora incluem classes beta para:
A interface atual de uso de computador utiliza:
computer_toolset_20260801
Nas plataformas compatíveis, o conjunto de ferramentas fornece 17 ações-membro, como:
screenshot
left_click
type
scroll
zoom
Para fluxos de trabalho exclusivamente na web, a Anthropic recomenda, quando apropriado, a ferramenta de uso de navegador em vez de expor um ambiente completo de desktop.
Isso é relevante porque a combinação de velocidade e preço baixo do Haiku o torna especialmente adequado para interações repetitivas com navegadores e agentes de desktop.
A Anthropic afirma que o Haiku 5.5 está disponível por meio de:
O artigo de origem também observa a disponibilidade em plataformas de terceiros, como Cursor e OpenRouter.
Essas são integrações externas e podem ter seus próprios preços, limites de taxa e comportamentos de roteamento de modelos.
Para desenvolvimento direto com a Anthropic, o ID oficial do modelo é:
claude-haiku-5-5
O Claude Haiku 5.5 é o modelo pequeno mais rápido e de menor custo da Anthropic na família Claude 5.5. Ele foi projetado para trabalhos de alto volume e sensíveis à latência, como resumos, classificação, roteamento, extração, uso de navegador e tarefas de subagentes.
Para prompts de até 100 mil tokens, o custo é de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. Prompts acima de 100 mil tokens usam tarifas maiores de US$ 0,50 para entrada e US$ 2,50 para saída por milhão de tokens.
As tarifas por token para prompts curtos são 90% menores. A Anthropic estima que o custo médio de fluxos de trabalho reais seja mais próximo de 75% menor, porque solicitações acima de 100 mil tokens recebem apenas uma redução de preço de 50% e o novo tokenizador produz aproximadamente 30% mais tokens para o mesmo texto.
Para contextos curtos, os preços padrão de entrada, entrada em cache e saída são iguais. Para contextos longos, o GPT-6 Luna atualmente se torna mais favorável porque seu nível de preço mais alto começa acima de 272 mil tokens, em vez de 100 mil, e suas tarifas para contexto longo são menores.
Sim. A Anthropic lista uma janela de contexto de 1.000.000 de tokens e até 128 mil tokens de saída para solicitações normais. Uma opção beta da Message Batches pode oferecer suporte a até 300 mil tokens de saída.
Ele é muito mais forte do que o Haiku 4.5 e supera o GPT-6 Luna nos resultados publicados pela Anthropic no Terminal-Bench e no FrontierCode. Ainda assim, a Anthropic recomenda o Sonnet 5.5 ou o Opus 5.5 para programação complexa com agentes.
As principais mudanças incluem o novo ID do modelo, aproximadamente 30% mais tokens para o mesmo texto, raciocínio adaptativo no lugar de budget_tokens, remoção das antigas configurações de amostragem, ausência de preenchimentos de mensagens do assistente, ferramentas de uso de computador atualizadas e novos motivos de parada.
O ID do modelo na API do Claude é:
claude-haiku-5-5
A Anthropic também documenta identificadores específicos para Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform na AWS.
/claude-api migrate.computer_toolset_20260801 e integração de agentes de desktop.computer_toolset_20260801 e orientações de segurança.O Claude Haiku 5.5 é uma atualização muito maior do que sua posição na base da tabela de preços do Claude poderia sugerir. A Anthropic reduziu o preço para prompts curtos para US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída, ao mesmo tempo que levou o modelo a uma janela de contexto de 1 milhão de tokens, raciocínio adaptativo e desempenho significativamente mais forte em uso de computador, programação, trabalho de conhecimento e raciocínio.
O papel do modelo continua claro. O Sonnet 5.5 e o Opus 5.5 permanecem como escolhas melhores para programação difícil com agentes e trabalho aberto, enquanto o Haiku 5.5 é otimizado para tarefas rápidas, específicas e repetíveis que podem ser executadas em escala ou delegadas por um modelo líder maior.
Os desenvolvedores que migram do Haiku 4.5 não devem apenas trocar o ID do modelo. O novo tokenizador, o raciocínio adaptativo, as restrições de amostragem, as mudanças nos preenchimentos, o conjunto de ferramentas de uso de computador e o limite de preço para contexto longo afetam as integrações existentes.
O Haiku 5.5 é mais interessante não como substituto barato para todos os modelos maiores, mas como uma camada de execução rápida que torna sistemas de alto volume e de múltiplos agentes significativamente mais econômicos.
Comece com uma frase e tenha um site completo em minutos.