A OpenAI ajustou sua estratégia de preços menos de um mês após o lançamento oficial da série GPT-5.6. A partir de 30 de julho de 2026: - GPT...

Menos de um mês após o lançamento oficial da série GPT-5.6, a OpenAI ajustou seu sistema de preços.
A partir de 30 de julho de 2026:
Esta atualização não se limita a descontos temporários. A OpenAI afirma que as reduções refletem melhorias no próprio modelo, na arquitetura de raciocínio, no sistema de roteamento, no gerenciamento de contexto e no software de agentes que conecta modelos às ferramentas.
O resultado prático é uma gama mais ampla de opções para ambientes de produção.
A Luna agora tem preço adequado para fluxos de trabalho de agentes com alta concorrência e sensibilidade a custos. A Terra continua sendo a opção equilibrada para tarefas diárias que exigem maior inteligência. A Sol continua atendendo às tarefas mais exigentes, enquanto o Fast mode oferece menor latência quando o tempo de espera importa mais do que o prêmio por token.
Quando o GPT-5.6 foi lançado em 9 de julho, a OpenAI divulgou os seguintes preços Standard de API para contexto curto:
| Modelo | Preço original de entrada | Preço original de saída |
|---|---|---|
| GPT-5.6 Sol | US$ 5,00 / milhão de tokens | US$ 30,00 / milhão de tokens |
| GPT-5.6 Terra | US$ 2,50 / milhão de tokens | US$ 15,00 / milhão de tokens |
| GPT-5.6 Luna | US$ 1,00 / milhão de tokens | US$ 6,00 / milhão de tokens |
A atualização de 30 de julho ajustou os preços da Terra e da Luna:
| Modelo | Novo preço de entrada | Novo preço de saída | Variação |
|---|---|---|---|
| GPT-5.6 Sol | US$ 5,00 / milhão de tokens | US$ 30,00 / milhão de tokens | Sem alteração |
| GPT-5.6 Terra | US$ 2,00 / milhão de tokens | US$ 12,00 / milhão de tokens | Redução de 20% |
| GPT-5.6 Luna | US$ 0,20 / milhão de tokens | US$ 1,20 / milhão de tokens | Redução de 80% |
O preço da Luna agora é um quinto do preço original de lançamento.
O novo preço da Terra corresponde a quatro quintos do preço original.
A Sol permanece inalterada sob o processamento Standard, mas o Fast mode agora oferece aos desenvolvedores uma escolha: velocidade de resposta até 2,5 vezes maior por duas vezes o preço por token do Standard.
Os preços de entrada e saída apresentados superficialmente não mostram a estrutura completa de cobrança.
O GPT-5.6 oferece descontos para entrada em cache e escrita explícita em cache. Solicitações com mais de 272.000 tokens de entrada também recebem preços de contexto longo para a solicitação inteira.
As tarifas abaixo são calculadas por milhão de tokens:
| Modelo | Entrada | Entrada em cache | Escrita em cache | Saída |
|---|---|---|---|---|
| GPT-5.6 Sol | US$ 5,00 | US$ 0,50 | US$ 6,25 | US$ 30,00 |
| GPT-5.6 Terra | US$ 2,00 | US$ 0,20 | US$ 2,50 | US$ 12,00 |
| GPT-5.6 Luna | US$ 0,20 | US$ 0,02 | US$ 0,25 | US$ 1,20 |
Leituras em cache têm desconto de 90% em relação à entrada normal sem cache.
A escrita em cache é cobrada a 1,25 vez o preço da entrada sem cache.
Para prompts com mais de 272.000 tokens de entrada, a OpenAI atualmente cobra os seguintes valores para a solicitação completa:
| Modelo | Entrada | Entrada em cache | Escrita em cache | Saída |
|---|---|---|---|---|
| GPT-5.6 Sol | US$ 10,00 | US$ 1,00 | US$ 12,50 | US$ 45,00 |
| GPT-5.6 Terra | US$ 4,00 | US$ 0,40 | US$ 5,00 | US$ 18,00 |
| GPT-5.6 Luna | US$ 0,40 | US$ 0,04 | US$ 0,50 | US$ 1,80 |
As regras de contexto longo significam que
a estimativa de custo deve considerar tanto o número de tokens quanto se a solicitação ultrapassa o limite de 272.000 tokens.
Um único prompt muito grande não é tratado cobrando os primeiros 272.000 tokens pela tarifa de contexto curto e o restante por uma tarifa mais alta. O multiplicador de contexto longo se aplica à solicitação inteira.
O principal argumento da OpenAI é que a implantação eficiente de IA começa pelos resultados, não pelo nome do modelo.
Diferentes etapas do mesmo fluxo de trabalho podem exigir diferentes níveis de inteligência, velocidade e confiabilidade.
O modelo ideal para uma tarefa depende de:
O GPT-5.6 Luna foi projetado para trabalhos sensíveis a custo e de alto volume.
Sua página atual do modelo na API o descreve como aproximadamente correspondente ao nível nano usado nas versões anteriores da série GPT-5.
A Luna é uma candidata prática para:
A OpenAI estima que a Luna consegue oferecer desempenho comparável a modelos considerados de ponta cerca de um ano atrás, a aproximadamente seis centavos de dólar por dólar de custo de tarefa e quase nove vezes mais rápido.
Essa comparação é baseada nas avaliações e na metodologia de custo da OpenAI. As equipes devem validar com suas próprias cargas de trabalho.
O GPT-5.6 Terra é o membro equilibrado da série.
A OpenAI o posiciona onde os modelos mini da era GPT-5 estavam, mas com maior capacidade de atuação como agente e em trabalhos profissionais.
A Terra é adequada para:
O GPT-5.6 Sol é o modelo principal para trabalhos profissionais complexos.
É a melhor escolha quando o modelo precisa:
O alias de API gpt-5.6 roteia para gpt-5.6-sol.
Esta atualização de preços torna fluxos de trabalho com modelos híbridos mais práticos.
Um agente de codificação não precisa usar a Sol para cada token e cada chamada de ferramenta.
Uma arquitetura possível é:
é muito alto.
O mesmo padrão pode ser aplicado fora da engenharia de software.
Um sistema de processamento de documentos pode usar a Luna para extração, a Terra para síntese e a Sol apenas quando o material for ambíguo ou de alto impacto.
A estratégia correta de roteamento deve ser determinada por avaliação, não por suposições.
Resultados de clientes compartilhados pela OpenAI
O anúncio da OpenAI incluiu feedback inicial de diversos clientes em produção.
Esses exemplos são relatos feitos pelas próprias empresas e clientes, e não benchmarks independentes.
| Empresa | Uso ou resultado relatado |
|---|---|
| Replit | A Luna tornou casos de uso antes impraticáveis economicamente viáveis para exploração |
| Notion | Em avaliações internas, a Terra alcançou qualidade equivalente ao GPT-5.5 com metade do custo por tarefa e 60% menos tempo |
| Ramp | A Terra e a Luna lideraram as avaliações internas de codificação em eficiência de custo; a Luna tornou-se a opção padrão para automação de tarefas em segundo plano |
| Blitzy | A Luna elevou a taxa de reutilização de cache de prompt de 24% para 90%, reduzindo significativamente os custos em comparação com a solução padrão anterior |
| Cognition | A Luna atua como um parceiro de codificação de menor custo no Devin Fusion, em conjunto com modelos maiores |
| Dust | Segundo relatos, em tarefas de agente semelhantes, a Luna é 40% mais rápida e 40% mais barata que a solução padrão anterior da empresa |
Esses exemplos mostram que a cobrança por token não é a única métrica útil.
Um modelo mais barato também pode alterar:
Uma métrica mais significativa costuma ser o custo por resultado bem-sucedido.
A OpenAI atribui a melhoria no preço por desempenho a três camadas interligadas.
Os modelos da série GPT-5.6 foram projetados para concluir tarefas de forma mais direta.
Um modelo que exige menos tokens de saída, menos novas tentativas ou menos ciclos de raciocínio pode reduzir o custo total da tarefa, mesmo com o preço de tabela inalterado.
A pilha de produção determina a eficiência com que o modelo utiliza o hardware.
A OpenAI afirma que software de serviço otimizado pode gerar tokens de forma mais eficiente e manter os recursos computacionais produtivos.
A estrutura é o software ao redor do modelo, fornecendo ferramentas, contexto, roteamento, estado e controle de fluxo de trabalho.
A OpenAI afirma que um melhor gerenciamento de contexto ajuda os agentes a evitar refazer trabalhos já concluídos.
Isso pode reduzir:
Essas três camadas se influenciam mutuamente.
Modelos mais fortes podem encontrar espaço para otimização na pilha de serviço. Essa otimização reduz custos, tornando o uso de agentes em maior escala economicamente viável. Mais uso, por sua vez, cria mais oportunidades para melhorar o sistema.
Uma das declarações mais notáveis do anúncio é que o GPT-5.6 Sol contribuiu para os esforços internos de eficiência da OpenAI.
Em um processo de engenharia liderado por humanos, a OpenAI afirma que o Sol:
A OpenAI relatou que as otimizações de núcleo reduziram o custo de serviço de ponta a ponta do modelo em cerca de 20%.
A empresa também afirmou que esses experimentos elevaram a eficiência de geração de tokens em mais de 15%.
Esses são resultados internos da OpenAI, ainda não reproduzidos de forma independente por benchmarks públicos.
Um ponto mais importante é que os modelos estão gradualmente se tornando parte do processo de melhoria da infraestrutura em que operam.
Isso cria um ciclo de feedback de engenharia mais fechado:
Modelos mais fortes
→ Melhor otimização de infraestrutura
→ Menor custo de serviço
→ Adoção mais ampla
→ Mais feedback e investimento
→ Modelos de próxima geração ainda mais fortes
Preços mais baixos não significam que a OpenAI precise de menos poder computacional total.
A empresa acredita que alcançar inteligência suficiente exige dois elementos ao mesmo tempo:
O primeiro expande a capacidade total.
O segundo aumenta o trabalho efetivo concluído por unidade de hardware.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
A OpenAI afirma estar construindo uma infraestrutura diversificada e alocando cargas de trabalho aos sistemas mais adequados para executá-las.
Isso sustenta as duas extremidades da série GPT-5.6:
Exemplos de cargas de trabalho que podem ser mais fáceis de escalar incluem:
Enquanto isso, quando o valor de obter uma resposta mais rapidamente justifica o custo adicional, solicitações complexas do Sol podem usar o modo Fast.
O modo Fast é o novo nome para a camada de serviço prioritária da OpenAI.
Solicitações existentes à API que usam:
"service_tier": "priority"
continuam compatíveis.
Os desenvolvedores também podem usar:
"service_tier": "fast"
Para o GPT-5.6 Sol, a OpenAI afirma que o modo Fast pode ser até 2,5 vezes mais rápido que o processamento padrão, mantendo a mesma inteligência do modelo.
O custo é o preço.
Atualmente, o modo Fast do GPT-5.6 Sol custa 2 vezes o preço padrão dos tokens da API.
Os descontos para entrada em cache continuam válidos.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="Revise este plano de migração e identifique as três premissas de maior risco.",
service_tier="fast",
)
print(response.output_text)
O modo Fast está disponível para modelos suportados por meio da API Responses e da API Chat Completions.
Para o GPT-5.6 e modelos anteriores, mesmo que a solicitação use o novo nome fast, o objeto de resposta pode reportar a camada de serviço como priority.
O modo Fast não é automaticamente a melhor configuração para todas as solicitações do Sol.
Ele é mais útil quando a latência afeta diretamente o valor do resultado.
Exemplos incluem:
Para os seguintes cenários, o processamento padrão pode ser mais econômico:
O custo adicional de dois vezes por token só faz sentido se o valor gerado pela conclusão downstream superar seu custo.
Os novos preços de tabela tornam a Luna e a Terra mais baratas, mas o cache de prompt também pode ter um impacto enorme em agentes de longa duração.
Cada rodada do loop do agente pode reenviar:
Sem cache, os aplicativos podem pagar repetidamente pelos mesmos prefixos.
O GPT-5.6 suporta cache automático e pontos de interrupção explícitos de cache.
O modelo de cobrança atual da OpenAI é:
A escrita de cache custa mais que a entrada comum, mas as leituras subsequentes recebem um grande desconto.
O cache é mais útil quando o mesmo prefixo estável é reutilizado vezes suficientes para recuperar o custo maior da escrita.
Os aplicativos devem monitorar:
Atual
A página de modelos da API lista várias especificações compartilhadas:
| Especificação | Sol | Terra | Luna |
|---|---|---|---|
| Janela de contexto | 1.050.000 tokens | 1.050.000 tokens | 1.050.000 tokens |
| Saída máxima | 128.000 tokens | 128.000 tokens | 128.000 tokens |
| Data de corte do conhecimento | 16 de fevereiro de 2026 | 16 de fevereiro de 2026 | 16 de fevereiro de 2026 |
| Entrada/saída de texto | Suportado | Suportado | Suportado |
| Entrada de imagem | Suportado | Suportado | Suportado |
| Tokens de raciocínio | Suportado | Suportado | Suportado |
| Chamada de função | Suportado | Suportado | Suportado |
| Saída estruturada | Suportado | Suportado | Suportado |
| Ajuste fino | Não suportado | Não suportado | Não suportado |
Os três modelos estão disponíveis por meio da API Responses.
A página de modelos também lista amplo suporte a ferramentas, mas a disponibilidade de funcionalidades específicas pode variar dependendo do endpoint, da conta, do produto e do estágio de lançamento.
A OpenAI afirma que o GPT-5.6 Terra e o Luna continuam disponíveis nas seguintes plataformas:
O acesso atual descrito no anúncio de preços inclui:
| Grupo de planos | Acesso ao GPT-5.6 no ChatGPT Work e Codex |
|---|---|
| Free e Go | Terra |
| Plus, Pro, Business, Enterprise | Terra e Luna |
O Sol possui regras de acesso próprias no ChatGPT, ChatGPT Work, Codex e API.
A atualização de 30 de julho não reduziu os preços das assinaturas do ChatGPT ou do Codex.
Também não aumentou os orçamentos de cotas declarados.
Em vez disso, Luna e Terra agora consomem menos créditos, pois seus custos de uso subjacentes são mais baixos.
A OpenAI também afirmou que as atualizações de preços começarão a ser implementadas via AWS no dia do anúncio. Os preços dos modelos fornecidos por plataformas terceiras podem diferir dos preços diretos da API da OpenAI.
Escolhendo o modelo GPT-5.6 correto
Um processo de seleção prático pode seguir cinco etapas.
Escreva o que conta como sucesso.
Evite escolher o modelo com base apenas em rótulos amplos como "programação" ou "pesquisa".
Tarefas de classificação de baixo risco e migrações de banco de dados em produção não devem usar as mesmas regras de decisão.
Para tarefas difíceis, teste primeiro o Sol para entender o nível máximo de qualidade disponível.
Meça se os modelos de menor custo preservam a qualidade que realmente importa.
Acompanhe:
Não otimize apenas o preço mais barato do token de entrada.
O GPT-5.6 Luna agora custa US$ 0,20 por milhão de tokens de entrada padrão de contexto curto, US$ 0,02 por milhão de tokens de entrada em cache, US$ 1,20 por milhão de tokens de saída e US$ 0,25 por milhão de tokens para gravação em cache.
O GPT-5.6 Terra agora custa US$ 2,00 por milhão de tokens de entrada padrão de contexto curto, US$ 0,20 por milhão de tokens de entrada em cache, US$ 12,00 por milhão de tokens de saída e US$ 2,50 por milhão de tokens para gravação em cache.
Os preços padrão de seus tokens não mudaram. O Sol continua custando US$ 5 por milhão de tokens de entrada de contexto curto e US$ 30 por milhão de tokens de saída, enquanto o Modo Rápido oferece processamento 2,5 vezes mais rápido pelo dobro do preço padrão.
A OpenAI renomeou o Priority Processing para Modo Rápido em 30 de julho de 2026. As solicitações existentes que usam service_tier: "priority" continuam compatíveis, e novas solicitações podem usar service_tier: "fast".
A página de modelos atual indica que prompts com mais de 272.000 tokens de entrada usarão taxas de entrada e saída mais altas para toda a solicitação. Os desenvolvedores devem considerar esse limite ao estimar custos de prompts muito grandes.
A OpenAI posiciona o Luna como o modelo voltado para trabalhos de alto throughput e sensíveis a custo. Quando o Luna não oferece qualidade suficiente, o Terra é a opção equilibrada, enquanto o Sol é direcionado às tarefas especializadas mais difíceis.
Não. A OpenAI afirma que os preços das assinaturas e os orçamentos de cotas permanecem inalterados. Terra e Luna agora consomem menos créditos nos fluxos de trabalho suportados dos produtos pagos.
Os preços diretos da API da OpenAI mudaram em 30 de julho. A OpenAI afirmou que os preços da AWS começarão a ser implementados mais tarde no mesmo dia, mas os preços e a disponibilidade em plataformas terceiras podem variar, portanto, os usuários devem verificar as tabelas de preços atuais dos provedores.
/com/api/docs/guides/latest-model): recomendações oficiais sobre seleção de modelos, migração, inferência, cache e fluxos de trabalho.
Na atualização de 30 de julho, a OpenAI reduziu os preços padrão da API do GPT-5.6 Luna em 80% e do Terra em 20%. O preço padrão do Sol permaneceu inalterado, enquanto o novo modo rápido pode acelerar as respostas da API em até 2,5 vezes, com tarifas de tokens duas vezes maiores.
O anúncio gira em torno de uma estratégia mais ampla de custo-benefício. A OpenAI afirma estar aprimorando modelos, pilha de raciocínio, roteamento, gerenciamento de contexto e estruturas de agentes para reduzir o tempo, o número de tokens ou o poder computacional necessários por tarefa bem-sucedida.
Para desenvolvedores, a escolha correta não é simplesmente selecionar o modelo mais barato. O Luna é voltado para execução de alto throughput, o Terra equilibra custo e inteligência, e o Sol lida com os trabalhos mais complexos. As economias proporcionadas por roteamento híbrido de modelos, cache, avaliações e medição de custo por sucesso podem superar em muito os benefícios de apenas trocar de modelo.
A mudança central é que o GPT-5.6 agora oferece uma faixa de trabalho mais ampla: os níveis Luna e Terra fornecem inteligência cotidiana mais econômica, enquanto o Sol oferece inteligência de ponta mais rápida quando a latência justificar o custo mais alto.
Este arquivo Markdown é uma adaptação editorial independente do artigo oficial. Preserva os temas, a ordem dos fatos e o significado real, mas não reproduz textualmente a redação da OpenAI nem as citações de clientes.
Comece com uma frase e tenha um site completo em minutos.