---
title: "Reformulação de preços e velocidade do OpenAI GPT-5.6 e estratégia de seleção de modelos"
locale: pt
category: ai_data
category_name: "Dados de IA"
translation_status: reviewed
license: cc_by
author: "injoys"
source_url: https://injoys.com/en/articles/openai-gpt-5-6-price-performance-model-routing
published_at: 2026-08-01T07:15:42+09:00
---

# Reformulação de preços e velocidade do OpenAI GPT-5.6 e estratégia de seleção de modelos

> A partir de 30 de julho de 2026, a OpenAI reduziu em 80% e 20%, respectivamente, os preços da API do GPT-5.6 Luna e Terra e introduziu o Fast mode no Sol. Essa reformulação se concentra em uma estratégia que reduz o custo por resultado ao distribuir os modelos conforme as etapas de planejamento, execução e verificação, em vez de usar o modelo mais avançado em todas as tarefas.

## Key Points

- O preço da API do GPT-5.6 Luna caiu para US$ 0,20 por 1 milhão de tokens de entrada e US$ 1,20 por 1 milhão de tokens de saída.
- O preço da API do GPT-5.6 Terra caiu para US$ 2 por 1 milhão de tokens de entrada e US$ 12 por 1 milhão de tokens de saída.
- Segundo o anúncio, o Fast mode do GPT-5.6 Sol é até 2,5 vezes mais rápido que o processamento Standard, custa o dobro e mantém o nível de inteligência do modelo.
- As empresas podem adotar uma configuração hierárquica na qual o Sol realiza julgamentos e planejamentos complexos, enquanto o Luna ou o Terra cuida da execução repetitiva e da verificação.
- A OpenAI explica que a otimização conjunta dos modelos, da infraestrutura de inferência e do harness de agentes possibilitou a redução de preços e a melhoria da capacidade de processamento.

OpenAI vinculou as melhorias na eficiência de execução da família GPT-5.6 à redução dos preços da API e ao aumento da velocidade de processamento. O ponto central não é aplicar o modelo mais poderoso a todas as tarefas, mas combinar Sol, Terra e Luna de acordo com o risco, a complexidade, a latência e a possibilidade de validação de cada tarefa para reduzir o custo por resultado.

Os números de preço e desempenho têm como base o anúncio feito pela OpenAI em 30 de julho de 2026. Como os benchmarks de clientes e os dados de melhoria de eficiência são resultados medidos pela OpenAI ou pelas empresas citadas no anúncio, não se pode presumir que sejam reproduzidos da mesma forma em todos os ambientes.

## Alteração dos preços da API em 30 de julho de 2026

Os novos preços da API do GPT-5.6 Luna e do Terra são os seguintes.

| Modelo | 1 milhão de tokens de entrada | 1 milhão de tokens de saída | Redução | Função principal |
|---|---:|---:|---:|---|
| GPT-5.6 Luna | US$ 0.20 | US$ 1.20 | 80% | Processamento em massa, tarefas repetitivas, atividades de execução claramente definidas |
| GPT-5.6 Terra | US$ 2 | US$ 12 | 20% | Tarefas cotidianas que exigem equilíbrio entre qualidade, custo e velocidade |
| GPT-5.6 Sol | Sem alteração no anúncio | Sem alteração no anúncio | Nenhuma | Raciocínio complexo, planejamento, decisões importantes |

Os preços das assinaturas pagas do ChatGPT e do Codex e o orçamento total de cotas não mudam com este anúncio. No entanto, a quantidade de créditos descontada ao usar Terra e Luna é reduzida. A OpenAI informou que a alteração dos preços via AWS seria aplicada gradualmente a partir do final do dia 30 de julho.

### Exemplo de cálculo do custo da API

O custo dos tokens pode ser calculado da seguinte forma.

`Custo total = número de tokens de entrada ÷ 1,000,000 × preço de entrada + número de tokens de saída ÷ 1,000,000 × preço de saída`

Por exemplo, ao processar 10 milhões de tokens de entrada e 2 milhões de tokens de saída, o custo baseado apenas no preço dos tokens seria o seguinte.

| Modelo | Custo de entrada | Custo de saída | Total |
|---|---:|---:|---:|
| Luna | US$ 2 | US$ 2.40 | US$ 4.40 |
| Terra | US$ 20 | US$ 24 | US$ 44 |

O valor efetivamente cobrado pode ser afetado por condições específicas de cada serviço, como a aplicação de cache, o método de processamento escolhido e a estrutura das chamadas de ferramentas.

## Funções da família GPT-5.6

GPT-5.6 não é um único modelo, mas uma família hierárquica composta por níveis com custos e desempenhos diferentes.

### GPT-5.6 Sol

Sol é responsável pelo nível mais elevado de raciocínio e pela solução de problemas complexos. É adequado para requisitos ambíguos, decisões com alto custo de falha, planejamento de longo prazo e revisão de resultados importantes.

### GPT-5.6 Terra

Terra busca equilibrar desempenho, custo e velocidade de resposta. É adequado para tarefas que exigem mais capacidade de decisão do que Luna, mas não precisam usar Sol o tempo todo, como perguntas e respostas internas de organizações, tarefas de agentes com escopo definido, análises gerais e programação.

### GPT-5.6 Luna

Luna é o nível mais rápido e econômico. Além de gerar frases curtas e simples, ele oferece suporte a chamadas de ferramentas e fluxos de trabalho com várias etapas, podendo ser usado como modelo de execução para repetir tarefas claramente definidas em grande escala.

As principais aplicações incluem:

- Classificação em massa de documentos e consultas de clientes
- Extração de dados estruturados
- Alterações repetitivas de código
- Criação e execução de testes
- Geração de documentos com regras claras
- Revisão de conteúdo em grande escala
- Automação de agentes em segundo plano
- Assistência em pesquisas repetitivas

A OpenAI afirma que Luna oferece desempenho semelhante ao de modelos considerados de ponta há 1 ano por cerca de 6% do custo estimado por tarefa e com velocidade quase 9 vezes maior. Nesse caso, 6% não é uma comparação direta dos preços por token, mas uma comparação do custo estimado para obter o mesmo resultado de uma tarefa.

## Características do Fast mode do Sol

O Fast mode para API foi introduzido no GPT-5.6 Sol. Ele substitui o Priority Processing existente e corresponde ao conceito do recurso `/fast` do Codex.

| Item | Fast mode |
|---|---|
| Velocidade | Até 2.5 vezes mais rápido que o processamento Standard |
| Inteligência do modelo | Igual à do Standard, segundo o anúncio da OpenAI |
| Preço | 2 vezes o preço do processamento Standard |
| Compatibilidade existente | Solicitações com a tag `priority` são processadas automaticamente pelo Fast mode |

A expressão “até 2.5 vezes” do Fast mode não garante que a latência de todas as solicitações será reduzida exatamente na mesma proporção. A velocidade percebida na prática pode variar de acordo com o tamanho do prompt, o tamanho da saída, a carga do serviço e o número de chamadas de ferramentas.

### Quando o Fast mode é adequado

- Serviços em tempo real nos quais o usuário espera pela resposta
- Ambientes de desenvolvimento que repetem rapidamente alterações e verificações de código
- Tarefas em que as chamadas ao Sol determinam a latência de todo o agente
- Situações em que até mesmo alguns minutos de atraso são importantes, como resposta a incidentes ou análise de falhas
- Atividades em que o custo gerado pelo atraso no processamento é maior que o custo adicional da API

Para tarefas cujo prazo de conclusão não é urgente, como lotes em segundo plano, análises noturnas e processamento assíncrono, o processamento Standard pode ser mais econômico.

## Critérios de seleção de modelos com foco nos resultados

Selecionar um modelo não é apenas uma questão de escolher o mais bem classificado. As seguintes perguntas devem ser analisadas para cada tarefa.

| Fator de decisão | Pergunta a verificar |
|---|---|
| Impacto da falha | Que impacto um erro teria sobre clientes, receita, segurança ou conformidade regulatória? |
| Tolerância a erros | Uma pessoa ou regras automáticas podem detectar os erros? |
| Latência | O usuário espera em tempo real ou o processamento pode ser assíncrono? |
| Volume de processamento | Quantos casos precisam ser processados por dia ou por mês? |
| Clareza do problema | A entrada, as regras e a saída esperada estão suficientemente definidas? |
| Valor do raciocínio | Um raciocínio mais poderoso melhora de forma significativa a qualidade real do resultado? |
| Possibilidade de validação | É possível avaliar o resultado por meio de testes, esquemas ou verificações cruzadas? |

Tarefas claras e que podem ser validadas automaticamente têm grande probabilidade de serem adequadas para Luna. Quando for necessária uma capacidade consistente de decisão, Terra pode ser considerado. Sol é adequado para resolver ambiguidades, tomar decisões de alto risco ou realizar a revisão final das consequências de uma falha.

## Estrutura de planejamento com Sol e execução com Luna

Mesmo dentro de uma única tarefa de agente, é possível atribuir modelos diferentes a cada etapa. Por exemplo, um agente de programação pode ser estruturado da seguinte forma.

1. Sol identifica ambiguidades nos requisitos e organiza as perguntas.
2. Sol determina o plano de implementação, o escopo das alterações e os fatores de risco.
3. Luna implementa em código as alterações que foram esclarecidas.
4. Luna cria e executa os testes.
5. Luna ou Terra avalia os resultados dos testes e as diferenças no código.
6. Sol revisa novamente apenas as conclusões importantes ou com alta probabilidade de falha.

Essa estrutura pode reduzir os custos em comparação com o uso de Sol em todas as etapas, concentrando a elevada capacidade de raciocínio nas decisões importantes. No entanto, ao dividir os modelos, é necessário projetar separadamente as regras de roteamento, o tratamento de erros, o rastreamento de logs e o sistema de avaliação.

## Três níveis de eficiência que sustentaram a redução de preços

A OpenAI explica que a redução de custos não foi apenas resultado de uma política de preços, mas de melhorias técnicas em três níveis.

1. Eficiência de tokens do próprio modelo
2. Eficiência de hardware do sistema de inferência
3. Eficiência do harness de agentes que conecta modelos, ferramentas e contexto

Essa explicação se baseia nos materiais técnicos publicados pela OpenAI, mas a estrutura detalhada de todos os custos não foi divulgada externamente. Portanto, é difícil determinar externamente quanto da redução de preços foi resultado da eficiência técnica e quanto decorreu da estratégia de preços.

## Otimização do modelo e do sistema de inferência

### Melhoria do volume de trabalho por token

Segundo a OpenAI, GPT-5.6 foi treinado para otimizar não apenas a taxa de sucesso das tarefas, mas também a eficiência de processamento. Isso significa que ele foi projetado para reduzir raciocínios desnecessariamente longos ou repetitivos e alcançar os resultados necessários usando menos tokens, aumentando a inteligência e o volume de trabalho por token.

### Distribuição de carga e roteamento de solicitações

O sistema de inferência distribui as solicitações entre data centers e clusters com base na região, na capacidade disponível e no tipo de acelerador. Dentro de cada cluster, a instância do modelo é selecionada considerando a carga atual, o tamanho do contexto de entrada, a possibilidade de uso do cache e as características da solicitação.

A OpenAI informou que usou GPT-5.6 Sol e Codex para analisar o tráfego de produção, investigar as causas de desequilíbrios de carga, testar estratégias de roteamento e ajustar heurísticas.

### Otimização de kernels de GPU

Os kernels de GPU são os códigos essenciais que executam as operações matemáticas do modelo no hardware. Mesmo usando a mesma GPU, o custo de processamento varia de acordo com a movimentação de memória, a sincronização, a organização dos dados e o método de paralelização.

Segundo a OpenAI, GPT-5.6 Sol participou da criação e otimização de kernels de produção usando Triton e Gluon no ambiente do Codex. A empresa informou que a combinação das melhorias nos kernels com otimizações relacionadas reduziu em 20% o custo de ponta a ponta da disponibilização do modelo.

O custo de ponta a ponta não se refere a uma única operação específica, mas ao custo de todo o processamento real de uma solicitação, incluindo roteamento, movimentação de dados, execução do modelo e geração da saída.

### Validação da precisão dos kernels

Mesmo um kernel rápido não pode ser usado se produzir resultados numericamente incorretos. A OpenAI explica que investiu em ferramentas de validação, incluindo FpSan, para verificar a precisão dos kernels criados por IA. FpSan é a abreviação de Floating-Point Sanitizer, uma ferramenta de código aberto que detecta erros relacionados a operações de ponto flutuante.

Isso mostra que, quando a IA gera código de infraestrutura de produção, são necessários não apenas benchmarks de desempenho, mas também validação numérica, testes de regressão e procedimentos de recuperação em caso de falha.

## Decodificação especulativa e cache KV

### Decodificação especulativa

A decodificação especulativa é um método no qual um pequeno modelo de rascunho propõe antecipadamente os próximos tokens, enquanto o modelo principal, maior, valida vários candidatos em paralelo. Quando as sugestões são aceitas, é possível reduzir o número de cálculos sequenciais caros realizados pelo modelo principal.

A OpenAI informou que GPT-5.6 Sol projetou e executou centenas de experimentos que alteraram o tamanho e a estrutura do modelo de rascunho, além de monitorar o treinamento. Como resultado, a eficiência de geração de tokens melhorou em pelo menos 15%.

### Cache KV e configurações por carga de trabalho

Ao processar a entrada, o modelo cria um cache Key-Value, ou cache KV. A configuração ideal varia conforme os tamanhos da entrada e da saída, o tamanho do lote, a taxa de acerto do cache, o número de solicitações simultâneas, a capacidade de memória e o método de fragmentação do modelo.

A OpenAI explica que usou Sol e Codex para analisar cargas de trabalho reais e avaliar configurações candidatas, ajustando detalhadamente a configuração do mecanismo para cada tipo de tarefa. O objetivo é processar mais solicitações no mesmo hardware.

## Harness de agentes e custo de contexto

Um agente chama o modelo e as ferramentas várias vezes para resolver uma única solicitação do usuário. Em uma tarefa que exige 30 chamadas ao modelo, se cada chamada tiver 1 segundo de atraso desnecessário, a latência total pode aumentar em cerca de 30 segundos.

A OpenAI descreve como harness de agentes a camada de orquestração baseada em Rust que conecta o modelo, as ferramentas e o ambiente do usuário.

### Exposição tardia apenas das ferramentas necessárias

Incluir desde o início no prompt todas as informações de ferramentas, plugins, habilidades e integrações MCP aumenta o número de tokens de entrada e a latência. O harness usa um método de descoberta tardia que expõe as informações das ferramentas relevantes apenas quando elas são necessárias. A OpenAI informou que as saídas das ferramentas são limitadas, por padrão, a 10 mil tokens, a menos que o modelo solicite um limite separado.

### Preservação exata do prefixo e cache de prompts

O cache de prompts reutiliza a parte inicial idêntica de uma entrada processada anteriormente para reduzir cálculos redundantes. Para reutilizar o cache, o prefixo do prompt precisa ser exatamente igual.

O harness da OpenAI gerencia o histórico em uma estrutura somente de anexação e acrescenta novas mensagens e resultados de ferramentas ao final. As ferramentas são apresentadas em uma ordem determinística, enquanto configurações de execução, como políticas de aprovação, são aplicadas em tempo de execução sem alterar a própria definição das ferramentas. Essa abordagem favorece o aumento da taxa de acerto do cache em loops repetitivos de agentes.

## Como interpretar os números de casos empresariais

O anúncio oficial da OpenAI incluiu avaliações de Replit, Notion, Ramp, Blitzy, Cognition, Dust e outras empresas.

- Notion informou que, em sua própria avaliação, Terra ofereceu qualidade semelhante à do GPT-5.5 pela metade do custo por tarefa e em um tempo 60% menor.
- Blitzy explicou que, após adotar Luna, a taxa de reutilização do cache de prompts aumentou de 24% para 90%, enquanto o custo ficou 87% menor que o do modelo padrão anterior.
- Dust informou que, nas mesmas tarefas de agente, Luna foi 40% mais rápido e 40% mais econômico que o modelo padrão anterior.
- Ramp informou que usa Luna como modelo padrão para a automação de agentes em segundo plano.

Esses números são casos medidos com base nas tarefas internas, prompts, critérios de avaliação e estruturas de sistemas de cada empresa. Como não são benchmarks comuns e independentes, não devem ser aplicados diretamente às atividades de outras organizações. Antes da adoção, é necessário realizar uma avaliação própria que reflita dados reais e o custo dos erros.

## Lista de verificação para validação antes da adoção

1. Prepare uma amostra representativa de tarefas e as respostas corretas ou os critérios de avaliação.
2. Compare as taxas de sucesso e de novas tentativas de Luna, Terra e Sol nas mesmas condições.
3. Inclua não apenas o custo dos tokens, mas também as chamadas de ferramentas, o pessoal de revisão e o custo de recuperação de falhas.
4. Meça a latência dos 95% ou 99% superiores, além da latência média.
5. Classifique como candidatas a modelos econômicos as etapas em que testes automáticos ou validação por esquema são possíveis.
6. Aplique políticas separadas de aprovação e registro a tarefas relacionadas a dados pessoais, segurança e regulamentação.
7. Defina os critérios de roteamento para encaminhar resultados de baixa confiabilidade ao Terra ou ao Sol.
8. Valide com tráfego real se o valor da redução da latência é maior que o custo adicional do Fast mode.

## Significado e limitações

Essa reformulação mostra que o critério da concorrência entre modelos de IA está migrando de uma única pontuação máxima para o custo por resultado. Ao atribuir Luna a tarefas repetitivas em grande escala, Terra ao trabalho cotidiano de conhecimento e Sol a decisões ambíguas e importantes, é possível combinar inteligência, velocidade e custo conforme cada atividade.

No entanto, é difícil separar, apenas com as informações públicas, quanto da redução de preço de 80% decorreu de melhorias na eficiência técnica e quanto veio da estratégia de mercado. Além disso, a viabilidade econômica de um modelo de baixo custo não é determinada apenas pelo preço dos tokens. Se uma taxa de erros elevada aumentar o número de novas tentativas e revisões humanas, o custo total da tarefa poderá subir.

Portanto, o indicador principal não é o preço de uma única chamada ao modelo, mas o custo total para produzir um resultado que tenha passado pela validação. É necessário medir em conjunto a taxa de sucesso de cada modelo, o número de novas tentativas, a latência e o custo de revisão para determinar se a redução dos preços do GPT-5.6 se traduz em valor comercial real.

## FAQ

### Qual é o novo preço da API do GPT-5.6 Luna?
Em 30 de julho de 2026, o Luna custa 0.20 dólar por 1 milhão de tokens de entrada e 1.20 dólar por 1 milhão de tokens de saída. A redução anunciada pela OpenAI em relação ao preço anterior é de 80%.

### Qual é o novo preço da API do GPT-5.6 Terra?
O Terra custa 2 dólares por 1 milhão de tokens de entrada e 12 dólares por 1 milhão de tokens de saída. A redução de preço anunciada pela OpenAI é de 20%.

### O preço do GPT-5.6 Sol também foi reduzido?
Não. Neste anúncio da OpenAI, o preço do processamento Standard do Sol não mudou. Em vez disso, foi adicionado o Fast mode, que é até 2.5 vezes mais rápido que o Standard e custa o dobro.

### A qualidade das respostas do modelo diminui ao usar o Fast mode?
A OpenAI explica que o Fast mode aumenta a velocidade de processamento sem reduzir o nível de inteligência do Sol. No entanto, a velocidade de até 2.5 vezes é um limite máximo, e a latência real pode variar conforme o tamanho da solicitação, o volume de saída, as chamadas de ferramentas e a carga do sistema.

### É necessário modificar as solicitações existentes do Priority Processing?
Segundo o anúncio da OpenAI, a tag `priority` das solicitações existentes da API continuará funcionando e será vinculada automaticamente ao processamento do Fast mode. Em ambientes de produção, é mais seguro verificar separadamente quando a mudança entrará em vigor e os valores efetivamente cobrados.

### Para quais tarefas é adequado usar o Luna?
É adequado para tarefas repetitivas e em grande escala, com regras e resultados esperados claros e que possam ser verificados automaticamente. Classificação de documentos, extração de dados, alterações repetitivas de código, execução de testes, revisão de conteúdo e automação em segundo plano são exemplos representativos.

### Qual modelo devo escolher entre Terra e Luna?
Se o baixo custo e a alta capacidade de processamento forem prioritários e a tarefa estiver bem definida, é possível começar avaliando o Luna. Se for necessário compreender mais contexto e ter maior capacidade de julgamento, mas sem precisar do raciocínio avançado no nível do Sol, o Terra pode ser adequado.

### Não posso usar o Sol em todas as etapas do agente?
É possível, mas a eficiência de custos pode diminuir. Separar as funções para que o Sol cuide do planejamento e das decisões de alto risco, enquanto o Luna ou o Terra processa execuções e testes claramente definidos, pode reduzir o custo total e, ao mesmo tempo, manter a qualidade das etapas importantes.

### O custo por tarefa de 6% do Luna é uma comparação dos preços por token?
Não. Os cerca de 6% mencionados pela OpenAI são o custo estimado por tarefa necessário para obter resultados semelhantes aos do modelo usado na comparação. Esse número não foi calculado apenas pela divisão direta dos preços por token e deve ser entendido como uma comparação que inclui as tarefas de avaliação e a taxa de sucesso.

### Como avaliar a viabilidade econômica real de um modelo de API?
Além do preço dos tokens, é preciso incluir a taxa de sucesso, o número de novas tentativas, os custos das chamadas de ferramentas, a latência das respostas, o tempo de revisão humana e os custos de recuperação de erros. O indicador mais útil é o custo total por resultado aprovado na verificação.

## Sources

- [Expandindo a fronteira da relação preço-desempenho com GPT-5.6 | OpenAI](https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/)
- [Como o GPT-5.6 combina inteligência de ponta com eficiência de ponta | OpenAI](https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/)

## Images

![Fluxo de seleção de modelos com peças, chips de IA, esteira de tarefas e pilhas de moedas decrescentes](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--5c50f46b468b0057808eb3e6351730cbce2f4b78/ai-4f6037ef.webp)
![Infográfico comparando fluxos, velocidade, custo e infraestrutura de modelos de IA](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY3NSwicHVyIjoiYmxvYl9pZCJ9fQ==--920476799a53738205d619a3a057685b5af9d05d/ai-334533bc.webp)