{"content_id":"aillofw1zj","slug":"openai-gpt-5-6-price-performance-model-routing","locale":"pt","schema_type":"TechArticle","category":"ai_data","category_name":"Dados de IA","title":"Reformulação de preços e velocidade do OpenAI GPT-5.6 e estratégia de seleção de modelos","summary":"A partir de 30 de julho de 2026, a OpenAI reduziu em 80% e 20%, respectivamente, os preços da API do GPT-5.6 Luna e Terra e introduziu o Fast mode no Sol. Essa reformulação se concentra em uma estratégia que reduz o custo por resultado ao distribuir os modelos conforme as etapas de planejamento, execução e verificação, em vez de usar o modelo mais avançado em todas as tarefas.","author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["O preço da API do GPT-5.6 Luna caiu para US$ 0,20 por 1 milhão de tokens de entrada e US$ 1,20 por 1 milhão de tokens de saída.","O preço da API do GPT-5.6 Terra caiu para US$ 2 por 1 milhão de tokens de entrada e US$ 12 por 1 milhão de tokens de saída.","Segundo o anúncio, o Fast mode do GPT-5.6 Sol é até 2,5 vezes mais rápido que o processamento Standard, custa o dobro e mantém o nível de inteligência do modelo.","As empresas podem adotar uma configuração hierárquica na qual o Sol realiza julgamentos e planejamentos complexos, enquanto o Luna ou o Terra cuida da execução repetitiva e da verificação.","A OpenAI explica que a otimização conjunta dos modelos, da infraestrutura de inferência e do harness de agentes possibilitou a redução de preços e a melhoria da capacidade de processamento."],"content_markdown":"OpenAI vinculou as melhorias na eficiência de execução da família GPT-5.6 à redução dos preços da API e ao aumento da velocidade de processamento. O ponto central não é aplicar o modelo mais poderoso a todas as tarefas, mas combinar Sol, Terra e Luna de acordo com o risco, a complexidade, a latência e a possibilidade de validação de cada tarefa para reduzir o custo por resultado.\n\nOs números de preço e desempenho têm como base o anúncio feito pela OpenAI em 30 de julho de 2026. Como os benchmarks de clientes e os dados de melhoria de eficiência são resultados medidos pela OpenAI ou pelas empresas citadas no anúncio, não se pode presumir que sejam reproduzidos da mesma forma em todos os ambientes.\n\n## Alteração dos preços da API em 30 de julho de 2026\n\nOs novos preços da API do GPT-5.6 Luna e do Terra são os seguintes.\n\n| Modelo | 1 milhão de tokens de entrada | 1 milhão de tokens de saída | Redução | Função principal |\n|---|---:|---:|---:|---|\n| GPT-5.6 Luna | US$ 0.20 | US$ 1.20 | 80% | Processamento em massa, tarefas repetitivas, atividades de execução claramente definidas |\n| GPT-5.6 Terra | US$ 2 | US$ 12 | 20% | Tarefas cotidianas que exigem equilíbrio entre qualidade, custo e velocidade |\n| GPT-5.6 Sol | Sem alteração no anúncio | Sem alteração no anúncio | Nenhuma | Raciocínio complexo, planejamento, decisões importantes |\n\nOs preços das assinaturas pagas do ChatGPT e do Codex e o orçamento total de cotas não mudam com este anúncio. No entanto, a quantidade de créditos descontada ao usar Terra e Luna é reduzida. A OpenAI informou que a alteração dos preços via AWS seria aplicada gradualmente a partir do final do dia 30 de julho.\n\n### Exemplo de cálculo do custo da API\n\nO custo dos tokens pode ser calculado da seguinte forma.\n\n`Custo total = número de tokens de entrada ÷ 1,000,000 × preço de entrada + número de tokens de saída ÷ 1,000,000 × preço de saída`\n\nPor exemplo, ao processar 10 milhões de tokens de entrada e 2 milhões de tokens de saída, o custo baseado apenas no preço dos tokens seria o seguinte.\n\n| Modelo | Custo de entrada | Custo de saída | Total |\n|---|---:|---:|---:|\n| Luna | US$ 2 | US$ 2.40 | US$ 4.40 |\n| Terra | US$ 20 | US$ 24 | US$ 44 |\n\nO valor efetivamente cobrado pode ser afetado por condições específicas de cada serviço, como a aplicação de cache, o método de processamento escolhido e a estrutura das chamadas de ferramentas.\n\n## Funções da família GPT-5.6\n\nGPT-5.6 não é um único modelo, mas uma família hierárquica composta por níveis com custos e desempenhos diferentes.\n\n### GPT-5.6 Sol\n\nSol é responsável pelo nível mais elevado de raciocínio e pela solução de problemas complexos. É adequado para requisitos ambíguos, decisões com alto custo de falha, planejamento de longo prazo e revisão de resultados importantes.\n\n### GPT-5.6 Terra\n\nTerra busca equilibrar desempenho, custo e velocidade de resposta. É adequado para tarefas que exigem mais capacidade de decisão do que Luna, mas não precisam usar Sol o tempo todo, como perguntas e respostas internas de organizações, tarefas de agentes com escopo definido, análises gerais e programação.\n\n### GPT-5.6 Luna\n\nLuna é o nível mais rápido e econômico. Além de gerar frases curtas e simples, ele oferece suporte a chamadas de ferramentas e fluxos de trabalho com várias etapas, podendo ser usado como modelo de execução para repetir tarefas claramente definidas em grande escala.\n\nAs principais aplicações incluem:\n\n- Classificação em massa de documentos e consultas de clientes\n- Extração de dados estruturados\n- Alterações repetitivas de código\n- Criação e execução de testes\n- Geração de documentos com regras claras\n- Revisão de conteúdo em grande escala\n- Automação de agentes em segundo plano\n- Assistência em pesquisas repetitivas\n\nA OpenAI afirma que Luna oferece desempenho semelhante ao de modelos considerados de ponta há 1 ano por cerca de 6% do custo estimado por tarefa e com velocidade quase 9 vezes maior. Nesse caso, 6% não é uma comparação direta dos preços por token, mas uma comparação do custo estimado para obter o mesmo resultado de uma tarefa.\n\n## Características do Fast mode do Sol\n\nO Fast mode para API foi introduzido no GPT-5.6 Sol. Ele substitui o Priority Processing existente e corresponde ao conceito do recurso `/fast` do Codex.\n\n| Item | Fast mode |\n|---|---|\n| Velocidade | Até 2.5 vezes mais rápido que o processamento Standard |\n| Inteligência do modelo | Igual à do Standard, segundo o anúncio da OpenAI |\n| Preço | 2 vezes o preço do processamento Standard |\n| Compatibilidade existente | Solicitações com a tag `priority` são processadas automaticamente pelo Fast mode |\n\nA expressão “até 2.5 vezes” do Fast mode não garante que a latência de todas as solicitações será reduzida exatamente na mesma proporção. A velocidade percebida na prática pode variar de acordo com o tamanho do prompt, o tamanho da saída, a carga do serviço e o número de chamadas de ferramentas.\n\n### Quando o Fast mode é adequado\n\n- Serviços em tempo real nos quais o usuário espera pela resposta\n- Ambientes de desenvolvimento que repetem rapidamente alterações e verificações de código\n- Tarefas em que as chamadas ao Sol determinam a latência de todo o agente\n- Situações em que até mesmo alguns minutos de atraso são importantes, como resposta a incidentes ou análise de falhas\n- Atividades em que o custo gerado pelo atraso no processamento é maior que o custo adicional da API\n\nPara tarefas cujo prazo de conclusão não é urgente, como lotes em segundo plano, análises noturnas e processamento assíncrono, o processamento Standard pode ser mais econômico.\n\n## Critérios de seleção de modelos com foco nos resultados\n\nSelecionar um modelo não é apenas uma questão de escolher o mais bem classificado. As seguintes perguntas devem ser analisadas para cada tarefa.\n\n| Fator de decisão | Pergunta a verificar |\n|---|---|\n| Impacto da falha | Que impacto um erro teria sobre clientes, receita, segurança ou conformidade regulatória? |\n| Tolerância a erros | Uma pessoa ou regras automáticas podem detectar os erros? |\n| Latência | O usuário espera em tempo real ou o processamento pode ser assíncrono? |\n| Volume de processamento | Quantos casos precisam ser processados por dia ou por mês? |\n| Clareza do problema | A entrada, as regras e a saída esperada estão suficientemente definidas? |\n| Valor do raciocínio | Um raciocínio mais poderoso melhora de forma significativa a qualidade real do resultado? |\n| Possibilidade de validação | É possível avaliar o resultado por meio de testes, esquemas ou verificações cruzadas? |\n\nTarefas claras e que podem ser validadas automaticamente têm grande probabilidade de serem adequadas para Luna. Quando for necessária uma capacidade consistente de decisão, Terra pode ser considerado. Sol é adequado para resolver ambiguidades, tomar decisões de alto risco ou realizar a revisão final das consequências de uma falha.\n\n## Estrutura de planejamento com Sol e execução com Luna\n\nMesmo dentro de uma única tarefa de agente, é possível atribuir modelos diferentes a cada etapa. Por exemplo, um agente de programação pode ser estruturado da seguinte forma.\n\n1. Sol identifica ambiguidades nos requisitos e organiza as perguntas.\n2. Sol determina o plano de implementação, o escopo das alterações e os fatores de risco.\n3. Luna implementa em código as alterações que foram esclarecidas.\n4. Luna cria e executa os testes.\n5. Luna ou Terra avalia os resultados dos testes e as diferenças no código.\n6. Sol revisa novamente apenas as conclusões importantes ou com alta probabilidade de falha.\n\nEssa estrutura pode reduzir os custos em comparação com o uso de Sol em todas as etapas, concentrando a elevada capacidade de raciocínio nas decisões importantes. No entanto, ao dividir os modelos, é necessário projetar separadamente as regras de roteamento, o tratamento de erros, o rastreamento de logs e o sistema de avaliação.\n\n## Três níveis de eficiência que sustentaram a redução de preços\n\nA OpenAI explica que a redução de custos não foi apenas resultado de uma política de preços, mas de melhorias técnicas em três níveis.\n\n1. Eficiência de tokens do próprio modelo\n2. Eficiência de hardware do sistema de inferência\n3. Eficiência do harness de agentes que conecta modelos, ferramentas e contexto\n\nEssa explicação se baseia nos materiais técnicos publicados pela OpenAI, mas a estrutura detalhada de todos os custos não foi divulgada externamente. Portanto, é difícil determinar externamente quanto da redução de preços foi resultado da eficiência técnica e quanto decorreu da estratégia de preços.\n\n## Otimização do modelo e do sistema de inferência\n\n### Melhoria do volume de trabalho por token\n\nSegundo a OpenAI, GPT-5.6 foi treinado para otimizar não apenas a taxa de sucesso das tarefas, mas também a eficiência de processamento. Isso significa que ele foi projetado para reduzir raciocínios desnecessariamente longos ou repetitivos e alcançar os resultados necessários usando menos tokens, aumentando a inteligência e o volume de trabalho por token.\n\n### Distribuição de carga e roteamento de solicitações\n\nO sistema de inferência distribui as solicitações entre data centers e clusters com base na região, na capacidade disponível e no tipo de acelerador. Dentro de cada cluster, a instância do modelo é selecionada considerando a carga atual, o tamanho do contexto de entrada, a possibilidade de uso do cache e as características da solicitação.\n\nA OpenAI informou que usou GPT-5.6 Sol e Codex para analisar o tráfego de produção, investigar as causas de desequilíbrios de carga, testar estratégias de roteamento e ajustar heurísticas.\n\n### Otimização de kernels de GPU\n\nOs kernels de GPU são os códigos essenciais que executam as operações matemáticas do modelo no hardware. Mesmo usando a mesma GPU, o custo de processamento varia de acordo com a movimentação de memória, a sincronização, a organização dos dados e o método de paralelização.\n\nSegundo a OpenAI, GPT-5.6 Sol participou da criação e otimização de kernels de produção usando Triton e Gluon no ambiente do Codex. A empresa informou que a combinação das melhorias nos kernels com otimizações relacionadas reduziu em 20% o custo de ponta a ponta da disponibilização do modelo.\n\nO custo de ponta a ponta não se refere a uma única operação específica, mas ao custo de todo o processamento real de uma solicitação, incluindo roteamento, movimentação de dados, execução do modelo e geração da saída.\n\n### Validação da precisão dos kernels\n\nMesmo um kernel rápido não pode ser usado se produzir resultados numericamente incorretos. A OpenAI explica que investiu em ferramentas de validação, incluindo FpSan, para verificar a precisão dos kernels criados por IA. FpSan é a abreviação de Floating-Point Sanitizer, uma ferramenta de código aberto que detecta erros relacionados a operações de ponto flutuante.\n\nIsso mostra que, quando a IA gera código de infraestrutura de produção, são necessários não apenas benchmarks de desempenho, mas também validação numérica, testes de regressão e procedimentos de recuperação em caso de falha.\n\n## Decodificação especulativa e cache KV\n\n### Decodificação especulativa\n\nA decodificação especulativa é um método no qual um pequeno modelo de rascunho propõe antecipadamente os próximos tokens, enquanto o modelo principal, maior, valida vários candidatos em paralelo. Quando as sugestões são aceitas, é possível reduzir o número de cálculos sequenciais caros realizados pelo modelo principal.\n\nA OpenAI informou que GPT-5.6 Sol projetou e executou centenas de experimentos que alteraram o tamanho e a estrutura do modelo de rascunho, além de monitorar o treinamento. Como resultado, a eficiência de geração de tokens melhorou em pelo menos 15%.\n\n### Cache KV e configurações por carga de trabalho\n\nAo processar a entrada, o modelo cria um cache Key-Value, ou cache KV. A configuração ideal varia conforme os tamanhos da entrada e da saída, o tamanho do lote, a taxa de acerto do cache, o número de solicitações simultâneas, a capacidade de memória e o método de fragmentação do modelo.\n\nA OpenAI explica que usou Sol e Codex para analisar cargas de trabalho reais e avaliar configurações candidatas, ajustando detalhadamente a configuração do mecanismo para cada tipo de tarefa. O objetivo é processar mais solicitações no mesmo hardware.\n\n## Harness de agentes e custo de contexto\n\nUm agente chama o modelo e as ferramentas várias vezes para resolver uma única solicitação do usuário. Em uma tarefa que exige 30 chamadas ao modelo, se cada chamada tiver 1 segundo de atraso desnecessário, a latência total pode aumentar em cerca de 30 segundos.\n\nA OpenAI descreve como harness de agentes a camada de orquestração baseada em Rust que conecta o modelo, as ferramentas e o ambiente do usuário.\n\n### Exposição tardia apenas das ferramentas necessárias\n\nIncluir desde o início no prompt todas as informações de ferramentas, plugins, habilidades e integrações MCP aumenta o número de tokens de entrada e a latência. O harness usa um método de descoberta tardia que expõe as informações das ferramentas relevantes apenas quando elas são necessárias. A OpenAI informou que as saídas das ferramentas são limitadas, por padrão, a 10 mil tokens, a menos que o modelo solicite um limite separado.\n\n### Preservação exata do prefixo e cache de prompts\n\nO cache de prompts reutiliza a parte inicial idêntica de uma entrada processada anteriormente para reduzir cálculos redundantes. Para reutilizar o cache, o prefixo do prompt precisa ser exatamente igual.\n\nO harness da OpenAI gerencia o histórico em uma estrutura somente de anexação e acrescenta novas mensagens e resultados de ferramentas ao final. As ferramentas são apresentadas em uma ordem determinística, enquanto configurações de execução, como políticas de aprovação, são aplicadas em tempo de execução sem alterar a própria definição das ferramentas. Essa abordagem favorece o aumento da taxa de acerto do cache em loops repetitivos de agentes.\n\n## Como interpretar os números de casos empresariais\n\nO anúncio oficial da OpenAI incluiu avaliações de Replit, Notion, Ramp, Blitzy, Cognition, Dust e outras empresas.\n\n- Notion informou que, em sua própria avaliação, Terra ofereceu qualidade semelhante à do GPT-5.5 pela metade do custo por tarefa e em um tempo 60% menor.\n- Blitzy explicou que, após adotar Luna, a taxa de reutilização do cache de prompts aumentou de 24% para 90%, enquanto o custo ficou 87% menor que o do modelo padrão anterior.\n- Dust informou que, nas mesmas tarefas de agente, Luna foi 40% mais rápido e 40% mais econômico que o modelo padrão anterior.\n- Ramp informou que usa Luna como modelo padrão para a automação de agentes em segundo plano.\n\nEsses números são casos medidos com base nas tarefas internas, prompts, critérios de avaliação e estruturas de sistemas de cada empresa. Como não são benchmarks comuns e independentes, não devem ser aplicados diretamente às atividades de outras organizações. Antes da adoção, é necessário realizar uma avaliação própria que reflita dados reais e o custo dos erros.\n\n## Lista de verificação para validação antes da adoção\n\n1. Prepare uma amostra representativa de tarefas e as respostas corretas ou os critérios de avaliação.\n2. Compare as taxas de sucesso e de novas tentativas de Luna, Terra e Sol nas mesmas condições.\n3. Inclua não apenas o custo dos tokens, mas também as chamadas de ferramentas, o pessoal de revisão e o custo de recuperação de falhas.\n4. Meça a latência dos 95% ou 99% superiores, além da latência média.\n5. Classifique como candidatas a modelos econômicos as etapas em que testes automáticos ou validação por esquema são possíveis.\n6. Aplique políticas separadas de aprovação e registro a tarefas relacionadas a dados pessoais, segurança e regulamentação.\n7. Defina os critérios de roteamento para encaminhar resultados de baixa confiabilidade ao Terra ou ao Sol.\n8. Valide com tráfego real se o valor da redução da latência é maior que o custo adicional do Fast mode.\n\n## Significado e limitações\n\nEssa reformulação mostra que o critério da concorrência entre modelos de IA está migrando de uma única pontuação máxima para o custo por resultado. Ao atribuir Luna a tarefas repetitivas em grande escala, Terra ao trabalho cotidiano de conhecimento e Sol a decisões ambíguas e importantes, é possível combinar inteligência, velocidade e custo conforme cada atividade.\n\nNo entanto, é difícil separar, apenas com as informações públicas, quanto da redução de preço de 80% decorreu de melhorias na eficiência técnica e quanto veio da estratégia de mercado. Além disso, a viabilidade econômica de um modelo de baixo custo não é determinada apenas pelo preço dos tokens. Se uma taxa de erros elevada aumentar o número de novas tentativas e revisões humanas, o custo total da tarefa poderá subir.\n\nPortanto, o indicador principal não é o preço de uma única chamada ao modelo, mas o custo total para produzir um resultado que tenha passado pela validação. É necessário medir em conjunto a taxa de sucesso de cada modelo, o número de novas tentativas, a latência e o custo de revisão para determinar se a redução dos preços do GPT-5.6 se traduz em valor comercial real.","content_html":"\u003cp\u003eOpenAI vinculou as melhorias na eficiência de execução da família GPT-5.6 à redução dos preços da API e ao aumento da velocidade de processamento. O ponto central não é aplicar o modelo mais poderoso a todas as tarefas, mas combinar Sol, Terra e Luna de acordo com o risco, a complexidade, a latência e a possibilidade de validação de cada tarefa para reduzir o custo por resultado.\u003c/p\u003e\n\u003cp\u003eOs números de preço e desempenho têm como base o anúncio feito pela OpenAI em 30 de julho de 2026. Como os benchmarks de clientes e os dados de melhoria de eficiência são resultados medidos pela OpenAI ou pelas empresas citadas no anúncio, não se pode presumir que sejam reproduzidos da mesma forma em todos os ambientes.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#altera%C3%A7%C3%A3o-dos-pre%C3%A7os-da-api-em-30-de-julho-de-2026\" class=\"anchor\" id=\"alteração-dos-preços-da-api-em-30-de-julho-de-2026\"\u003e\u003c/a\u003eAlteração dos preços da API em 30 de julho de 2026\u003c/h2\u003e\n\u003cp\u003eOs novos preços da API do GPT-5.6 Luna e do Terra são os seguintes.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModelo\u003c/th\u003e\n\u003cth\u003e1 milhão de tokens de entrada\u003c/th\u003e\n\u003cth\u003e1 milhão de tokens de saída\u003c/th\u003e\n\u003cth\u003eRedução\u003c/th\u003e\n\u003cth\u003eFunção principal\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eGPT-5.6 Luna\u003c/td\u003e\n\u003ctd data-label=\"1 milhão de tokens de entrada\"\u003eUS$ 0.20\u003c/td\u003e\n\u003ctd data-label=\"1 milhão de tokens de saída\"\u003eUS$ 1.20\u003c/td\u003e\n\u003ctd data-label=\"Redução\"\u003e80%\u003c/td\u003e\n\u003ctd data-label=\"Função principal\"\u003eProcessamento em massa, tarefas repetitivas, atividades de execução claramente definidas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eGPT-5.6 Terra\u003c/td\u003e\n\u003ctd data-label=\"1 milhão de tokens de entrada\"\u003eUS$ 2\u003c/td\u003e\n\u003ctd data-label=\"1 milhão de tokens de saída\"\u003eUS$ 12\u003c/td\u003e\n\u003ctd data-label=\"Redução\"\u003e20%\u003c/td\u003e\n\u003ctd data-label=\"Função principal\"\u003eTarefas cotidianas que exigem equilíbrio entre qualidade, custo e velocidade\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eGPT-5.6 Sol\u003c/td\u003e\n\u003ctd data-label=\"1 milhão de tokens de entrada\"\u003eSem alteração no anúncio\u003c/td\u003e\n\u003ctd data-label=\"1 milhão de tokens de saída\"\u003eSem alteração no anúncio\u003c/td\u003e\n\u003ctd data-label=\"Redução\"\u003eNenhuma\u003c/td\u003e\n\u003ctd data-label=\"Função principal\"\u003eRaciocínio complexo, planejamento, decisões importantes\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eOs preços das assinaturas pagas do ChatGPT e do Codex e o orçamento total de cotas não mudam com este anúncio. No entanto, a quantidade de créditos descontada ao usar Terra e Luna é reduzida. A OpenAI informou que a alteração dos preços via AWS seria aplicada gradualmente a partir do final do dia 30 de julho.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#exemplo-de-c%C3%A1lculo-do-custo-da-api\" class=\"anchor\" id=\"exemplo-de-cálculo-do-custo-da-api\"\u003e\u003c/a\u003eExemplo de cálculo do custo da API\u003c/h3\u003e\n\u003cp\u003eO custo dos tokens pode ser calculado da seguinte forma.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eCusto total = número de tokens de entrada ÷ 1,000,000 × preço de entrada + número de tokens de saída ÷ 1,000,000 × preço de saída\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003ePor exemplo, ao processar 10 milhões de tokens de entrada e 2 milhões de tokens de saída, o custo baseado apenas no preço dos tokens seria o seguinte.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModelo\u003c/th\u003e\n\u003cth\u003eCusto de entrada\u003c/th\u003e\n\u003cth\u003eCusto de saída\u003c/th\u003e\n\u003cth\u003eTotal\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eLuna\u003c/td\u003e\n\u003ctd data-label=\"Custo de entrada\"\u003eUS$ 2\u003c/td\u003e\n\u003ctd data-label=\"Custo de saída\"\u003eUS$ 2.40\u003c/td\u003e\n\u003ctd data-label=\"Total\"\u003eUS$ 4.40\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eTerra\u003c/td\u003e\n\u003ctd data-label=\"Custo de entrada\"\u003eUS$ 20\u003c/td\u003e\n\u003ctd data-label=\"Custo de saída\"\u003eUS$ 24\u003c/td\u003e\n\u003ctd data-label=\"Total\"\u003eUS$ 44\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eO valor efetivamente cobrado pode ser afetado por condições específicas de cada serviço, como a aplicação de cache, o método de processamento escolhido e a estrutura das chamadas de ferramentas.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#fun%C3%A7%C3%B5es-da-fam%C3%ADlia-gpt-56\" class=\"anchor\" id=\"funções-da-família-gpt-56\"\u003e\u003c/a\u003eFunções da família GPT-5.6\u003c/h2\u003e\n\u003cp\u003eGPT-5.6 não é um único modelo, mas uma família hierárquica composta por níveis com custos e desempenhos diferentes.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-sol\" class=\"anchor\" id=\"gpt-56-sol\"\u003e\u003c/a\u003eGPT-5.6 Sol\u003c/h3\u003e\n\u003cp\u003eSol é responsável pelo nível mais elevado de raciocínio e pela solução de problemas complexos. É adequado para requisitos ambíguos, decisões com alto custo de falha, planejamento de longo prazo e revisão de resultados importantes.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-terra\" class=\"anchor\" id=\"gpt-56-terra\"\u003e\u003c/a\u003eGPT-5.6 Terra\u003c/h3\u003e\n\u003cp\u003eTerra busca equilibrar desempenho, custo e velocidade de resposta. É adequado para tarefas que exigem mais capacidade de decisão do que Luna, mas não precisam usar Sol o tempo todo, como perguntas e respostas internas de organizações, tarefas de agentes com escopo definido, análises gerais e programação.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-luna\" class=\"anchor\" id=\"gpt-56-luna\"\u003e\u003c/a\u003eGPT-5.6 Luna\u003c/h3\u003e\n\u003cp\u003eLuna é o nível mais rápido e econômico. Além de gerar frases curtas e simples, ele oferece suporte a chamadas de ferramentas e fluxos de trabalho com várias etapas, podendo ser usado como modelo de execução para repetir tarefas claramente definidas em grande escala.\u003c/p\u003e\n\u003cp\u003eAs principais aplicações incluem:\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eClassificação em massa de documentos e consultas de clientes\u003c/li\u003e\n\u003cli\u003eExtração de dados estruturados\u003c/li\u003e\n\u003cli\u003eAlterações repetitivas de código\u003c/li\u003e\n\u003cli\u003eCriação e execução de testes\u003c/li\u003e\n\u003cli\u003eGeração de documentos com regras claras\u003c/li\u003e\n\u003cli\u003eRevisão de conteúdo em grande escala\u003c/li\u003e\n\u003cli\u003eAutomação de agentes em segundo plano\u003c/li\u003e\n\u003cli\u003eAssistência em pesquisas repetitivas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eA OpenAI afirma que Luna oferece desempenho semelhante ao de modelos considerados de ponta há 1 ano por cerca de 6% do custo estimado por tarefa e com velocidade quase 9 vezes maior. Nesse caso, 6% não é uma comparação direta dos preços por token, mas uma comparação do custo estimado para obter o mesmo resultado de uma tarefa.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#caracter%C3%ADsticas-do-fast-mode-do-sol\" class=\"anchor\" id=\"características-do-fast-mode-do-sol\"\u003e\u003c/a\u003eCaracterísticas do Fast mode do Sol\u003c/h2\u003e\n\u003cp\u003eO Fast mode para API foi introduzido no GPT-5.6 Sol. Ele substitui o Priority Processing existente e corresponde ao conceito do recurso \u003ccode\u003e/fast\u003c/code\u003e do Codex.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eItem\u003c/th\u003e\n\u003cth\u003eFast mode\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eVelocidade\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eAté 2.5 vezes mais rápido que o processamento Standard\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eInteligência do modelo\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eIgual à do Standard, segundo o anúncio da OpenAI\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003ePreço\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003e2 vezes o preço do processamento Standard\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eCompatibilidade existente\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eSolicitações com a tag \u003ccode\u003epriority\u003c/code\u003e são processadas automaticamente pelo Fast mode\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eA expressão “até 2.5 vezes” do Fast mode não garante que a latência de todas as solicitações será reduzida exatamente na mesma proporção. A velocidade percebida na prática pode variar de acordo com o tamanho do prompt, o tamanho da saída, a carga do serviço e o número de chamadas de ferramentas.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#quando-o-fast-mode-%C3%A9-adequado\" class=\"anchor\" id=\"quando-o-fast-mode-é-adequado\"\u003e\u003c/a\u003eQuando o Fast mode é adequado\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eServiços em tempo real nos quais o usuário espera pela resposta\u003c/li\u003e\n\u003cli\u003eAmbientes de desenvolvimento que repetem rapidamente alterações e verificações de código\u003c/li\u003e\n\u003cli\u003eTarefas em que as chamadas ao Sol determinam a latência de todo o agente\u003c/li\u003e\n\u003cli\u003eSituações em que até mesmo alguns minutos de atraso são importantes, como resposta a incidentes ou análise de falhas\u003c/li\u003e\n\u003cli\u003eAtividades em que o custo gerado pelo atraso no processamento é maior que o custo adicional da API\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePara tarefas cujo prazo de conclusão não é urgente, como lotes em segundo plano, análises noturnas e processamento assíncrono, o processamento Standard pode ser mais econômico.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#crit%C3%A9rios-de-sele%C3%A7%C3%A3o-de-modelos-com-foco-nos-resultados\" class=\"anchor\" id=\"critérios-de-seleção-de-modelos-com-foco-nos-resultados\"\u003e\u003c/a\u003eCritérios de seleção de modelos com foco nos resultados\u003c/h2\u003e\n\u003cp\u003eSelecionar um modelo não é apenas uma questão de escolher o mais bem classificado. As seguintes perguntas devem ser analisadas para cada tarefa.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eFator de decisão\u003c/th\u003e\n\u003cth\u003ePergunta a verificar\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Fator de decisão\"\u003eImpacto da falha\u003c/td\u003e\n\u003ctd data-label=\"Pergunta a verificar\"\u003eQue impacto um erro teria sobre clientes, receita, segurança ou conformidade regulatória?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Fator de decisão\"\u003eTolerância a erros\u003c/td\u003e\n\u003ctd data-label=\"Pergunta a verificar\"\u003eUma pessoa ou regras automáticas podem detectar os erros?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Fator de decisão\"\u003eLatência\u003c/td\u003e\n\u003ctd data-label=\"Pergunta a verificar\"\u003eO usuário espera em tempo real ou o processamento pode ser assíncrono?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Fator de decisão\"\u003eVolume de processamento\u003c/td\u003e\n\u003ctd data-label=\"Pergunta a verificar\"\u003eQuantos casos precisam ser processados por dia ou por mês?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Fator de decisão\"\u003eClareza do problema\u003c/td\u003e\n\u003ctd data-label=\"Pergunta a verificar\"\u003eA entrada, as regras e a saída esperada estão suficientemente definidas?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Fator de decisão\"\u003eValor do raciocínio\u003c/td\u003e\n\u003ctd data-label=\"Pergunta a verificar\"\u003eUm raciocínio mais poderoso melhora de forma significativa a qualidade real do resultado?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Fator de decisão\"\u003ePossibilidade de validação\u003c/td\u003e\n\u003ctd data-label=\"Pergunta a verificar\"\u003eÉ possível avaliar o resultado por meio de testes, esquemas ou verificações cruzadas?\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eTarefas claras e que podem ser validadas automaticamente têm grande probabilidade de serem adequadas para Luna. Quando for necessária uma capacidade consistente de decisão, Terra pode ser considerado. Sol é adequado para resolver ambiguidades, tomar decisões de alto risco ou realizar a revisão final das consequências de uma falha.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#estrutura-de-planejamento-com-sol-e-execu%C3%A7%C3%A3o-com-luna\" class=\"anchor\" id=\"estrutura-de-planejamento-com-sol-e-execução-com-luna\"\u003e\u003c/a\u003eEstrutura de planejamento com Sol e execução com Luna\u003c/h2\u003e\n\u003cp\u003eMesmo dentro de uma única tarefa de agente, é possível atribuir modelos diferentes a cada etapa. Por exemplo, um agente de programação pode ser estruturado da seguinte forma.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eSol identifica ambiguidades nos requisitos e organiza as perguntas.\u003c/li\u003e\n\u003cli\u003eSol determina o plano de implementação, o escopo das alterações e os fatores de risco.\u003c/li\u003e\n\u003cli\u003eLuna implementa em código as alterações que foram esclarecidas.\u003c/li\u003e\n\u003cli\u003eLuna cria e executa os testes.\u003c/li\u003e\n\u003cli\u003eLuna ou Terra avalia os resultados dos testes e as diferenças no código.\u003c/li\u003e\n\u003cli\u003eSol revisa novamente apenas as conclusões importantes ou com alta probabilidade de falha.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eEssa estrutura pode reduzir os custos em comparação com o uso de Sol em todas as etapas, concentrando a elevada capacidade de raciocínio nas decisões importantes. No entanto, ao dividir os modelos, é necessário projetar separadamente as regras de roteamento, o tratamento de erros, o rastreamento de logs e o sistema de avaliação.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#tr%C3%AAs-n%C3%ADveis-de-efici%C3%AAncia-que-sustentaram-a-redu%C3%A7%C3%A3o-de-pre%C3%A7os\" class=\"anchor\" id=\"três-níveis-de-eficiência-que-sustentaram-a-redução-de-preços\"\u003e\u003c/a\u003eTrês níveis de eficiência que sustentaram a redução de preços\u003c/h2\u003e\n\u003cp\u003eA OpenAI explica que a redução de custos não foi apenas resultado de uma política de preços, mas de melhorias técnicas em três níveis.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eEficiência de tokens do próprio modelo\u003c/li\u003e\n\u003cli\u003eEficiência de hardware do sistema de inferência\u003c/li\u003e\n\u003cli\u003eEficiência do harness de agentes que conecta modelos, ferramentas e contexto\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eEssa explicação se baseia nos materiais técnicos publicados pela OpenAI, mas a estrutura detalhada de todos os custos não foi divulgada externamente. Portanto, é difícil determinar externamente quanto da redução de preços foi resultado da eficiência técnica e quanto decorreu da estratégia de preços.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#otimiza%C3%A7%C3%A3o-do-modelo-e-do-sistema-de-infer%C3%AAncia\" class=\"anchor\" id=\"otimização-do-modelo-e-do-sistema-de-inferência\"\u003e\u003c/a\u003eOtimização do modelo e do sistema de inferência\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#melhoria-do-volume-de-trabalho-por-token\" class=\"anchor\" id=\"melhoria-do-volume-de-trabalho-por-token\"\u003e\u003c/a\u003eMelhoria do volume de trabalho por token\u003c/h3\u003e\n\u003cp\u003eSegundo a OpenAI, GPT-5.6 foi treinado para otimizar não apenas a taxa de sucesso das tarefas, mas também a eficiência de processamento. Isso significa que ele foi projetado para reduzir raciocínios desnecessariamente longos ou repetitivos e alcançar os resultados necessários usando menos tokens, aumentando a inteligência e o volume de trabalho por token.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#distribui%C3%A7%C3%A3o-de-carga-e-roteamento-de-solicita%C3%A7%C3%B5es\" class=\"anchor\" id=\"distribuição-de-carga-e-roteamento-de-solicitações\"\u003e\u003c/a\u003eDistribuição de carga e roteamento de solicitações\u003c/h3\u003e\n\u003cp\u003eO sistema de inferência distribui as solicitações entre data centers e clusters com base na região, na capacidade disponível e no tipo de acelerador. Dentro de cada cluster, a instância do modelo é selecionada considerando a carga atual, o tamanho do contexto de entrada, a possibilidade de uso do cache e as características da solicitação.\u003c/p\u003e\n\u003cp\u003eA OpenAI informou que usou GPT-5.6 Sol e Codex para analisar o tráfego de produção, investigar as causas de desequilíbrios de carga, testar estratégias de roteamento e ajustar heurísticas.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#otimiza%C3%A7%C3%A3o-de-kernels-de-gpu\" class=\"anchor\" id=\"otimização-de-kernels-de-gpu\"\u003e\u003c/a\u003eOtimização de kernels de GPU\u003c/h3\u003e\n\u003cp\u003eOs kernels de GPU são os códigos essenciais que executam as operações matemáticas do modelo no hardware. Mesmo usando a mesma GPU, o custo de processamento varia de acordo com a movimentação de memória, a sincronização, a organização dos dados e o método de paralelização.\u003c/p\u003e\n\u003cp\u003eSegundo a OpenAI, GPT-5.6 Sol participou da criação e otimização de kernels de produção usando Triton e Gluon no ambiente do Codex. A empresa informou que a combinação das melhorias nos kernels com otimizações relacionadas reduziu em 20% o custo de ponta a ponta da disponibilização do modelo.\u003c/p\u003e\n\u003cp\u003eO custo de ponta a ponta não se refere a uma única operação específica, mas ao custo de todo o processamento real de uma solicitação, incluindo roteamento, movimentação de dados, execução do modelo e geração da saída.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#valida%C3%A7%C3%A3o-da-precis%C3%A3o-dos-kernels\" class=\"anchor\" id=\"validação-da-precisão-dos-kernels\"\u003e\u003c/a\u003eValidação da precisão dos kernels\u003c/h3\u003e\n\u003cp\u003eMesmo um kernel rápido não pode ser usado se produzir resultados numericamente incorretos. A OpenAI explica que investiu em ferramentas de validação, incluindo FpSan, para verificar a precisão dos kernels criados por IA. FpSan é a abreviação de Floating-Point Sanitizer, uma ferramenta de código aberto que detecta erros relacionados a operações de ponto flutuante.\u003c/p\u003e\n\u003cp\u003eIsso mostra que, quando a IA gera código de infraestrutura de produção, são necessários não apenas benchmarks de desempenho, mas também validação numérica, testes de regressão e procedimentos de recuperação em caso de falha.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#decodifica%C3%A7%C3%A3o-especulativa-e-cache-kv\" class=\"anchor\" id=\"decodificação-especulativa-e-cache-kv\"\u003e\u003c/a\u003eDecodificação especulativa e cache KV\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#decodifica%C3%A7%C3%A3o-especulativa\" class=\"anchor\" id=\"decodificação-especulativa\"\u003e\u003c/a\u003eDecodificação especulativa\u003c/h3\u003e\n\u003cp\u003eA decodificação especulativa é um método no qual um pequeno modelo de rascunho propõe antecipadamente os próximos tokens, enquanto o modelo principal, maior, valida vários candidatos em paralelo. Quando as sugestões são aceitas, é possível reduzir o número de cálculos sequenciais caros realizados pelo modelo principal.\u003c/p\u003e\n\u003cp\u003eA OpenAI informou que GPT-5.6 Sol projetou e executou centenas de experimentos que alteraram o tamanho e a estrutura do modelo de rascunho, além de monitorar o treinamento. Como resultado, a eficiência de geração de tokens melhorou em pelo menos 15%.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#cache-kv-e-configura%C3%A7%C3%B5es-por-carga-de-trabalho\" class=\"anchor\" id=\"cache-kv-e-configurações-por-carga-de-trabalho\"\u003e\u003c/a\u003eCache KV e configurações por carga de trabalho\u003c/h3\u003e\n\u003cp\u003eAo processar a entrada, o modelo cria um cache Key-Value, ou cache KV. A configuração ideal varia conforme os tamanhos da entrada e da saída, o tamanho do lote, a taxa de acerto do cache, o número de solicitações simultâneas, a capacidade de memória e o método de fragmentação do modelo.\u003c/p\u003e\n\u003cp\u003eA OpenAI explica que usou Sol e Codex para analisar cargas de trabalho reais e avaliar configurações candidatas, ajustando detalhadamente a configuração do mecanismo para cada tipo de tarefa. O objetivo é processar mais solicitações no mesmo hardware.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#harness-de-agentes-e-custo-de-contexto\" class=\"anchor\" id=\"harness-de-agentes-e-custo-de-contexto\"\u003e\u003c/a\u003eHarness de agentes e custo de contexto\u003c/h2\u003e\n\u003cp\u003eUm agente chama o modelo e as ferramentas várias vezes para resolver uma única solicitação do usuário. Em uma tarefa que exige 30 chamadas ao modelo, se cada chamada tiver 1 segundo de atraso desnecessário, a latência total pode aumentar em cerca de 30 segundos.\u003c/p\u003e\n\u003cp\u003eA OpenAI descreve como harness de agentes a camada de orquestração baseada em Rust que conecta o modelo, as ferramentas e o ambiente do usuário.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#exposi%C3%A7%C3%A3o-tardia-apenas-das-ferramentas-necess%C3%A1rias\" class=\"anchor\" id=\"exposição-tardia-apenas-das-ferramentas-necessárias\"\u003e\u003c/a\u003eExposição tardia apenas das ferramentas necessárias\u003c/h3\u003e\n\u003cp\u003eIncluir desde o início no prompt todas as informações de ferramentas, plugins, habilidades e integrações MCP aumenta o número de tokens de entrada e a latência. O harness usa um método de descoberta tardia que expõe as informações das ferramentas relevantes apenas quando elas são necessárias. A OpenAI informou que as saídas das ferramentas são limitadas, por padrão, a 10 mil tokens, a menos que o modelo solicite um limite separado.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#preserva%C3%A7%C3%A3o-exata-do-prefixo-e-cache-de-prompts\" class=\"anchor\" id=\"preservação-exata-do-prefixo-e-cache-de-prompts\"\u003e\u003c/a\u003ePreservação exata do prefixo e cache de prompts\u003c/h3\u003e\n\u003cp\u003eO cache de prompts reutiliza a parte inicial idêntica de uma entrada processada anteriormente para reduzir cálculos redundantes. Para reutilizar o cache, o prefixo do prompt precisa ser exatamente igual.\u003c/p\u003e\n\u003cp\u003eO harness da OpenAI gerencia o histórico em uma estrutura somente de anexação e acrescenta novas mensagens e resultados de ferramentas ao final. As ferramentas são apresentadas em uma ordem determinística, enquanto configurações de execução, como políticas de aprovação, são aplicadas em tempo de execução sem alterar a própria definição das ferramentas. Essa abordagem favorece o aumento da taxa de acerto do cache em loops repetitivos de agentes.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#como-interpretar-os-n%C3%BAmeros-de-casos-empresariais\" class=\"anchor\" id=\"como-interpretar-os-números-de-casos-empresariais\"\u003e\u003c/a\u003eComo interpretar os números de casos empresariais\u003c/h2\u003e\n\u003cp\u003eO anúncio oficial da OpenAI incluiu avaliações de Replit, Notion, Ramp, Blitzy, Cognition, Dust e outras empresas.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNotion informou que, em sua própria avaliação, Terra ofereceu qualidade semelhante à do GPT-5.5 pela metade do custo por tarefa e em um tempo 60% menor.\u003c/li\u003e\n\u003cli\u003eBlitzy explicou que, após adotar Luna, a taxa de reutilização do cache de prompts aumentou de 24% para 90%, enquanto o custo ficou 87% menor que o do modelo padrão anterior.\u003c/li\u003e\n\u003cli\u003eDust informou que, nas mesmas tarefas de agente, Luna foi 40% mais rápido e 40% mais econômico que o modelo padrão anterior.\u003c/li\u003e\n\u003cli\u003eRamp informou que usa Luna como modelo padrão para a automação de agentes em segundo plano.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEsses números são casos medidos com base nas tarefas internas, prompts, critérios de avaliação e estruturas de sistemas de cada empresa. Como não são benchmarks comuns e independentes, não devem ser aplicados diretamente às atividades de outras organizações. Antes da adoção, é necessário realizar uma avaliação própria que reflita dados reais e o custo dos erros.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#lista-de-verifica%C3%A7%C3%A3o-para-valida%C3%A7%C3%A3o-antes-da-ado%C3%A7%C3%A3o\" class=\"anchor\" id=\"lista-de-verificação-para-validação-antes-da-adoção\"\u003e\u003c/a\u003eLista de verificação para validação antes da adoção\u003c/h2\u003e\n\u003col\u003e\n\u003cli\u003ePrepare uma amostra representativa de tarefas e as respostas corretas ou os critérios de avaliação.\u003c/li\u003e\n\u003cli\u003eCompare as taxas de sucesso e de novas tentativas de Luna, Terra e Sol nas mesmas condições.\u003c/li\u003e\n\u003cli\u003eInclua não apenas o custo dos tokens, mas também as chamadas de ferramentas, o pessoal de revisão e o custo de recuperação de falhas.\u003c/li\u003e\n\u003cli\u003eMeça a latência dos 95% ou 99% superiores, além da latência média.\u003c/li\u003e\n\u003cli\u003eClassifique como candidatas a modelos econômicos as etapas em que testes automáticos ou validação por esquema são possíveis.\u003c/li\u003e\n\u003cli\u003eAplique políticas separadas de aprovação e registro a tarefas relacionadas a dados pessoais, segurança e regulamentação.\u003c/li\u003e\n\u003cli\u003eDefina os critérios de roteamento para encaminhar resultados de baixa confiabilidade ao Terra ou ao Sol.\u003c/li\u003e\n\u003cli\u003eValide com tráfego real se o valor da redução da latência é maior que o custo adicional do Fast mode.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#significado-e-limita%C3%A7%C3%B5es\" class=\"anchor\" id=\"significado-e-limitações\"\u003e\u003c/a\u003eSignificado e limitações\u003c/h2\u003e\n\u003cp\u003eEssa reformulação mostra que o critério da concorrência entre modelos de IA está migrando de uma única pontuação máxima para o custo por resultado. Ao atribuir Luna a tarefas repetitivas em grande escala, Terra ao trabalho cotidiano de conhecimento e Sol a decisões ambíguas e importantes, é possível combinar inteligência, velocidade e custo conforme cada atividade.\u003c/p\u003e\n\u003cp\u003eNo entanto, é difícil separar, apenas com as informações públicas, quanto da redução de preço de 80% decorreu de melhorias na eficiência técnica e quanto veio da estratégia de mercado. Além disso, a viabilidade econômica de um modelo de baixo custo não é determinada apenas pelo preço dos tokens. Se uma taxa de erros elevada aumentar o número de novas tentativas e revisões humanas, o custo total da tarefa poderá subir.\u003c/p\u003e\n\u003cp\u003ePortanto, o indicador principal não é o preço de uma única chamada ao modelo, mas o custo total para produzir um resultado que tenha passado pela validação. É necessário medir em conjunto a taxa de sucesso de cada modelo, o número de novas tentativas, a latência e o custo de revisão para determinar se a redução dos preços do GPT-5.6 se traduz em valor comercial real.\u003c/p\u003e\n","tags":["OpenAI","GPT-5.6","Preços de API","Eficiência de raciocínio","Agente"],"faqs":[{"question":"Qual é o novo preço da API do GPT-5.6 Luna?","answer":"Em 30 de julho de 2026, o Luna custa 0.20 dólar por 1 milhão de tokens de entrada e 1.20 dólar por 1 milhão de tokens de saída. A redução anunciada pela OpenAI em relação ao preço anterior é de 80%."},{"question":"Qual é o novo preço da API do GPT-5.6 Terra?","answer":"O Terra custa 2 dólares por 1 milhão de tokens de entrada e 12 dólares por 1 milhão de tokens de saída. A redução de preço anunciada pela OpenAI é de 20%."},{"question":"O preço do GPT-5.6 Sol também foi reduzido?","answer":"Não. Neste anúncio da OpenAI, o preço do processamento Standard do Sol não mudou. Em vez disso, foi adicionado o Fast mode, que é até 2.5 vezes mais rápido que o Standard e custa o dobro."},{"question":"A qualidade das respostas do modelo diminui ao usar o Fast mode?","answer":"A OpenAI explica que o Fast mode aumenta a velocidade de processamento sem reduzir o nível de inteligência do Sol. No entanto, a velocidade de até 2.5 vezes é um limite máximo, e a latência real pode variar conforme o tamanho da solicitação, o volume de saída, as chamadas de ferramentas e a carga do sistema."},{"question":"É necessário modificar as solicitações existentes do Priority Processing?","answer":"Segundo o anúncio da OpenAI, a tag `priority` das solicitações existentes da API continuará funcionando e será vinculada automaticamente ao processamento do Fast mode. Em ambientes de produção, é mais seguro verificar separadamente quando a mudança entrará em vigor e os valores efetivamente cobrados."},{"question":"Para quais tarefas é adequado usar o Luna?","answer":"É adequado para tarefas repetitivas e em grande escala, com regras e resultados esperados claros e que possam ser verificados automaticamente. Classificação de documentos, extração de dados, alterações repetitivas de código, execução de testes, revisão de conteúdo e automação em segundo plano são exemplos representativos."},{"question":"Qual modelo devo escolher entre Terra e Luna?","answer":"Se o baixo custo e a alta capacidade de processamento forem prioritários e a tarefa estiver bem definida, é possível começar avaliando o Luna. Se for necessário compreender mais contexto e ter maior capacidade de julgamento, mas sem precisar do raciocínio avançado no nível do Sol, o Terra pode ser adequado."},{"question":"Não posso usar o Sol em todas as etapas do agente?","answer":"É possível, mas a eficiência de custos pode diminuir. Separar as funções para que o Sol cuide do planejamento e das decisões de alto risco, enquanto o Luna ou o Terra processa execuções e testes claramente definidos, pode reduzir o custo total e, ao mesmo tempo, manter a qualidade das etapas importantes."},{"question":"O custo por tarefa de 6% do Luna é uma comparação dos preços por token?","answer":"Não. Os cerca de 6% mencionados pela OpenAI são o custo estimado por tarefa necessário para obter resultados semelhantes aos do modelo usado na comparação. Esse número não foi calculado apenas pela divisão direta dos preços por token e deve ser entendido como uma comparação que inclui as tarefas de avaliação e a taxa de sucesso."},{"question":"Como avaliar a viabilidade econômica real de um modelo de API?","answer":"Além do preço dos tokens, é preciso incluir a taxa de sucesso, o número de novas tentativas, os custos das chamadas de ferramentas, a latência das respostas, o tempo de revisão humana e os custos de recuperação de erros. O indicador mais útil é o custo total por resultado aprovado na verificação."}],"sources":[{"url":"https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/","title":"Expandindo a fronteira da relação preço-desempenho com GPT-5.6 | OpenAI","type":"source"},{"url":"https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/","title":"Como o GPT-5.6 combina inteligência de ponta com eficiência de ponta | OpenAI","type":"source"}],"images":[{"id":395,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--5c50f46b468b0057808eb3e6351730cbce2f4b78/ai-4f6037ef.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"퍼즐, AI 칩 계층, 작업 컨베이어, 감소하는 동전 더미로 표현한 모델 선택 흐름","caption":"AI 모델의 작업 분배와 비용 절감, 검증 과정을 시각화한 개념도다.","description":null},"en":{"alt":"Model selection flow with puzzles, layered AI chips, a task conveyor, and shrinking coin stacks","caption":"The diagram visualizes AI task routing, cost reduction, and output verification.","description":null},"ja":{"alt":"パズル、階層化AIチップ、タスク用コンベア、減っていくコインで示すモデル選択フロー","caption":"AIモデルのタスク振り分け、コスト削減、検証の流れを表した概念図。","description":null},"es":{"alt":"Flujo de selección de modelos con piezas, chips de IA, cinta de tareas y pilas de monedas decrecientes","caption":"El diagrama representa la asignación de tareas, la reducción de costes y la verificación con IA.","description":null},"id":{"alt":"Alur pemilihan model dengan puzzle, chip AI bertingkat, konveyor tugas, dan tumpukan koin yang menyusut","caption":"Diagram ini menggambarkan perutean tugas AI, penghematan biaya, dan verifikasi hasil.","description":null},"pt":{"alt":"Fluxo de seleção de modelos com peças, chips de IA, esteira de tarefas e pilhas de moedas decrescentes","caption":"O diagrama mostra o roteamento de tarefas, a redução de custos e a verificação por IA.","description":null},"zh-hant":{"alt":"以拼圖、分層 AI 晶片、任務輸送帶與遞減硬幣堆呈現模型選擇流程","caption":"此概念圖呈現 AI 任務分流、成本降低與結果驗證流程。","description":null},"de":{"alt":"Modellauswahl mit Puzzleteilen, gestaffelten KI-Chips, Aufgabenband und schrumpfenden Münzstapeln","caption":"Die Grafik veranschaulicht KI-Aufgabenverteilung, Kostensenkung und Ergebnisprüfung.","description":null}}},{"id":396,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY3NSwicHVyIjoiYmxvYl9pZCJ9fQ==--920476799a53738205d619a3a057685b5af9d05d/ai-334533bc.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 모델별 처리 흐름과 속도, 비용, 하드웨어 구성을 비교한 인포그래픽","caption":"세 가지 AI 처리 경로의 성능과 비용 차이 및 연결된 인프라를 시각화한다.","description":null},"en":{"alt":"Infographic comparing AI model processing flows, speed, cost, and hardware infrastructure","caption":"Three AI processing paths visualize differences in performance, cost, and connected infrastructure.","description":null},"ja":{"alt":"AIモデル別の処理フロー、速度、コスト、ハードウェア構成を比較する図","caption":"3つのAI処理経路について、性能とコスト、接続インフラの違いを可視化している。","description":null},"es":{"alt":"Infografía comparativa de flujos, velocidad, coste e infraestructura de modelos de IA","caption":"Tres rutas de procesamiento de IA muestran diferencias de rendimiento, coste e infraestructura conectada.","description":null},"id":{"alt":"Infografik perbandingan alur, kecepatan, biaya, dan infrastruktur perangkat keras model AI","caption":"Tiga jalur pemrosesan AI memperlihatkan perbedaan kinerja, biaya, dan infrastruktur yang terhubung.","description":null},"pt":{"alt":"Infográfico comparando fluxos, velocidade, custo e infraestrutura de modelos de IA","caption":"Três rotas de processamento de IA mostram diferenças de desempenho, custo e infraestrutura conectada.","description":null},"zh-hant":{"alt":"比較各種 AI 模型處理流程、速度、成本與硬體架構的資訊圖表","caption":"三條 AI 處理路徑呈現效能、成本與連接基礎設施的差異。","description":null},"de":{"alt":"Infografik zum Vergleich von KI-Modellabläufen, Geschwindigkeit, Kosten und Hardware","caption":"Drei KI-Verarbeitungspfade zeigen Unterschiede bei Leistung, Kosten und verbundener Infrastruktur.","description":null}}}],"published_at":"2026-08-01T07:15:42+09:00","updated_at":"2026-08-01T07:15:42+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/openai-gpt-5-6-price-performance-model-routing"}