---
title: "Custo por token, o novo critério da competição em semicondutores de IA"
locale: pt
category: ai_data
category_name: "Dados de IA"
translation_status: reviewed
license: cc_by
author: "injoys"
source_url: https://injoys.com/en/articles/ai-chip-token-economics-and-hardware-strategies
published_at: 2026-08-17T07:14:00+09:00
---

# Custo por token, o novo critério da competição em semicondutores de IA

> No mercado de IA generativa, tornou-se importante não apenas alcançar o melhor desempenho computacional, mas também produzir tokens pelo menor custo possível, mantendo qualidade e velocidade de resposta constantes. ASIC customizados, sistemas em escala de rack e otimizações de memória e rede estão no centro da competição, mas os custos não podem ser comparados apenas pelas especificações dos chips.

## Key Points

- À medida que os serviços de IA crescem, os custos recorrentes de inferência determinam diretamente os preços e a rentabilidade dos produtos.
- O custo por token deve ser calculado pelo custo total, incluindo energia, memória, rede, taxa de utilização, software e qualidade do modelo, e não pelo preço do chip.
- Google, AWS, Microsoft e Meta buscam controlar os custos e a cadeia de suprimentos com aceleradores adaptados às próprias cargas de trabalho.
- NVIDIA e AMD respondem aos chips customizados combinando versatilidade, ecossistemas de desenvolvimento e otimização no nível de rack.
- Na prática, uma métrica mais útil do que o simples custo por token é o custo por tarefa concluída com sucesso, considerando a qualidade e as novas tentativas.

A competitividade dos semicondutores para IA generativa está deixando de ser avaliada apenas pela capacidade máxima de processamento e passando a incluir a viabilidade econômica em serviços reais. O termo informal **custo-benefício de tokens**, usado no setor, refere-se a quantos tokens podem ser processados de forma útil com determinado custo ou consumo de energia.

No entanto, o token mais barato não produz necessariamente o resultado mais econômico. Para avaliar a competitividade real, também é preciso medir a precisão do modelo, a latência de resposta, o número de novas tentativas e a taxa de utilização do data center.

## O que é custo-benefício de tokens

Tokens são as unidades de processamento de texto usadas por modelos de linguagem para ler entradas e gerar saídas. Os provedores de API geralmente estabelecem preços distintos para tokens de entrada e de saída e, em alguns casos, aplicam tarifas específicas a entradas armazenadas em cache.

Custo-benefício de tokens não é um termo contábil oficial nem um benchmark padronizado. Na prática, é necessário diferenciar os seguintes indicadores.

| Indicador | Significado | Elementos fáceis de ignorar |
|---|---|---|
| Tokens por dólar | Quantidade de tokens processados pelo mesmo custo | Qualidade, latência e diferença de preço entre entrada e saída |
| Tokens por segundo | Velocidade de geração | Número de usuários simultâneos e latência até o primeiro token |
| Tokens por watt | Eficiência energética | Perdas de refrigeração e conversão de energia |
| Vazão por servidor | Vazão total de um servidor ou rack | Baixa utilização e tempo de espera |
| Custo por tarefa bem-sucedida | Custo total necessário para concluir o objetivo | Novas tentativas, chamadas de ferramentas e caminhos que falharam |

Conceitualmente, o custo total por token pode ser expresso da seguinte forma.

`Custo total por token = depreciação + energia·refrigeração + memória·rede + custos operacionais + custos de software ÷ tokens processados efetivamente`

Nesse caso, tokens processados efetivamente não significam simplesmente o volume gerado, mas os tokens que atendem aos padrões de qualidade do serviço. Como modelos diferentes usam tokenizadores e comprimentos de resposta distintos, comparar diretamente apenas o preço de 1 milhão de tokens pode produzir distorções.

## Por que o custo de inferência está mudando a competição entre semicondutores

### O custo se repete sempre que o serviço é usado

O treinamento em grande escala é uma etapa na qual se concentram custos enormes, mas não constitui uma despesa totalmente pontual. Mesmo após o pré-treinamento, repetem-se o ajuste fino, o aprendizado por reforço, as avaliações e o treinamento de novas versões. Ainda assim, o custo de inferência gerado a cada solicitação do usuário afeta mais diretamente o modelo de negócios, pois aumenta quase no mesmo ritmo que o crescimento do serviço.

O Stanford AI Index 2025 analisou que o custo de inferência necessário para oferecer determinado nível de desempenho do modelo caiu rapidamente. Esse resultado foi produzido não apenas por melhorias nos semicondutores, mas também por modelos menores, quantização, motores de inferência e maior concorrência. Quando o custo unitário cai, mais funcionalidades se tornam economicamente viáveis, mas também pode surgir o efeito Jevons, no qual o aumento do uso compensa a queda do custo unitário.

### Agentes de IA amplificam o uso de tokens

Em chatbots comuns, perguntas e respostas tendem a terminar de forma relativamente breve. Já os agentes de IA podem repetir as seguintes tarefas.

- Elaboração e revisão de planos
- Leitura de documentos longos ou repositórios de código
- Chamadas de ferramentas como busca, banco de dados e terminal
- Revisão dos resultados da execução e correção de erros
- Geração e avaliação de várias alternativas

Quanto mais longas forem as etapas da tarefa, maior será o acúmulo de contexto de entrada, raciocínio intermediário, resultados de ferramentas e novas tentativas. Na era dos agentes, o custo total para concluir uma tarefa com sucesso é mais importante do que o preço de uma única chamada ao modelo.

### Energia e instalações criam os limites reais da oferta

Mesmo que aceleradores de IA estejam disponíveis, eles não podem operar se faltarem conexão à rede elétrica, refrigeração, memória de alta largura de banda, rede e espaço no data center. Portanto, tokens por watt e tokens por rack significam mais do que apenas economia na conta de energia. Isso ocorre porque esses indicadores determinam o volume de serviços que pode ser oferecido dentro de uma capacidade elétrica limitada.

## Estratégias de hardware para reduzir o custo por token

### 1. Aceleradores próprios adaptados a cargas de trabalho específicas

GPUs de uso geral oferecem suporte a diversos modelos e operações, mas essa flexibilidade tem um custo. Grandes provedores de nuvem podem analisar as cargas de trabalho internas executadas repetidamente, eliminar funcionalidades desnecessárias e otimizar os caminhos de movimentação de dados.

| Empresa | Família de aceleradores divulgada | Principal direção | Cuidados na interpretação |
|---|---|---|---|
| Google | TPU, Ironwood | Projeto conjunto de modelos, compiladores e infraestrutura de nuvem | Não é possível afirmar que a mesma eficiência será reproduzida fora do ambiente interno do Google |
| AWS | Trainium, Inferentia | Chips exclusivos da AWS e software Neuron adaptados a treinamento e inferência | É necessário verificar as operações compatíveis e o custo de portabilidade dos modelos |
| Microsoft | Maia 100 | Acelerador próprio para cargas de trabalho de IA do Azure | É difícil calcular o custo de cargas de trabalho comerciais apenas com as especificações divulgadas |
| Meta | MTIA | Otimização de cargas internas de inferência em grande escala, como recomendação e ranqueamento | Não é um chip LLM de uso geral que substitui todos os modelos de IA generativa |

O Ironwood, divulgado pelo Google em 2025, é um TPU de 7ª geração projetado com foco em inferência. É mais correto entendê-lo não como um chip dedicado exclusivamente a um modelo Gemini específico, mas como parte de uma estratégia de integração vertical que otimiza conjuntamente os modelos do Google, o compilador XLA e os data centers.

O objetivo dos chips próprios não se limita à redução do custo de aquisição. Também entram em jogo o controle do cronograma de fornecimento, a melhoria da eficiência energética, a otimização das cargas internas e o aumento do poder de negociação com fornecedores externos.

### 2. Projetar o rack inteiro como um único computador

Como modelos grandes não cabem na memória de um único acelerador, eles são distribuídos entre vários aceleradores. Nesse caso, o desempenho pode depender mais da velocidade de comunicação entre os aceleradores, da largura de banda da memória e do agendamento de software do que da capacidade computacional de cada chip.

A plataforma NVIDIA Blackwell colocou em primeiro plano uma abordagem em escala de rack que integra GPU, CPU, NVLink, rede e software. A AMD também está fortalecendo seus aceleradores Instinct, seu ecossistema de software aberto e seus sistemas em escala de rack. Nessa competição, os seguintes elementos são mais importantes do que benchmarks de chips isolados.

- Número de solicitações que um rack pode processar simultaneamente
- Custo de movimentação dos pesos e do KV cache entre aceleradores
- Capacidade de utilizar os equipamentos restantes quando ocorre uma falha
- Desempenho sustentado dentro dos limites de fornecimento de energia e refrigeração
- Tempo de desenvolvimento necessário para efetivamente implantar o modelo

Mesmo que o preço do rack seja alto, o custo por token pode cair se a utilização e a vazão forem suficientemente elevadas. Por outro lado, até chips baratos perdem sua viabilidade econômica quando passam muito tempo ociosos devido à imaturidade do software ou a gargalos de comunicação.

### 3. Reduzir as fronteiras de comunicação em escala de wafer

A Cerebras desenvolveu a família WSE, que utiliza processadores do tamanho de um wafer em vez de vários dies individuais convencionais. Essa abordagem posiciona grandes recursos computacionais e alta largura de banda de memória em um único wafer, reduzindo parte da comunicação entre chips existente nos clusters tradicionais.

A arquitetura em escala de wafer pode buscar baixa latência e alta vazão, mas não elimina toda a comunicação. Ao conectar vários sistemas ou operar modelos grandes, ainda são necessários memória externa, rede, recuperação de falhas e compiladores. Os recordes de tokens por segundo de um modelo específico também não podem ser comparados diretamente quando precisão, tamanho do lote, comprimento do contexto e condições de saída são diferentes.

### 4. Priorizar a otimização da memória e da movimentação de dados

Na inferência, o processo de movimentar os pesos do modelo e o KV cache pode se tornar um gargalo com mais facilidade do que o cálculo em si. Em especial, a etapa de decodificação que gera um token por vez é fortemente afetada pela largura de banda da memória.

É por isso que os fornecedores de hardware enfatizam memória de alta largura de banda, chiplets, interconexões de alta velocidade e caches maiores. Mesmo que os números de desempenho computacional sejam altos, a vazão real de tokens não aumenta se os dados necessários não puderem ser fornecidos no momento certo.

### 5. Projetar conjuntamente hardware e software de inferência

O custo-benefício de tokens não é determinado apenas pelos semicondutores. Mesmo no mesmo hardware, a vazão pode variar significativamente conforme as técnicas a seguir.

- **Quantização:** reduz a precisão dos pesos e das operações para diminuir o uso de memória e o volume de cálculos.
- **Agrupamento contínuo:** agrupa com eficiência solicitações que chegam em momentos diferentes.
- **Cache de prefixos:** reutiliza os cálculos de prompts de sistema e contextos repetidos.
- **Decodificação especulativa:** um modelo pequeno cria tokens candidatos e um modelo grande os verifica.
- **Separação entre Prefill e decode:** aloca o processamento da entrada e a geração da saída em recursos diferentes.
- **Roteamento de modelos esparsos:** ativa apenas alguns dos especialistas necessários em modelos Mixture-of-Experts.

Chips personalizados só produzem resultados quando o compilador e o modelo são preparados em conjunto. O CUDA é uma importante linha de defesa da NVIDIA porque já existe um ecossistema acumulado que inclui bibliotecas, ferramentas de desenvolvimento, conhecimento de otimização e profissionais qualificados.

## Por que a dependência da NVIDIA não desaparece rapidamente

Mesmo empresas que adotam chips próprios ou aceleradores AMD podem continuar usando sistemas NVIDIA em paralelo. Isso não é necessariamente uma contradição estratégica, mas se aproxima mais de uma distribuição das cargas de trabalho.

Os pontos fortes da NVIDIA são os seguintes.

1. CUDA e amplo suporte a bibliotecas de IA
2. Versatilidade para testar rapidamente novos modelos
3. Alto nível de maturidade em servidores, redes e software de gerenciamento
4. Experiência acumulada de desenvolvedores e equipes de operações
5. Ampla disponibilidade por meio de provedores de nuvem e fabricantes de servidores

Por outro lado, ASICs próprios tendem a obter vantagens em cargas de trabalho consistentes, repetitivas e de grande escala. Portanto, é provável que o mercado evolua para uma estrutura em que GPUs de uso geral e aceleradores especializados dividam funções, em vez de um único tipo de chip substituir todos os demais.

## Condições que precisam ser controladas na comparação do custo-benefício de tokens

O desempenho máximo ou o percentual de redução de custos anunciado por uma empresa não pode ser comparado diretamente se não vier de um benchmark independente realizado sob as mesmas condições. No mínimo, é necessário alinhar as condições a seguir.

| Condição de comparação | Impacto sobre o custo |
|---|---|
| Modelo e número de parâmetros | Alteram a memória e o volume de cálculos necessários |
| Precisão numérica | A velocidade e a qualidade de FP8, BF16, INT8 etc. são diferentes |
| Comprimento da entrada e da saída | Altera a proporção entre Prefill e decode |
| Tamanho do lote e solicitações simultâneas | Altera o equilíbrio entre vazão e latência |
| Latência até o primeiro token | Determina a qualidade percebida de serviços em tempo real |
| Taxa de utilização | Torna-se a referência para dividir os custos fixos pela vazão real |
| Escopo energético | Varia conforme a medição inclua apenas o chip ou também refrigeração e rede |
| Qualidade da resposta | Uma resposta curta, mas imprecisa, gera custos de novas tentativas |

Resultados como os do MLPerf Inference, da MLCommons, que especificam modelo, cenário e condições de qualidade, são relativamente úteis. No entanto, nem mesmo benchmarks públicos conseguem reproduzir completamente a configuração dos modelos de empresas reais, os custos regionais de energia e os padrões de tráfego.

## Além do simples preço dos tokens: custo por tarefa bem-sucedida

Tokens são fáceis de medir, mas não representam diretamente o valor do resultado final. Mesmo que o modelo A tenha um preço por token menor que o modelo B, o custo para concluir uma tarefa pode ser maior se ele produzir respostas mais longas ou falhar com frequência.

Para serviços de agentes, o cálculo a seguir é mais adequado.

`Custo por tarefa bem-sucedida = custos totais de modelos·ferramentas·infraestrutura ÷ número de tarefas aprovadas nos critérios de qualidade`

Isso inclui não apenas o custo dos tokens, mas também APIs de busca, execução de código, bancos de dados, revisão humana, tentativas malsucedidas e custos decorrentes da latência. Essa é uma perspectiva frequentemente ausente nas discussões sobre competição de desempenho ou custo-benefício de tokens.

## Como diferenciar alegações públicas de números não confirmados

Roadmaps de produtos e previsões do mercado de semicondutores mudam com frequência. Entre alguns nomes e números incluídos nos materiais fornecidos, itens que não foram suficientemente confirmados por documentos oficiais de produtos ou benchmarks reproduzíveis não foram tratados como fatos estabelecidos. Entre os exemplos estão `Frozen V2` e `Claude Fable 5`, apresentados como dedicados a modelos específicos, a velocidade da Cerebras em determinados modelos não divulgados, o custo fixo de 1 milhão de tokens por chip e os números futuros de participação de mercado.

Além disso, expressões como as seguintes exigem que suas condições sejam verificadas.

- **Eficiência até 10 vezes maior:** é necessário verificar a referência de comparação, a precisão e o escopo do sistema.
- **Redução de 50% no custo dos tokens:** são necessárias condições relativas ao modelo, à região, à utilização e à depreciação.
- **Centenas de tokens por segundo:** é necessário distinguir entre a velocidade para um único usuário e a vazão total.
- **Abandono da NVIDIA:** é necessário verificar se significa uma substituição completa ou a transferência de apenas algumas cargas internas.

Para decisões de investimento ou aquisição de infraestrutura, não se deve usar apenas materiais de divulgação. Também é necessário analisar benchmarks independentes, cronogramas reais de fornecimento, o escopo do suporte de software e o custo total de propriedade.

## Conclusão do mercado

A competição dos semicondutores de IA está deixando a fase em que se disputa apenas a velocidade máxima e avançando para uma fase em que se disputa **a capacidade de produzir tokens e concluir tarefas que atendam aos critérios de qualidade pelo menor custo total possível**.

ASICs personalizados buscam alta eficiência em cargas de trabalho repetitivas e de grande escala, enquanto GPUs de uso geral respondem com suporte flexível a modelos e um ecossistema maduro. Projetos em escala de rack, largura de banda da memória, redes, energia e software de inferência tornaram-se tão importantes quanto o próprio chip.

No fim, o indicador que define o vencedor não é simplesmente o número de tokens por segundo nem o preço de 1 milhão de tokens. O **custo total por tarefa bem-sucedida**, que considera qualidade, latência, utilização e restrições de energia no tráfego real, é um critério mais preciso.

## FAQ

### Toseongbi é um indicador oficial de desempenho de semicondutores de IA?
Não. Toseongbi é uma expressão informal abreviada que significa custo-benefício de tokens. Ao fazer comparações, é preciso distinguir tokens por dólar, tokens por watt, tokens por segundo, latência até o primeiro token e custo por tarefa concluída com sucesso.

### Por que o custo de inferência se tornou mais importante do que o custo de treinamento?
Embora o treinamento e o pós-processamento também exijam investimentos recorrentes, a inferência gera custos sempre que um usuário faz uma solicitação. À medida que o uso do serviço e as etapas de trabalho dos agentes aumentam, os custos de energia, tempo dos aceleradores, memória e rede continuam se acumulando.

### Por que os agentes de IA usam mais tokens do que os chatbots comuns?
Os agentes de IA repetem processos de planejamento, pesquisa, chamadas de ferramentas, análise de resultados e correção de erros. Em cada etapa, o contexto e os resultados intermediários são inseridos novamente, e os caminhos malsucedidos também geram custos, o que pode aumentar o uso total de tokens.

### Os chips de IA próprios são sempre mais baratos do que as GPUs da NVIDIA?
Nem sempre. Chips próprios podem aumentar a eficiência em cargas de trabalho internas constantes e repetitivas, mas a portabilidade de modelos, os compiladores, a equipe de operações e a baixa taxa de utilização podem gerar custos adicionais. A comparação deve considerar o custo total de propriedade, incluindo versatilidade e velocidade de desenvolvimento.

### Um número maior de tokens por segundo também reduz o custo por token?
Não necessariamente. Tokens por segundo é um indicador de velocidade e pode não refletir o preço do equipamento, o consumo de energia, o número de solicitações simultâneas e a taxa de utilização. A velocidade de geração para um único usuário e a capacidade total de processamento do servidor também são indicadores diferentes.

### É possível comparar diretamente o preço de 1 milhão de tokens entre modelos diferentes?
É preciso ter cautela. Cada modelo tem um tokenizador, tamanho médio de resposta, precisão e política de cache diferentes. Com base na mesma tarefa e nos mesmos critérios de qualidade, é preciso comparar em conjunto os tokens de entrada e saída necessários, o número de novas tentativas e os custos das ferramentas.

### O que significa dizer que o lock-in do CUDA é forte?
Significa que o código, as bibliotecas, os métodos de otimização e a equipe de desenvolvimento das empresas estão consolidados no ambiente NVIDIA CUDA. A migração para outros aceleradores pode gerar custos de alteração de código, validação de desempenho e reconstrução da estrutura operacional.

### Qual é o melhor indicador para avaliar a viabilidade econômica real dos semicondutores de IA?
Isso varia conforme o objetivo do serviço, mas, para agentes e automação de tarefas, o custo total por tarefa concluída com sucesso é útil. Esse indicador considera não apenas os tokens, mas também a qualidade, as novas tentativas, as chamadas de ferramentas, a latência, o consumo de energia e o custo da revisão humana.

## Sources

- [Relatório Stanford AI Index 2025](https://hai.stanford.edu/ai-index/2025-ai-index-report)
- [MLCommons MLPerf Inference: Datacenter](https://mlcommons.org/benchmarks/inference-datacenter/)
- [Google Cloud: TPU Ironwood para a era da inferência](https://cloud.google.com/blog/products/compute/ironwood-tpu-age-of-inference)
- [AWS Trainium](https://aws.amazon.com/ai/machine-learning/trainium/)
- [AWS Inferentia](https://aws.amazon.com/machine-learning/inferentia/)
- [Microsoft: Apresentando o Azure Maia e o Azure Cobalt](https://www.microsoft.com/en-us/microsoft-cloud/blog/2023/11/15/introducing-azure-maia-and-azure-cobalt-custom-silicon-for-ai-and-general-purpose-compute/)
- [Meta Engineering: Meta Training and Inference Accelerator de próxima geração](https://engineering.fb.com/2024/04/10/data-center-engineering/next-generation-meta-training-inference-accelerator/)
- [Plataforma de computação de IA NVIDIA Blackwell](https://nvidianews.nvidia.com/news/blackwell-ai-computing-platform)
- [Cerebras Wafer-Scale Engine](https://www.cerebras.ai/chip)
- [Preços da API da Anthropic](https://www.anthropic.com/pricing)
- [Preços da API da OpenAI](https://openai.com/api/pricing/)

## Images

![Chip de IA ligado a servidores, memória, refrigeração e energia ao lado de uma balança de custos](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6ODczNiwicHVyIjoiYmxvYl9pZCJ9fQ==--89216a7803ea259aaf3da7751b5e2558ddbd0d58/ai-6567cf23.webp)
![Infográfico compara processamento confuso de chips com servidor de IA otimizado em camadas](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6ODc0MiwicHVyIjoiYmxvYl9pZCJ9fQ==--a4c58b75c8d5a545afb9e6754eeae729a3db54f8/ai-58645f49.webp)