{"content_id":"1xikd0137w","slug":"ai-chip-token-economics-and-hardware-strategies","locale":"pt","schema_type":"TechArticle","category":"ai_data","category_name":"Dados de IA","title":"Custo por token, o novo critério da competição em semicondutores de IA","summary":"No mercado de IA generativa, tornou-se importante não apenas alcançar o melhor desempenho computacional, mas também produzir tokens pelo menor custo possível, mantendo qualidade e velocidade de resposta constantes. ASIC customizados, sistemas em escala de rack e otimizações de memória e rede estão no centro da competição, mas os custos não podem ser comparados apenas pelas especificações dos chips.","sponsorship_disclosure":null,"author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["À medida que os serviços de IA crescem, os custos recorrentes de inferência determinam diretamente os preços e a rentabilidade dos produtos.","O custo por token deve ser calculado pelo custo total, incluindo energia, memória, rede, taxa de utilização, software e qualidade do modelo, e não pelo preço do chip.","Google, AWS, Microsoft e Meta buscam controlar os custos e a cadeia de suprimentos com aceleradores adaptados às próprias cargas de trabalho.","NVIDIA e AMD respondem aos chips customizados combinando versatilidade, ecossistemas de desenvolvimento e otimização no nível de rack.","Na prática, uma métrica mais útil do que o simples custo por token é o custo por tarefa concluída com sucesso, considerando a qualidade e as novas tentativas."],"content_markdown":"A competitividade dos semicondutores para IA generativa está deixando de ser avaliada apenas pela capacidade máxima de processamento e passando a incluir a viabilidade econômica em serviços reais. O termo informal **custo-benefício de tokens**, usado no setor, refere-se a quantos tokens podem ser processados de forma útil com determinado custo ou consumo de energia.\n\nNo entanto, o token mais barato não produz necessariamente o resultado mais econômico. Para avaliar a competitividade real, também é preciso medir a precisão do modelo, a latência de resposta, o número de novas tentativas e a taxa de utilização do data center.\n\n## O que é custo-benefício de tokens\n\nTokens são as unidades de processamento de texto usadas por modelos de linguagem para ler entradas e gerar saídas. Os provedores de API geralmente estabelecem preços distintos para tokens de entrada e de saída e, em alguns casos, aplicam tarifas específicas a entradas armazenadas em cache.\n\nCusto-benefício de tokens não é um termo contábil oficial nem um benchmark padronizado. Na prática, é necessário diferenciar os seguintes indicadores.\n\n| Indicador | Significado | Elementos fáceis de ignorar |\n|---|---|---|\n| Tokens por dólar | Quantidade de tokens processados pelo mesmo custo | Qualidade, latência e diferença de preço entre entrada e saída |\n| Tokens por segundo | Velocidade de geração | Número de usuários simultâneos e latência até o primeiro token |\n| Tokens por watt | Eficiência energética | Perdas de refrigeração e conversão de energia |\n| Vazão por servidor | Vazão total de um servidor ou rack | Baixa utilização e tempo de espera |\n| Custo por tarefa bem-sucedida | Custo total necessário para concluir o objetivo | Novas tentativas, chamadas de ferramentas e caminhos que falharam |\n\nConceitualmente, o custo total por token pode ser expresso da seguinte forma.\n\n`Custo total por token = depreciação + energia·refrigeração + memória·rede + custos operacionais + custos de software ÷ tokens processados efetivamente`\n\nNesse caso, tokens processados efetivamente não significam simplesmente o volume gerado, mas os tokens que atendem aos padrões de qualidade do serviço. Como modelos diferentes usam tokenizadores e comprimentos de resposta distintos, comparar diretamente apenas o preço de 1 milhão de tokens pode produzir distorções.\n\n## Por que o custo de inferência está mudando a competição entre semicondutores\n\n### O custo se repete sempre que o serviço é usado\n\nO treinamento em grande escala é uma etapa na qual se concentram custos enormes, mas não constitui uma despesa totalmente pontual. Mesmo após o pré-treinamento, repetem-se o ajuste fino, o aprendizado por reforço, as avaliações e o treinamento de novas versões. Ainda assim, o custo de inferência gerado a cada solicitação do usuário afeta mais diretamente o modelo de negócios, pois aumenta quase no mesmo ritmo que o crescimento do serviço.\n\nO Stanford AI Index 2025 analisou que o custo de inferência necessário para oferecer determinado nível de desempenho do modelo caiu rapidamente. Esse resultado foi produzido não apenas por melhorias nos semicondutores, mas também por modelos menores, quantização, motores de inferência e maior concorrência. Quando o custo unitário cai, mais funcionalidades se tornam economicamente viáveis, mas também pode surgir o efeito Jevons, no qual o aumento do uso compensa a queda do custo unitário.\n\n### Agentes de IA amplificam o uso de tokens\n\nEm chatbots comuns, perguntas e respostas tendem a terminar de forma relativamente breve. Já os agentes de IA podem repetir as seguintes tarefas.\n\n- Elaboração e revisão de planos\n- Leitura de documentos longos ou repositórios de código\n- Chamadas de ferramentas como busca, banco de dados e terminal\n- Revisão dos resultados da execução e correção de erros\n- Geração e avaliação de várias alternativas\n\nQuanto mais longas forem as etapas da tarefa, maior será o acúmulo de contexto de entrada, raciocínio intermediário, resultados de ferramentas e novas tentativas. Na era dos agentes, o custo total para concluir uma tarefa com sucesso é mais importante do que o preço de uma única chamada ao modelo.\n\n### Energia e instalações criam os limites reais da oferta\n\nMesmo que aceleradores de IA estejam disponíveis, eles não podem operar se faltarem conexão à rede elétrica, refrigeração, memória de alta largura de banda, rede e espaço no data center. Portanto, tokens por watt e tokens por rack significam mais do que apenas economia na conta de energia. Isso ocorre porque esses indicadores determinam o volume de serviços que pode ser oferecido dentro de uma capacidade elétrica limitada.\n\n## Estratégias de hardware para reduzir o custo por token\n\n### 1. Aceleradores próprios adaptados a cargas de trabalho específicas\n\nGPUs de uso geral oferecem suporte a diversos modelos e operações, mas essa flexibilidade tem um custo. Grandes provedores de nuvem podem analisar as cargas de trabalho internas executadas repetidamente, eliminar funcionalidades desnecessárias e otimizar os caminhos de movimentação de dados.\n\n| Empresa | Família de aceleradores divulgada | Principal direção | Cuidados na interpretação |\n|---|---|---|---|\n| Google | TPU, Ironwood | Projeto conjunto de modelos, compiladores e infraestrutura de nuvem | Não é possível afirmar que a mesma eficiência será reproduzida fora do ambiente interno do Google |\n| AWS | Trainium, Inferentia | Chips exclusivos da AWS e software Neuron adaptados a treinamento e inferência | É necessário verificar as operações compatíveis e o custo de portabilidade dos modelos |\n| Microsoft | Maia 100 | Acelerador próprio para cargas de trabalho de IA do Azure | É difícil calcular o custo de cargas de trabalho comerciais apenas com as especificações divulgadas |\n| Meta | MTIA | Otimização de cargas internas de inferência em grande escala, como recomendação e ranqueamento | Não é um chip LLM de uso geral que substitui todos os modelos de IA generativa |\n\nO Ironwood, divulgado pelo Google em 2025, é um TPU de 7ª geração projetado com foco em inferência. É mais correto entendê-lo não como um chip dedicado exclusivamente a um modelo Gemini específico, mas como parte de uma estratégia de integração vertical que otimiza conjuntamente os modelos do Google, o compilador XLA e os data centers.\n\nO objetivo dos chips próprios não se limita à redução do custo de aquisição. Também entram em jogo o controle do cronograma de fornecimento, a melhoria da eficiência energética, a otimização das cargas internas e o aumento do poder de negociação com fornecedores externos.\n\n### 2. Projetar o rack inteiro como um único computador\n\nComo modelos grandes não cabem na memória de um único acelerador, eles são distribuídos entre vários aceleradores. Nesse caso, o desempenho pode depender mais da velocidade de comunicação entre os aceleradores, da largura de banda da memória e do agendamento de software do que da capacidade computacional de cada chip.\n\nA plataforma NVIDIA Blackwell colocou em primeiro plano uma abordagem em escala de rack que integra GPU, CPU, NVLink, rede e software. A AMD também está fortalecendo seus aceleradores Instinct, seu ecossistema de software aberto e seus sistemas em escala de rack. Nessa competição, os seguintes elementos são mais importantes do que benchmarks de chips isolados.\n\n- Número de solicitações que um rack pode processar simultaneamente\n- Custo de movimentação dos pesos e do KV cache entre aceleradores\n- Capacidade de utilizar os equipamentos restantes quando ocorre uma falha\n- Desempenho sustentado dentro dos limites de fornecimento de energia e refrigeração\n- Tempo de desenvolvimento necessário para efetivamente implantar o modelo\n\nMesmo que o preço do rack seja alto, o custo por token pode cair se a utilização e a vazão forem suficientemente elevadas. Por outro lado, até chips baratos perdem sua viabilidade econômica quando passam muito tempo ociosos devido à imaturidade do software ou a gargalos de comunicação.\n\n### 3. Reduzir as fronteiras de comunicação em escala de wafer\n\nA Cerebras desenvolveu a família WSE, que utiliza processadores do tamanho de um wafer em vez de vários dies individuais convencionais. Essa abordagem posiciona grandes recursos computacionais e alta largura de banda de memória em um único wafer, reduzindo parte da comunicação entre chips existente nos clusters tradicionais.\n\nA arquitetura em escala de wafer pode buscar baixa latência e alta vazão, mas não elimina toda a comunicação. Ao conectar vários sistemas ou operar modelos grandes, ainda são necessários memória externa, rede, recuperação de falhas e compiladores. Os recordes de tokens por segundo de um modelo específico também não podem ser comparados diretamente quando precisão, tamanho do lote, comprimento do contexto e condições de saída são diferentes.\n\n### 4. Priorizar a otimização da memória e da movimentação de dados\n\nNa inferência, o processo de movimentar os pesos do modelo e o KV cache pode se tornar um gargalo com mais facilidade do que o cálculo em si. Em especial, a etapa de decodificação que gera um token por vez é fortemente afetada pela largura de banda da memória.\n\nÉ por isso que os fornecedores de hardware enfatizam memória de alta largura de banda, chiplets, interconexões de alta velocidade e caches maiores. Mesmo que os números de desempenho computacional sejam altos, a vazão real de tokens não aumenta se os dados necessários não puderem ser fornecidos no momento certo.\n\n### 5. Projetar conjuntamente hardware e software de inferência\n\nO custo-benefício de tokens não é determinado apenas pelos semicondutores. Mesmo no mesmo hardware, a vazão pode variar significativamente conforme as técnicas a seguir.\n\n- **Quantização:** reduz a precisão dos pesos e das operações para diminuir o uso de memória e o volume de cálculos.\n- **Agrupamento contínuo:** agrupa com eficiência solicitações que chegam em momentos diferentes.\n- **Cache de prefixos:** reutiliza os cálculos de prompts de sistema e contextos repetidos.\n- **Decodificação especulativa:** um modelo pequeno cria tokens candidatos e um modelo grande os verifica.\n- **Separação entre Prefill e decode:** aloca o processamento da entrada e a geração da saída em recursos diferentes.\n- **Roteamento de modelos esparsos:** ativa apenas alguns dos especialistas necessários em modelos Mixture-of-Experts.\n\nChips personalizados só produzem resultados quando o compilador e o modelo são preparados em conjunto. O CUDA é uma importante linha de defesa da NVIDIA porque já existe um ecossistema acumulado que inclui bibliotecas, ferramentas de desenvolvimento, conhecimento de otimização e profissionais qualificados.\n\n## Por que a dependência da NVIDIA não desaparece rapidamente\n\nMesmo empresas que adotam chips próprios ou aceleradores AMD podem continuar usando sistemas NVIDIA em paralelo. Isso não é necessariamente uma contradição estratégica, mas se aproxima mais de uma distribuição das cargas de trabalho.\n\nOs pontos fortes da NVIDIA são os seguintes.\n\n1. CUDA e amplo suporte a bibliotecas de IA\n2. Versatilidade para testar rapidamente novos modelos\n3. Alto nível de maturidade em servidores, redes e software de gerenciamento\n4. Experiência acumulada de desenvolvedores e equipes de operações\n5. Ampla disponibilidade por meio de provedores de nuvem e fabricantes de servidores\n\nPor outro lado, ASICs próprios tendem a obter vantagens em cargas de trabalho consistentes, repetitivas e de grande escala. Portanto, é provável que o mercado evolua para uma estrutura em que GPUs de uso geral e aceleradores especializados dividam funções, em vez de um único tipo de chip substituir todos os demais.\n\n## Condições que precisam ser controladas na comparação do custo-benefício de tokens\n\nO desempenho máximo ou o percentual de redução de custos anunciado por uma empresa não pode ser comparado diretamente se não vier de um benchmark independente realizado sob as mesmas condições. No mínimo, é necessário alinhar as condições a seguir.\n\n| Condição de comparação | Impacto sobre o custo |\n|---|---|\n| Modelo e número de parâmetros | Alteram a memória e o volume de cálculos necessários |\n| Precisão numérica | A velocidade e a qualidade de FP8, BF16, INT8 etc. são diferentes |\n| Comprimento da entrada e da saída | Altera a proporção entre Prefill e decode |\n| Tamanho do lote e solicitações simultâneas | Altera o equilíbrio entre vazão e latência |\n| Latência até o primeiro token | Determina a qualidade percebida de serviços em tempo real |\n| Taxa de utilização | Torna-se a referência para dividir os custos fixos pela vazão real |\n| Escopo energético | Varia conforme a medição inclua apenas o chip ou também refrigeração e rede |\n| Qualidade da resposta | Uma resposta curta, mas imprecisa, gera custos de novas tentativas |\n\nResultados como os do MLPerf Inference, da MLCommons, que especificam modelo, cenário e condições de qualidade, são relativamente úteis. No entanto, nem mesmo benchmarks públicos conseguem reproduzir completamente a configuração dos modelos de empresas reais, os custos regionais de energia e os padrões de tráfego.\n\n## Além do simples preço dos tokens: custo por tarefa bem-sucedida\n\nTokens são fáceis de medir, mas não representam diretamente o valor do resultado final. Mesmo que o modelo A tenha um preço por token menor que o modelo B, o custo para concluir uma tarefa pode ser maior se ele produzir respostas mais longas ou falhar com frequência.\n\nPara serviços de agentes, o cálculo a seguir é mais adequado.\n\n`Custo por tarefa bem-sucedida = custos totais de modelos·ferramentas·infraestrutura ÷ número de tarefas aprovadas nos critérios de qualidade`\n\nIsso inclui não apenas o custo dos tokens, mas também APIs de busca, execução de código, bancos de dados, revisão humana, tentativas malsucedidas e custos decorrentes da latência. Essa é uma perspectiva frequentemente ausente nas discussões sobre competição de desempenho ou custo-benefício de tokens.\n\n## Como diferenciar alegações públicas de números não confirmados\n\nRoadmaps de produtos e previsões do mercado de semicondutores mudam com frequência. Entre alguns nomes e números incluídos nos materiais fornecidos, itens que não foram suficientemente confirmados por documentos oficiais de produtos ou benchmarks reproduzíveis não foram tratados como fatos estabelecidos. Entre os exemplos estão `Frozen V2` e `Claude Fable 5`, apresentados como dedicados a modelos específicos, a velocidade da Cerebras em determinados modelos não divulgados, o custo fixo de 1 milhão de tokens por chip e os números futuros de participação de mercado.\n\nAlém disso, expressões como as seguintes exigem que suas condições sejam verificadas.\n\n- **Eficiência até 10 vezes maior:** é necessário verificar a referência de comparação, a precisão e o escopo do sistema.\n- **Redução de 50% no custo dos tokens:** são necessárias condições relativas ao modelo, à região, à utilização e à depreciação.\n- **Centenas de tokens por segundo:** é necessário distinguir entre a velocidade para um único usuário e a vazão total.\n- **Abandono da NVIDIA:** é necessário verificar se significa uma substituição completa ou a transferência de apenas algumas cargas internas.\n\nPara decisões de investimento ou aquisição de infraestrutura, não se deve usar apenas materiais de divulgação. Também é necessário analisar benchmarks independentes, cronogramas reais de fornecimento, o escopo do suporte de software e o custo total de propriedade.\n\n## Conclusão do mercado\n\nA competição dos semicondutores de IA está deixando a fase em que se disputa apenas a velocidade máxima e avançando para uma fase em que se disputa **a capacidade de produzir tokens e concluir tarefas que atendam aos critérios de qualidade pelo menor custo total possível**.\n\nASICs personalizados buscam alta eficiência em cargas de trabalho repetitivas e de grande escala, enquanto GPUs de uso geral respondem com suporte flexível a modelos e um ecossistema maduro. Projetos em escala de rack, largura de banda da memória, redes, energia e software de inferência tornaram-se tão importantes quanto o próprio chip.\n\nNo fim, o indicador que define o vencedor não é simplesmente o número de tokens por segundo nem o preço de 1 milhão de tokens. O **custo total por tarefa bem-sucedida**, que considera qualidade, latência, utilização e restrições de energia no tráfego real, é um critério mais preciso.","content_html":"\u003cp\u003eA competitividade dos semicondutores para IA generativa está deixando de ser avaliada apenas pela capacidade máxima de processamento e passando a incluir a viabilidade econômica em serviços reais. O termo informal \u003cstrong\u003ecusto-benefício de tokens\u003c/strong\u003e, usado no setor, refere-se a quantos tokens podem ser processados de forma útil com determinado custo ou consumo de energia.\u003c/p\u003e\n\u003cp\u003eNo entanto, o token mais barato não produz necessariamente o resultado mais econômico. Para avaliar a competitividade real, também é preciso medir a precisão do modelo, a latência de resposta, o número de novas tentativas e a taxa de utilização do data center.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#o-que-%C3%A9-custo-benef%C3%ADcio-de-tokens\" class=\"anchor\" id=\"o-que-é-custo-benefício-de-tokens\"\u003e\u003c/a\u003eO que é custo-benefício de tokens\u003c/h2\u003e\n\u003cp\u003eTokens são as unidades de processamento de texto usadas por modelos de linguagem para ler entradas e gerar saídas. Os provedores de API geralmente estabelecem preços distintos para tokens de entrada e de saída e, em alguns casos, aplicam tarifas específicas a entradas armazenadas em cache.\u003c/p\u003e\n\u003cp\u003eCusto-benefício de tokens não é um termo contábil oficial nem um benchmark padronizado. Na prática, é necessário diferenciar os seguintes indicadores.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eIndicador\u003c/th\u003e\n\u003cth\u003eSignificado\u003c/th\u003e\n\u003cth\u003eElementos fáceis de ignorar\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Indicador\"\u003eTokens por dólar\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eQuantidade de tokens processados pelo mesmo custo\u003c/td\u003e\n\u003ctd data-label=\"Elementos fáceis de ignorar\"\u003eQualidade, latência e diferença de preço entre entrada e saída\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Indicador\"\u003eTokens por segundo\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eVelocidade de geração\u003c/td\u003e\n\u003ctd data-label=\"Elementos fáceis de ignorar\"\u003eNúmero de usuários simultâneos e latência até o primeiro token\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Indicador\"\u003eTokens por watt\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eEficiência energética\u003c/td\u003e\n\u003ctd data-label=\"Elementos fáceis de ignorar\"\u003ePerdas de refrigeração e conversão de energia\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Indicador\"\u003eVazão por servidor\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eVazão total de um servidor ou rack\u003c/td\u003e\n\u003ctd data-label=\"Elementos fáceis de ignorar\"\u003eBaixa utilização e tempo de espera\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Indicador\"\u003eCusto por tarefa bem-sucedida\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eCusto total necessário para concluir o objetivo\u003c/td\u003e\n\u003ctd data-label=\"Elementos fáceis de ignorar\"\u003eNovas tentativas, chamadas de ferramentas e caminhos que falharam\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eConceitualmente, o custo total por token pode ser expresso da seguinte forma.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eCusto total por token = depreciação + energia·refrigeração + memória·rede + custos operacionais + custos de software ÷ tokens processados efetivamente\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eNesse caso, tokens processados efetivamente não significam simplesmente o volume gerado, mas os tokens que atendem aos padrões de qualidade do serviço. Como modelos diferentes usam tokenizadores e comprimentos de resposta distintos, comparar diretamente apenas o preço de 1 milhão de tokens pode produzir distorções.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#por-que-o-custo-de-infer%C3%AAncia-est%C3%A1-mudando-a-competi%C3%A7%C3%A3o-entre-semicondutores\" class=\"anchor\" id=\"por-que-o-custo-de-inferência-está-mudando-a-competição-entre-semicondutores\"\u003e\u003c/a\u003ePor que o custo de inferência está mudando a competição entre semicondutores\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#o-custo-se-repete-sempre-que-o-servi%C3%A7o-%C3%A9-usado\" class=\"anchor\" id=\"o-custo-se-repete-sempre-que-o-serviço-é-usado\"\u003e\u003c/a\u003eO custo se repete sempre que o serviço é usado\u003c/h3\u003e\n\u003cp\u003eO treinamento em grande escala é uma etapa na qual se concentram custos enormes, mas não constitui uma despesa totalmente pontual. Mesmo após o pré-treinamento, repetem-se o ajuste fino, o aprendizado por reforço, as avaliações e o treinamento de novas versões. Ainda assim, o custo de inferência gerado a cada solicitação do usuário afeta mais diretamente o modelo de negócios, pois aumenta quase no mesmo ritmo que o crescimento do serviço.\u003c/p\u003e\n\u003cp\u003eO Stanford AI Index 2025 analisou que o custo de inferência necessário para oferecer determinado nível de desempenho do modelo caiu rapidamente. Esse resultado foi produzido não apenas por melhorias nos semicondutores, mas também por modelos menores, quantização, motores de inferência e maior concorrência. Quando o custo unitário cai, mais funcionalidades se tornam economicamente viáveis, mas também pode surgir o efeito Jevons, no qual o aumento do uso compensa a queda do custo unitário.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#agentes-de-ia-amplificam-o-uso-de-tokens\" class=\"anchor\" id=\"agentes-de-ia-amplificam-o-uso-de-tokens\"\u003e\u003c/a\u003eAgentes de IA amplificam o uso de tokens\u003c/h3\u003e\n\u003cp\u003eEm chatbots comuns, perguntas e respostas tendem a terminar de forma relativamente breve. Já os agentes de IA podem repetir as seguintes tarefas.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eElaboração e revisão de planos\u003c/li\u003e\n\u003cli\u003eLeitura de documentos longos ou repositórios de código\u003c/li\u003e\n\u003cli\u003eChamadas de ferramentas como busca, banco de dados e terminal\u003c/li\u003e\n\u003cli\u003eRevisão dos resultados da execução e correção de erros\u003c/li\u003e\n\u003cli\u003eGeração e avaliação de várias alternativas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eQuanto mais longas forem as etapas da tarefa, maior será o acúmulo de contexto de entrada, raciocínio intermediário, resultados de ferramentas e novas tentativas. Na era dos agentes, o custo total para concluir uma tarefa com sucesso é mais importante do que o preço de uma única chamada ao modelo.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#energia-e-instala%C3%A7%C3%B5es-criam-os-limites-reais-da-oferta\" class=\"anchor\" id=\"energia-e-instalações-criam-os-limites-reais-da-oferta\"\u003e\u003c/a\u003eEnergia e instalações criam os limites reais da oferta\u003c/h3\u003e\n\u003cp\u003eMesmo que aceleradores de IA estejam disponíveis, eles não podem operar se faltarem conexão à rede elétrica, refrigeração, memória de alta largura de banda, rede e espaço no data center. Portanto, tokens por watt e tokens por rack significam mais do que apenas economia na conta de energia. Isso ocorre porque esses indicadores determinam o volume de serviços que pode ser oferecido dentro de uma capacidade elétrica limitada.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#estrat%C3%A9gias-de-hardware-para-reduzir-o-custo-por-token\" class=\"anchor\" id=\"estratégias-de-hardware-para-reduzir-o-custo-por-token\"\u003e\u003c/a\u003eEstratégias de hardware para reduzir o custo por token\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#1-aceleradores-pr%C3%B3prios-adaptados-a-cargas-de-trabalho-espec%C3%ADficas\" class=\"anchor\" id=\"1-aceleradores-próprios-adaptados-a-cargas-de-trabalho-específicas\"\u003e\u003c/a\u003e1. Aceleradores próprios adaptados a cargas de trabalho específicas\u003c/h3\u003e\n\u003cp\u003eGPUs de uso geral oferecem suporte a diversos modelos e operações, mas essa flexibilidade tem um custo. Grandes provedores de nuvem podem analisar as cargas de trabalho internas executadas repetidamente, eliminar funcionalidades desnecessárias e otimizar os caminhos de movimentação de dados.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eEmpresa\u003c/th\u003e\n\u003cth\u003eFamília de aceleradores divulgada\u003c/th\u003e\n\u003cth\u003ePrincipal direção\u003c/th\u003e\n\u003cth\u003eCuidados na interpretação\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Empresa\"\u003eGoogle\u003c/td\u003e\n\u003ctd data-label=\"Família de aceleradores divulgada\"\u003eTPU, Ironwood\u003c/td\u003e\n\u003ctd data-label=\"Principal direção\"\u003eProjeto conjunto de modelos, compiladores e infraestrutura de nuvem\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eNão é possível afirmar que a mesma eficiência será reproduzida fora do ambiente interno do Google\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Empresa\"\u003eAWS\u003c/td\u003e\n\u003ctd data-label=\"Família de aceleradores divulgada\"\u003eTrainium, Inferentia\u003c/td\u003e\n\u003ctd data-label=\"Principal direção\"\u003eChips exclusivos da AWS e software Neuron adaptados a treinamento e inferência\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eÉ necessário verificar as operações compatíveis e o custo de portabilidade dos modelos\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Empresa\"\u003eMicrosoft\u003c/td\u003e\n\u003ctd data-label=\"Família de aceleradores divulgada\"\u003eMaia 100\u003c/td\u003e\n\u003ctd data-label=\"Principal direção\"\u003eAcelerador próprio para cargas de trabalho de IA do Azure\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eÉ difícil calcular o custo de cargas de trabalho comerciais apenas com as especificações divulgadas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Empresa\"\u003eMeta\u003c/td\u003e\n\u003ctd data-label=\"Família de aceleradores divulgada\"\u003eMTIA\u003c/td\u003e\n\u003ctd data-label=\"Principal direção\"\u003eOtimização de cargas internas de inferência em grande escala, como recomendação e ranqueamento\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eNão é um chip LLM de uso geral que substitui todos os modelos de IA generativa\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eO Ironwood, divulgado pelo Google em 2025, é um TPU de 7ª geração projetado com foco em inferência. É mais correto entendê-lo não como um chip dedicado exclusivamente a um modelo Gemini específico, mas como parte de uma estratégia de integração vertical que otimiza conjuntamente os modelos do Google, o compilador XLA e os data centers.\u003c/p\u003e\n\u003cp\u003eO objetivo dos chips próprios não se limita à redução do custo de aquisição. Também entram em jogo o controle do cronograma de fornecimento, a melhoria da eficiência energética, a otimização das cargas internas e o aumento do poder de negociação com fornecedores externos.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#2-projetar-o-rack-inteiro-como-um-%C3%BAnico-computador\" class=\"anchor\" id=\"2-projetar-o-rack-inteiro-como-um-único-computador\"\u003e\u003c/a\u003e2. Projetar o rack inteiro como um único computador\u003c/h3\u003e\n\u003cp\u003eComo modelos grandes não cabem na memória de um único acelerador, eles são distribuídos entre vários aceleradores. Nesse caso, o desempenho pode depender mais da velocidade de comunicação entre os aceleradores, da largura de banda da memória e do agendamento de software do que da capacidade computacional de cada chip.\u003c/p\u003e\n\u003cp\u003eA plataforma NVIDIA Blackwell colocou em primeiro plano uma abordagem em escala de rack que integra GPU, CPU, NVLink, rede e software. A AMD também está fortalecendo seus aceleradores Instinct, seu ecossistema de software aberto e seus sistemas em escala de rack. Nessa competição, os seguintes elementos são mais importantes do que benchmarks de chips isolados.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNúmero de solicitações que um rack pode processar simultaneamente\u003c/li\u003e\n\u003cli\u003eCusto de movimentação dos pesos e do KV cache entre aceleradores\u003c/li\u003e\n\u003cli\u003eCapacidade de utilizar os equipamentos restantes quando ocorre uma falha\u003c/li\u003e\n\u003cli\u003eDesempenho sustentado dentro dos limites de fornecimento de energia e refrigeração\u003c/li\u003e\n\u003cli\u003eTempo de desenvolvimento necessário para efetivamente implantar o modelo\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eMesmo que o preço do rack seja alto, o custo por token pode cair se a utilização e a vazão forem suficientemente elevadas. Por outro lado, até chips baratos perdem sua viabilidade econômica quando passam muito tempo ociosos devido à imaturidade do software ou a gargalos de comunicação.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#3-reduzir-as-fronteiras-de-comunica%C3%A7%C3%A3o-em-escala-de-wafer\" class=\"anchor\" id=\"3-reduzir-as-fronteiras-de-comunicação-em-escala-de-wafer\"\u003e\u003c/a\u003e3. Reduzir as fronteiras de comunicação em escala de wafer\u003c/h3\u003e\n\u003cp\u003eA Cerebras desenvolveu a família WSE, que utiliza processadores do tamanho de um wafer em vez de vários dies individuais convencionais. Essa abordagem posiciona grandes recursos computacionais e alta largura de banda de memória em um único wafer, reduzindo parte da comunicação entre chips existente nos clusters tradicionais.\u003c/p\u003e\n\u003cp\u003eA arquitetura em escala de wafer pode buscar baixa latência e alta vazão, mas não elimina toda a comunicação. Ao conectar vários sistemas ou operar modelos grandes, ainda são necessários memória externa, rede, recuperação de falhas e compiladores. Os recordes de tokens por segundo de um modelo específico também não podem ser comparados diretamente quando precisão, tamanho do lote, comprimento do contexto e condições de saída são diferentes.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#4-priorizar-a-otimiza%C3%A7%C3%A3o-da-mem%C3%B3ria-e-da-movimenta%C3%A7%C3%A3o-de-dados\" class=\"anchor\" id=\"4-priorizar-a-otimização-da-memória-e-da-movimentação-de-dados\"\u003e\u003c/a\u003e4. Priorizar a otimização da memória e da movimentação de dados\u003c/h3\u003e\n\u003cp\u003eNa inferência, o processo de movimentar os pesos do modelo e o KV cache pode se tornar um gargalo com mais facilidade do que o cálculo em si. Em especial, a etapa de decodificação que gera um token por vez é fortemente afetada pela largura de banda da memória.\u003c/p\u003e\n\u003cp\u003eÉ por isso que os fornecedores de hardware enfatizam memória de alta largura de banda, chiplets, interconexões de alta velocidade e caches maiores. Mesmo que os números de desempenho computacional sejam altos, a vazão real de tokens não aumenta se os dados necessários não puderem ser fornecidos no momento certo.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#5-projetar-conjuntamente-hardware-e-software-de-infer%C3%AAncia\" class=\"anchor\" id=\"5-projetar-conjuntamente-hardware-e-software-de-inferência\"\u003e\u003c/a\u003e5. Projetar conjuntamente hardware e software de inferência\u003c/h3\u003e\n\u003cp\u003eO custo-benefício de tokens não é determinado apenas pelos semicondutores. Mesmo no mesmo hardware, a vazão pode variar significativamente conforme as técnicas a seguir.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eQuantização:\u003c/strong\u003e reduz a precisão dos pesos e das operações para diminuir o uso de memória e o volume de cálculos.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAgrupamento contínuo:\u003c/strong\u003e agrupa com eficiência solicitações que chegam em momentos diferentes.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eCache de prefixos:\u003c/strong\u003e reutiliza os cálculos de prompts de sistema e contextos repetidos.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eDecodificação especulativa:\u003c/strong\u003e um modelo pequeno cria tokens candidatos e um modelo grande os verifica.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eSeparação entre Prefill e decode:\u003c/strong\u003e aloca o processamento da entrada e a geração da saída em recursos diferentes.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eRoteamento de modelos esparsos:\u003c/strong\u003e ativa apenas alguns dos especialistas necessários em modelos Mixture-of-Experts.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eChips personalizados só produzem resultados quando o compilador e o modelo são preparados em conjunto. O CUDA é uma importante linha de defesa da NVIDIA porque já existe um ecossistema acumulado que inclui bibliotecas, ferramentas de desenvolvimento, conhecimento de otimização e profissionais qualificados.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#por-que-a-depend%C3%AAncia-da-nvidia-n%C3%A3o-desaparece-rapidamente\" class=\"anchor\" id=\"por-que-a-dependência-da-nvidia-não-desaparece-rapidamente\"\u003e\u003c/a\u003ePor que a dependência da NVIDIA não desaparece rapidamente\u003c/h2\u003e\n\u003cp\u003eMesmo empresas que adotam chips próprios ou aceleradores AMD podem continuar usando sistemas NVIDIA em paralelo. Isso não é necessariamente uma contradição estratégica, mas se aproxima mais de uma distribuição das cargas de trabalho.\u003c/p\u003e\n\u003cp\u003eOs pontos fortes da NVIDIA são os seguintes.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eCUDA e amplo suporte a bibliotecas de IA\u003c/li\u003e\n\u003cli\u003eVersatilidade para testar rapidamente novos modelos\u003c/li\u003e\n\u003cli\u003eAlto nível de maturidade em servidores, redes e software de gerenciamento\u003c/li\u003e\n\u003cli\u003eExperiência acumulada de desenvolvedores e equipes de operações\u003c/li\u003e\n\u003cli\u003eAmpla disponibilidade por meio de provedores de nuvem e fabricantes de servidores\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003ePor outro lado, ASICs próprios tendem a obter vantagens em cargas de trabalho consistentes, repetitivas e de grande escala. Portanto, é provável que o mercado evolua para uma estrutura em que GPUs de uso geral e aceleradores especializados dividam funções, em vez de um único tipo de chip substituir todos os demais.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#condi%C3%A7%C3%B5es-que-precisam-ser-controladas-na-compara%C3%A7%C3%A3o-do-custo-benef%C3%ADcio-de-tokens\" class=\"anchor\" id=\"condições-que-precisam-ser-controladas-na-comparação-do-custo-benefício-de-tokens\"\u003e\u003c/a\u003eCondições que precisam ser controladas na comparação do custo-benefício de tokens\u003c/h2\u003e\n\u003cp\u003eO desempenho máximo ou o percentual de redução de custos anunciado por uma empresa não pode ser comparado diretamente se não vier de um benchmark independente realizado sob as mesmas condições. No mínimo, é necessário alinhar as condições a seguir.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eCondição de comparação\u003c/th\u003e\n\u003cth\u003eImpacto sobre o custo\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003eModelo e número de parâmetros\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eAlteram a memória e o volume de cálculos necessários\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003ePrecisão numérica\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eA velocidade e a qualidade de FP8, BF16, INT8 etc. são diferentes\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003eComprimento da entrada e da saída\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eAltera a proporção entre Prefill e decode\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003eTamanho do lote e solicitações simultâneas\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eAltera o equilíbrio entre vazão e latência\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003eLatência até o primeiro token\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eDetermina a qualidade percebida de serviços em tempo real\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003eTaxa de utilização\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eTorna-se a referência para dividir os custos fixos pela vazão real\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003eEscopo energético\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eVaria conforme a medição inclua apenas o chip ou também refrigeração e rede\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Condição de comparação\"\u003eQualidade da resposta\u003c/td\u003e\n\u003ctd data-label=\"Impacto sobre o custo\"\u003eUma resposta curta, mas imprecisa, gera custos de novas tentativas\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eResultados como os do MLPerf Inference, da MLCommons, que especificam modelo, cenário e condições de qualidade, são relativamente úteis. No entanto, nem mesmo benchmarks públicos conseguem reproduzir completamente a configuração dos modelos de empresas reais, os custos regionais de energia e os padrões de tráfego.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#al%C3%A9m-do-simples-pre%C3%A7o-dos-tokens-custo-por-tarefa-bem-sucedida\" class=\"anchor\" id=\"além-do-simples-preço-dos-tokens-custo-por-tarefa-bem-sucedida\"\u003e\u003c/a\u003eAlém do simples preço dos tokens: custo por tarefa bem-sucedida\u003c/h2\u003e\n\u003cp\u003eTokens são fáceis de medir, mas não representam diretamente o valor do resultado final. Mesmo que o modelo A tenha um preço por token menor que o modelo B, o custo para concluir uma tarefa pode ser maior se ele produzir respostas mais longas ou falhar com frequência.\u003c/p\u003e\n\u003cp\u003ePara serviços de agentes, o cálculo a seguir é mais adequado.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eCusto por tarefa bem-sucedida = custos totais de modelos·ferramentas·infraestrutura ÷ número de tarefas aprovadas nos critérios de qualidade\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eIsso inclui não apenas o custo dos tokens, mas também APIs de busca, execução de código, bancos de dados, revisão humana, tentativas malsucedidas e custos decorrentes da latência. Essa é uma perspectiva frequentemente ausente nas discussões sobre competição de desempenho ou custo-benefício de tokens.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#como-diferenciar-alega%C3%A7%C3%B5es-p%C3%BAblicas-de-n%C3%BAmeros-n%C3%A3o-confirmados\" class=\"anchor\" id=\"como-diferenciar-alegações-públicas-de-números-não-confirmados\"\u003e\u003c/a\u003eComo diferenciar alegações públicas de números não confirmados\u003c/h2\u003e\n\u003cp\u003eRoadmaps de produtos e previsões do mercado de semicondutores mudam com frequência. Entre alguns nomes e números incluídos nos materiais fornecidos, itens que não foram suficientemente confirmados por documentos oficiais de produtos ou benchmarks reproduzíveis não foram tratados como fatos estabelecidos. Entre os exemplos estão \u003ccode\u003eFrozen V2\u003c/code\u003e e \u003ccode\u003eClaude Fable 5\u003c/code\u003e, apresentados como dedicados a modelos específicos, a velocidade da Cerebras em determinados modelos não divulgados, o custo fixo de 1 milhão de tokens por chip e os números futuros de participação de mercado.\u003c/p\u003e\n\u003cp\u003eAlém disso, expressões como as seguintes exigem que suas condições sejam verificadas.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eEficiência até 10 vezes maior:\u003c/strong\u003e é necessário verificar a referência de comparação, a precisão e o escopo do sistema.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eRedução de 50% no custo dos tokens:\u003c/strong\u003e são necessárias condições relativas ao modelo, à região, à utilização e à depreciação.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eCentenas de tokens por segundo:\u003c/strong\u003e é necessário distinguir entre a velocidade para um único usuário e a vazão total.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAbandono da NVIDIA:\u003c/strong\u003e é necessário verificar se significa uma substituição completa ou a transferência de apenas algumas cargas internas.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePara decisões de investimento ou aquisição de infraestrutura, não se deve usar apenas materiais de divulgação. Também é necessário analisar benchmarks independentes, cronogramas reais de fornecimento, o escopo do suporte de software e o custo total de propriedade.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#conclus%C3%A3o-do-mercado\" class=\"anchor\" id=\"conclusão-do-mercado\"\u003e\u003c/a\u003eConclusão do mercado\u003c/h2\u003e\n\u003cp\u003eA competição dos semicondutores de IA está deixando a fase em que se disputa apenas a velocidade máxima e avançando para uma fase em que se disputa \u003cstrong\u003ea capacidade de produzir tokens e concluir tarefas que atendam aos critérios de qualidade pelo menor custo total possível\u003c/strong\u003e.\u003c/p\u003e\n\u003cp\u003eASICs personalizados buscam alta eficiência em cargas de trabalho repetitivas e de grande escala, enquanto GPUs de uso geral respondem com suporte flexível a modelos e um ecossistema maduro. Projetos em escala de rack, largura de banda da memória, redes, energia e software de inferência tornaram-se tão importantes quanto o próprio chip.\u003c/p\u003e\n\u003cp\u003eNo fim, o indicador que define o vencedor não é simplesmente o número de tokens por segundo nem o preço de 1 milhão de tokens. O \u003cstrong\u003ecusto total por tarefa bem-sucedida\u003c/strong\u003e, que considera qualidade, latência, utilização e restrições de energia no tráfego real, é um critério mais preciso.\u003c/p\u003e\n","tags":["Semicondutores","IA generativa","Data center de IA","Agentes de IA","Chips de IA"],"faqs":[{"question":"Toseongbi é um indicador oficial de desempenho de semicondutores de IA?","answer":"Não. Toseongbi é uma expressão informal abreviada que significa custo-benefício de tokens. Ao fazer comparações, é preciso distinguir tokens por dólar, tokens por watt, tokens por segundo, latência até o primeiro token e custo por tarefa concluída com sucesso."},{"question":"Por que o custo de inferência se tornou mais importante do que o custo de treinamento?","answer":"Embora o treinamento e o pós-processamento também exijam investimentos recorrentes, a inferência gera custos sempre que um usuário faz uma solicitação. À medida que o uso do serviço e as etapas de trabalho dos agentes aumentam, os custos de energia, tempo dos aceleradores, memória e rede continuam se acumulando."},{"question":"Por que os agentes de IA usam mais tokens do que os chatbots comuns?","answer":"Os agentes de IA repetem processos de planejamento, pesquisa, chamadas de ferramentas, análise de resultados e correção de erros. Em cada etapa, o contexto e os resultados intermediários são inseridos novamente, e os caminhos malsucedidos também geram custos, o que pode aumentar o uso total de tokens."},{"question":"Os chips de IA próprios são sempre mais baratos do que as GPUs da NVIDIA?","answer":"Nem sempre. Chips próprios podem aumentar a eficiência em cargas de trabalho internas constantes e repetitivas, mas a portabilidade de modelos, os compiladores, a equipe de operações e a baixa taxa de utilização podem gerar custos adicionais. A comparação deve considerar o custo total de propriedade, incluindo versatilidade e velocidade de desenvolvimento."},{"question":"Um número maior de tokens por segundo também reduz o custo por token?","answer":"Não necessariamente. Tokens por segundo é um indicador de velocidade e pode não refletir o preço do equipamento, o consumo de energia, o número de solicitações simultâneas e a taxa de utilização. A velocidade de geração para um único usuário e a capacidade total de processamento do servidor também são indicadores diferentes."},{"question":"É possível comparar diretamente o preço de 1 milhão de tokens entre modelos diferentes?","answer":"É preciso ter cautela. Cada modelo tem um tokenizador, tamanho médio de resposta, precisão e política de cache diferentes. Com base na mesma tarefa e nos mesmos critérios de qualidade, é preciso comparar em conjunto os tokens de entrada e saída necessários, o número de novas tentativas e os custos das ferramentas."},{"question":"O que significa dizer que o lock-in do CUDA é forte?","answer":"Significa que o código, as bibliotecas, os métodos de otimização e a equipe de desenvolvimento das empresas estão consolidados no ambiente NVIDIA CUDA. A migração para outros aceleradores pode gerar custos de alteração de código, validação de desempenho e reconstrução da estrutura operacional."},{"question":"Qual é o melhor indicador para avaliar a viabilidade econômica real dos semicondutores de IA?","answer":"Isso varia conforme o objetivo do serviço, mas, para agentes e automação de tarefas, o custo total por tarefa concluída com sucesso é útil. Esse indicador considera não apenas os tokens, mas também a qualidade, as novas tentativas, as chamadas de ferramentas, a latência, o consumo de energia e o custo da revisão humana."}],"sources":[{"url":"https://hai.stanford.edu/ai-index/2025-ai-index-report","title":"Relatório Stanford AI Index 2025","type":"data_point"},{"url":"https://mlcommons.org/benchmarks/inference-datacenter/","title":"MLCommons MLPerf Inference: Datacenter","type":"source"},{"url":"https://cloud.google.com/blog/products/compute/ironwood-tpu-age-of-inference","title":"Google Cloud: TPU Ironwood para a era da inferência","type":"source"},{"url":"https://aws.amazon.com/ai/machine-learning/trainium/","title":"AWS Trainium","type":"source"},{"url":"https://aws.amazon.com/machine-learning/inferentia/","title":"AWS Inferentia","type":"source"},{"url":"https://www.microsoft.com/en-us/microsoft-cloud/blog/2023/11/15/introducing-azure-maia-and-azure-cobalt-custom-silicon-for-ai-and-general-purpose-compute/","title":"Microsoft: Apresentando o Azure Maia e o Azure Cobalt","type":"source"},{"url":"https://engineering.fb.com/2024/04/10/data-center-engineering/next-generation-meta-training-inference-accelerator/","title":"Meta Engineering: Meta Training and Inference Accelerator de próxima geração","type":"source"},{"url":"https://nvidianews.nvidia.com/news/blackwell-ai-computing-platform","title":"Plataforma de computação de IA NVIDIA Blackwell","type":"source"},{"url":"https://www.cerebras.ai/chip","title":"Cerebras Wafer-Scale Engine","type":"source"},{"url":"https://www.anthropic.com/pricing","title":"Preços da API da Anthropic","type":"data_point"},{"url":"https://openai.com/api/pricing/","title":"Preços da API da OpenAI","type":"data_point"}],"images":[{"id":698,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6ODczNiwicHVyIjoiYmxvYl9pZCJ9fQ==--89216a7803ea259aaf3da7751b5e2558ddbd0d58/ai-6567cf23.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 칩과 서버, 메모리, 냉각·전력 장치가 연결되고 비용 저울이 놓인 일러스트","caption":"AI 반도체 인프라의 전력·성능·비용 균형을 시각화했다.","description":null},"en":{"alt":"AI chip linked to servers, memory, cooling and power systems beside a cost-balancing scale","caption":"The illustration visualizes the balance of power, performance and cost in AI chip infrastructure.","description":null},"ja":{"alt":"AIチップとサーバー、メモリ、冷却・電力装置がつながり、コストの天秤が置かれた図","caption":"AI半導体基盤における電力、性能、コストの均衡を表している。","description":null},"es":{"alt":"Chip de IA conectado a servidores, memoria, refrigeración y energía junto a una balanza de costes","caption":"La ilustración representa el equilibrio entre energía, rendimiento y coste en la infraestructura de IA.","description":null},"id":{"alt":"Chip AI terhubung ke server, memori, pendingin, dan daya di samping timbangan biaya","caption":"Ilustrasi ini menggambarkan keseimbangan daya, kinerja, dan biaya infrastruktur chip AI.","description":null},"pt":{"alt":"Chip de IA ligado a servidores, memória, refrigeração e energia ao lado de uma balança de custos","caption":"A ilustração mostra o equilíbrio entre energia, desempenho e custo na infraestrutura de chips de IA.","description":null},"zh-hant":{"alt":"AI 晶片連接伺服器、記憶體、冷卻與供電設備，旁邊設有成本天平","caption":"插圖呈現 AI 晶片基礎設施在電力、效能與成本之間的平衡。","description":null},"de":{"alt":"KI-Chip mit Servern, Speicher, Kühlung und Stromsystemen neben einer Kostenwaage","caption":"Die Illustration zeigt das Gleichgewicht von Energie, Leistung und Kosten einer KI-Chip-Infrastruktur.","description":null}}},{"id":699,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6ODc0MiwicHVyIjoiYmxvYl9pZCJ9fQ==--a4c58b75c8d5a545afb9e6754eeae729a3db54f8/ai-58645f49.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"복잡한 칩 처리 흐름과 최적화된 계층형 AI 서버를 비교한 분할 인포그래픽","caption":"분산된 처리 경로와 통합형 AI 반도체 시스템의 효율 차이를 대비해 보여준다.","description":null},"en":{"alt":"Split infographic comparing tangled chip processing with an optimized layered AI server","caption":"The graphic contrasts fragmented processing paths with an efficient integrated AI chip system.","description":null},"ja":{"alt":"複雑なチップ処理と最適化された階層型AIサーバーを比較する図","caption":"分散した処理経路と統合型AI半導体システムの効率差を対比している。","description":null},"es":{"alt":"Infografía que compara un procesamiento caótico de chips con un servidor de IA optimizado","caption":"El gráfico contrasta rutas fragmentadas con un sistema integrado de chips de IA más eficiente.","description":null},"id":{"alt":"Infografik perbandingan pemrosesan cip yang rumit dan server AI berlapis yang optimal","caption":"Grafik ini membandingkan jalur pemrosesan terpisah dengan sistem cip AI terintegrasi yang efisien.","description":null},"pt":{"alt":"Infográfico compara processamento confuso de chips com servidor de IA otimizado em camadas","caption":"O gráfico contrasta rotas fragmentadas com um sistema integrado de chips de IA mais eficiente.","description":null},"zh-hant":{"alt":"比較混亂晶片處理流程與最佳化分層AI伺服器的資訊圖","caption":"圖中對比分散處理路徑與高效率整合式AI晶片系統。","description":null},"de":{"alt":"Geteilte Infografik vergleicht chaotische Chipverarbeitung mit einem optimierten KI-Server","caption":"Die Grafik stellt fragmentierte Abläufe einem effizienten integrierten KI-Chipsystem gegenüber.","description":null}}}],"published_at":"2026-08-17T07:14:00+09:00","updated_at":"2026-08-17T07:14:00+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/ai-chip-token-economics-and-hardware-strategies"}