{"content_id":"flazlbamrl","slug":"why-most-ai-inference-will-remain-in-data-centers","locale":"pt","schema_type":"TechArticle","category":"trends","category_name":"Tendências","title":"Por que a inferência em data centers provavelmente continuará dominante mesmo com o avanço da IA local","summary":"A IA local terá um papel importante na proteção da privacidade, no funcionamento offline e nas respostas imediatas, mas o centro do desempenho máximo e do processamento em larga escala provavelmente permanecerá nos data centers. As principais razões são o avanço contínuo dos padrões de desempenho, o processamento em lotes e a alta utilização de aceleradores, o hardware voltado para data centers e a crescente complexidade das tarefas de agentes.","sponsorship_disclosure":null,"affiliate_disclosure":null,"commerce_disclosure":null,"author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["O fato de ser possível usar modelos de pesos abertos é diferente do fato de ser possível executá-los com eficiência em dispositivos pessoais.","Mesmo que os notebooks do futuro executem os melhores modelos de hoje, os modelos de data centers daquela época poderão oferecer desempenho superior e capacidade de realizar tarefas mais longas.","Os data centers podem agrupar dinamicamente várias solicitações e compartilhar aceleradores para alcançar maior taxa de processamento e utilização do que equipamentos pessoais.","O custo da inferência local deve ser calculado considerando não apenas a compra da GPU, mas também depreciação, energia, resfriamento, manutenção e baixa utilização.","É provável que o mercado real se aproxime mais de uma estrutura híbrida, conectando os dois ambientes de acordo com cada tarefa, do que de um cenário em que o ambiente local ou a nuvem desapareça."],"content_markdown":"Com o rápido avanço dos modelos de pesos abertos e dos modelos de linguagem pequenos, repete-se a previsão de que, no fim, toda IA será executada em PCs ou smartphones. A execução local tem vantagens claras: reduz as tarifas de uso de APIs, não envia dados sensíveis para fora e funciona mesmo sem internet.\n\nNo entanto, o crescimento da IA local e o declínio da IA em data centers não são a mesma afirmação. Mesmo que, no futuro, aumente muito a quantidade de IA executada em dispositivos pessoais, é provável que os data centers continuem sendo o centro da inferência quando se consideram o volume total de computação e as tarefas de alta complexidade. Isso ocorre porque não apenas o tamanho dos modelos, mas também a competição por desempenho, a demanda dos usuários, o processamento em lotes, a taxa de utilização do hardware e o custo total de propriedade atuam em conjunto.\n\n## Três conceitos que precisam ser diferenciados primeiro\n\nNo debate sobre IA local, diferentes eixos são frequentemente misturados.\n\n| Categoria | Significado | Conceito oposto |\n|---|---|---|\n| Pesos abertos | Modelo cujos pesos treinados podem ser baixados e usados dentro do escopo definido pela licença | Modelo cujos pesos não são disponibilizados |\n| Inferência local e no dispositivo | Método executado diretamente em PCs, smartphones, veículos ou equipamentos internos de uma empresa | Método executado em um data center externo |\n| Hospedagem própria | Método em que o usuário opera o modelo em um servidor ou data center de sua escolha | Método que utiliza a API do fornecedor do modelo |\n\nPesos abertos não significam necessariamente execução local. Uma empresa pode oferecer um modelo de pesos abertos em um cluster de GPUs alugado ou em seu próprio data center. Por outro lado, um fabricante de dispositivos também pode instalar em smartphones um modelo pequeno cujos pesos não são públicos.\n\nPortanto, a verdadeira pergunta não é “os modelos públicos estão avançando?”, mas sim “em qual ambiente computacional é mais vantajoso processar cada tarefa em termos de desempenho, custo, proteção de dados pessoais e operação?”.\n\nPesos abertos também não significam necessariamente código aberto completo. Como as condições aplicáveis ao uso, à redistribuição e aos modelos derivados variam de acordo com a licença de cada modelo, é necessário verificar separadamente a licença correspondente antes da distribuição comercial.\n\n## Os modelos locais do futuro poderão alcançar os melhores modelos atuais\n\nOs avanços em quantização, destilação de conhecimento, poda, otimização de mecanismos de inferência e NPUs dedicadas permitem processar tarefas do mesmo nível com menos memória e energia. É bastante razoável prever que parte das capacidades que hoje exigem servidores possa migrar para notebooks ou smartphones daqui a alguns anos.\n\nNo entanto, o parâmetro de comparação não é fixo. Enquanto os modelos locais do futuro se aproximam dos melhores modelos atuais, os modelos de data center também podem avançar nas seguintes direções.\n\n- Raciocínio e planejamento mais complexos\n- Processamento de contextos mais longos e resultados de busca em grande escala\n- Tarefas multimodais que combinam imagens, áudio e vídeo\n- Uso confiável de várias ferramentas e sistemas externos\n- Raciocínio que utiliza múltiplos agentes ou caminhos candidatos\n- Capacidade de detectar erros e se recuperar durante tarefas longas\n\nPortanto, a afirmação de que “um dia será possível implementar localmente o melhor desempenho atual” é diferente da afirmação de que “também será possível implementar localmente o melhor desempenho daquele momento”. A primeira tem grande probabilidade de se concretizar com o aumento da eficiência tecnológica, mas a segunda pode continuar sendo difícil enquanto também avançarem a escala de energia, memória, redes e aceleradores oferecida pelos data centers.\n\n## O padrão de desempenho suficiente para os usuários também aumenta\n\nAs tarefas representativas do início da IA generativa eram responder a perguntas, resumir documentos curtos, redigir e-mails e gerar código simples. Essas tarefas também podem ser processadas de maneira útil por modelos locais pequenos.\n\nEm contrapartida, agentes de IA leem repositórios inteiros de código, modificam vários arquivos, executam testes e repetem buscas e chamadas a ferramentas externas. Agentes de pesquisa precisam trabalhar por longos períodos, comparando diversas fontes e preservando resultados intermediários. Agentes de automação empresarial também precisam lidar com permissões, bancos de dados e sistemas internos.\n\nEm tarefas longas, os erros de cada etapa se acumulam. Mesmo que a taxa de sucesso de uma etapa seja alta, a probabilidade de sucesso da tarefa inteira pode cair significativamente quando dezenas de decisões e chamadas a ferramentas são executadas em sequência. Por isso, os usuários passam a avaliar as seguintes capacidades, e não apenas a qualidade de uma única resposta.\n\n- Mantém objetivos e restrições por longos períodos?\n- Diagnostica e corrige chamadas malsucedidas a ferramentas?\n- Evita apresentar conteúdo não verificado como se fosse fato?\n- Compreende de forma coerente o contexto amplo do código e dos documentos?\n- Reduz o número de vezes em que uma pessoa precisa intervir?\n\nSe um modelo mais poderoso reduzir o retrabalho e o tempo de supervisão, o custo total da atividade poderá ser menor mesmo que o preço por token seja mais alto. Por outro lado, para tarefas curtas e repetitivas, um modelo local barato pode ser mais racional. No fim, o critério de escolha não é apenas o preço do modelo, mas o custo de cada tarefa concluída e o risco de falha.\n\n## As principais vantagens dos data centers são o processamento em lotes e o compartilhamento de recursos\n\nA geração de tokens por grandes modelos de linguagem depende muito do processo de leitura repetida dos pesos do modelo na memória do acelerador. Quando apenas uma solicitação é processada, parte dos grandes recursos de computação paralela e da largura de banda da memória pode não ser plenamente aproveitada.\n\nOs sistemas de serviço agrupam em lotes as solicitações de diferentes usuários para realizar operações matriciais. Assim, várias solicitações podem ser processadas em conjunto em uma única etapa de computação, aumentando a densidade computacional e a vazão. O processamento contínuo em lotes, que remove as solicitações concluídas e inclui novas, é uma tecnologia essencial para elevar a utilização em serviços reais, nos quais os comprimentos de entrada e saída variam.\n\nO processamento em lotes não elimina completamente os custos proporcionalmente ao número de solicitações. Há tokens e cache KV que precisam ser calculados para cada solicitação, e o aumento do lote também eleva o uso de memória e a latência. Os operadores precisam equilibrar os seguintes fatores.\n\n- Número de tokens processados por segundo\n- Latência até a geração do primeiro token\n- Latência dos tokens de saída de cada solicitação\n- Memória ocupada pelo cache KV\n- Combinação de solicitações com contextos longos e curtos\n- Metas de nível de serviço e número máximo de solicitações simultâneas\n\nAinda assim, como os serviços de grande escala recebem solicitações continuamente, é mais fácil reduzir o tempo ocioso do que com uma GPU pessoal. Também é possível compartilhar réplicas de modelos entre vários clientes, ajustar o número de servidores conforme o tráfego e transferir algumas tarefas para aceleradores adequados.\n\n## GPUs pessoais tendem a ter baixa utilização média\n\nEquipamentos pessoais podem ser usados imediatamente quando necessário, mas podem passar a maior parte do dia em espera. Mesmo executando vários agentes ao mesmo tempo, é difícil preencher continuamente solicitações de diferentes durações como fazem os grandes serviços.\n\nA viabilidade econômica do equipamento local depende não da velocidade máxima de processamento, mas da utilização real. Mesmo possuindo uma GPU cara, se ela for usada apenas algumas horas por semana, o custo de capital por token útil aumenta. Por outro lado, se houver trabalhos contínuos, como produção de vídeos, testes de software ou processamento de documentos em massa, a utilização do equipamento local pode aumentar, tornando-o competitivo em custos.\n\nDisponibilizar um servidor local para várias pessoas aumenta a utilização e as oportunidades de processamento em lotes. No entanto, nesse momento, tornam-se necessários autenticação, controle de acesso, filas de tarefas, resposta a falhas, refrigeração e monitoramento. Mesmo em pequena escala, surgem problemas semelhantes aos da operação de um data center.\n\n## Os aceleradores para data centers têm finalidades e configurações diferentes\n\nAs GPUs para consumidores também são poderosas em IA generativa, mas são projetadas levando em consideração jogos, gráficos e computação de uso geral. Os aceleradores para data centers se concentram em memória de alta largura de banda e grande capacidade, interconexão entre aceleradores, expansão no nível de racks e computação de IA em baixa precisão.\n\nA GeForce RTX 4090 é uma GPU para consumidores, enquanto a NVIDIA B200 é um acelerador de IA para data centers. Segundo as estimativas comparadas pelo autor, a NVIDIA B200 tem desempenho computacional aproximadamente 3 vezes superior ao da RTX 4090 no mesmo nível de consumo de energia, e sua largura de banda de memória é quase 4 vezes maior. Essa diferença favorece os data centers ao carregar grandes modelos na memória e servi-los com alta vazão.\n\nNo entanto, os números de desempenho dos dois produtos não devem ser comparados por meio de uma proporção simples. Os valores divulgados de computação de IA podem variar quanto à precisão, à aplicação ou não de esparsidade, ao limite de energia e à configuração do sistema. O desempenho real de inferência deve ser avaliado por benchmarks que igualem até mesmo a arquitetura do modelo, o método de quantização, o tamanho do lote, o comprimento do contexto e a pilha de software.\n\nA distribuição de grandes modelos entre vários aceleradores também gera custos de comunicação. Os data centers oferecem interconexões de alta velocidade e redes otimizadas, mas a inferência distribuída não é gratuita. Para modelos pequenos, a execução em uma única GPU para consumidores pode ser mais simples e eficiente.\n\n## Como calcular o custo real da inferência local\n\nO cálculo de que “como a GPU já foi comprada, a inferência posterior é gratuita” desconsidera os custos de capital e operação. É preciso incluir todos os itens a seguir.\n\n**Custo total de propriedade local**\n\n`custo de compra - valor estimado de revenda + custo de energia + custo de refrigeração + custo de reparos e substituições + valor do tempo operacional`\n\nAo dividir esse valor pelo número de tokens úteis efetivamente gerados ou pelo número de tarefas concluídas, obtém-se um custo unitário comparável. É mais preciso calcular com base em resultados que possam ser usados após a revisão, e não apenas em tokens de saída.\n\nO custo de energia pode ser estimado da seguinte forma.\n\n`consumo médio de energia (kW) × tempo de execução (h) × tarifa de energia`\n\nTambém é necessário incluir as perdas da fonte de alimentação e o consumo de energia da CPU, da memória, dos dispositivos de armazenamento e dos equipamentos de refrigeração. Como as tarifas de energia e o tempo de uso dos equipamentos variam muito de uma região para outra, não é adequado apresentar um custo mensal fixo de eletricidade aplicável a todos os usuários.\n\n**O custo total da nuvem** pode incluir, além das tarifas de API ou assinatura, transferência de dados, latência, custo de troca de fornecedor, limites de uso e custos de gestão de informações sensíveis. Quando o uso é pequeno ou irregular, os serviços pagos conforme o uso tendem a ser vantajosos; para trabalhos contínuos, previsíveis e em grande volume, equipamentos próprios ou infraestrutura reservada podem ser mais vantajosos.\n\n## Áreas em que a IA local é claramente vantajosa\n\nA viabilidade econômica dos data centers não elimina a necessidade da IA local. Nas condições a seguir, o controle dos dados, a disponibilidade ou o tempo de resposta podem ser mais importantes do que usar o melhor modelo.\n\n| Situação | Vantagem da execução local | Restrição a verificar |\n|---|---|---|\n| Ambiente offline | Funciona independentemente de falhas na internet ou restrições de comunicação | Desempenho do dispositivo e consumo de bateria |\n| Processamento de informações sensíveis | Pode evitar o envio dos dados originais para servidores externos | Roubo do dispositivo, malware e proteção dos logs locais |\n| Assistência de teclado e voz | Baixa latência e resposta imediata | Tamanho e precisão do modelo |\n| Classificação repetitiva em pequena escala | Baixo custo marginal se o volume de uso for suficiente | Custos iniciais de desenvolvimento e equipamentos |\n| Controle de veículos, fábricas e operações em campo | Decisões rápidas sem ida e volta pela rede | Validação de segurança e sistema de atualizações |\n| Recursos de personalização | Uso do contexto do usuário dentro do dispositivo | Gestão de permissões e exclusão de dados |\n\nA proteção de dados pessoais também não pode ser avaliada de forma binária, como “local é seguro, nuvem é perigosa”. Se o equipamento local estiver infectado ou o disco não estiver criptografado, os dados poderão ser expostos. Por outro lado, serviços em nuvem também podem oferecer limites de retenção de dados, criptografia e ambientes de execução isolados, mas os usuários precisam verificar a arquitetura técnica real e as condições contratuais.\n\n## O formato mais provável é a IA híbrida\n\nÉ provável que a execução local e os data centers dividam funções, em vez de uma substituir completamente a outra.\n\n1. O dispositivo processa detecção de voz, remoção de dados pessoais, classificações curtas e geração simples.\n2. Um roteador local avalia a complexidade e a sensibilidade da tarefa.\n3. O modelo do data center é chamado apenas quando são necessários raciocínio complexo, contexto longo ou buscas em grande escala.\n4. Parte do resultado é verificada localmente ou combinada com os dados do usuário.\n5. Se a conexão for interrompida, o sistema passa para um modelo local com funcionalidades limitadas.\n\nEssa arquitetura permite usar um modelo poderoso quando necessário, ao mesmo tempo que reduz o volume de chamadas à nuvem. Os fornecedores podem usar modelos pequenos para filtragem, roteamento e geração de rascunhos, destinando os modelos grandes apenas às solicitações difíceis. Os usuários também podem executar modelos públicos localmente e conectar um modelo separado em um data center como recurso auxiliar.\n\n## Primeiro é preciso definir qual métrica representa “a maior parte da inferência”\n\nA participação da IA local e da IA em data centers pode parecer completamente diferente conforme a unidade de medição. Essa distinção é um elemento frequentemente ignorado em debates simplificados sobre participação de mercado.\n\n- **Número de solicitações:** se aumentarem as conclusões automáticas curtas ou classificações em smartphones, a participação local poderá ser alta.\n- **Número de tokens gerados:** se documentos longos e tarefas de agentes se concentrarem na nuvem, a participação dos data centers poderá ser alta.\n- **Volume de computação:** raciocínios difíceis, geração de vários candidatos e processamento multimodal podem elevar o volume total de computação dos data centers.\n- **Valor dos gastos:** serviços empresariais e infraestrutura de alto preço podem elevar a participação dos data centers nos gastos.\n- **Tempo percebido pelo usuário:** recursos auxiliares locais sempre ativos podem fazer com que o usuário sinta que utiliza a IA local com mais frequência.\n\nPortanto, no futuro, é possível que o número de solicitações locais aumente, enquanto o volume total de computação de IA, as tarefas de alta complexidade e os gastos relacionados se concentrem nos data centers. Tanto a frase “toda IA vai se tornar local” quanto “a IA local não é importante” ignoram essa diferença.\n\n## Variáveis que podem mudar a perspectiva\n\nA perspectiva centrada em data centers não é uma lei estabelecida. As mudanças a seguir podem fazer com que a participação local cresça mais rapidamente do que o esperado.\n\n- A capacidade dos modelos atingir uma saturação real em muitas atividades, reduzindo o valor de modelos mais poderosos\n- Dispositivos de baixo consumo com alta capacidade e largura de banda de memória se popularizarem\n- A destilação e a quantização reduzirem significativamente os modelos sem quase nenhuma perda da capacidade de raciocínio complexo\n- Regulamentações de privacidade e segurança nacional restringirem fortemente o envio de dados a servidores externos\n- A expansão dos data centers desacelerar devido a restrições da rede elétrica, de água para refrigeração, do fornecimento de semicondutores ou de licenciamento\n- Tecnologias e sistemas de remuneração capazes de agregar com segurança recursos distribuídos de dispositivos amadurecerem\n\nPor outro lado, se as tarefas de agentes se tornarem mais longas, a geração de vídeos e o processamento multimodal em tempo real se popularizarem, e a utilização dos aceleradores e a eficiência energética dos data centers continuarem melhorando, a vantagem da inferência centralizada poderá se fortalecer.\n\n## Conclusão\n\nA IA local não é uma tecnologia periférica destinada a desaparecer. É provável que ela se torne uma camada essencial em recursos auxiliares de smartphones, no processamento de informações sensíveis, em trabalhos offline e em serviços nos quais a latência é importante. Os modelos de pesos abertos também ampliam as opções e a capacidade de hospedagem própria, contribuindo para reduzir a dependência de fornecedores.\n\nNo entanto, é difícil considerar que apenas o aumento da eficiência dos modelos eliminará a necessidade dos data centers. O padrão de melhor desempenho e as exigências dos usuários aumentam em conjunto, enquanto os data centers possuem vantagens estruturais no processamento em lotes, na alta utilização dos aceleradores, na memória de alta largura de banda e grande capacidade e no compartilhamento de recursos.\n\nA perspectiva de longo prazo mais convincente não é a vitória da execução local nem o monopólio da nuvem. É uma arquitetura em camadas, na qual tarefas curtas, sensíveis e imediatas são processadas no dispositivo, enquanto tarefas complexas, longas e de alto custo são enviadas aos data centers. Nesse ambiente, a principal vantagem competitiva deixa de ser o tamanho de um único modelo e passa a ser o roteamento das tarefas para o local de execução adequado, o controle de custos e a governança de dados.","content_html":"\u003cp\u003eCom o rápido avanço dos modelos de pesos abertos e dos modelos de linguagem pequenos, repete-se a previsão de que, no fim, toda IA será executada em PCs ou smartphones. A execução local tem vantagens claras: reduz as tarifas de uso de APIs, não envia dados sensíveis para fora e funciona mesmo sem internet.\u003c/p\u003e\n\u003cp\u003eNo entanto, o crescimento da IA local e o declínio da IA em data centers não são a mesma afirmação. Mesmo que, no futuro, aumente muito a quantidade de IA executada em dispositivos pessoais, é provável que os data centers continuem sendo o centro da inferência quando se consideram o volume total de computação e as tarefas de alta complexidade. Isso ocorre porque não apenas o tamanho dos modelos, mas também a competição por desempenho, a demanda dos usuários, o processamento em lotes, a taxa de utilização do hardware e o custo total de propriedade atuam em conjunto.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#tr%C3%AAs-conceitos-que-precisam-ser-diferenciados-primeiro\" class=\"anchor\" id=\"três-conceitos-que-precisam-ser-diferenciados-primeiro\"\u003e\u003c/a\u003eTrês conceitos que precisam ser diferenciados primeiro\u003c/h2\u003e\n\u003cp\u003eNo debate sobre IA local, diferentes eixos são frequentemente misturados.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eCategoria\u003c/th\u003e\n\u003cth\u003eSignificado\u003c/th\u003e\n\u003cth\u003eConceito oposto\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Categoria\"\u003ePesos abertos\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eModelo cujos pesos treinados podem ser baixados e usados dentro do escopo definido pela licença\u003c/td\u003e\n\u003ctd data-label=\"Conceito oposto\"\u003eModelo cujos pesos não são disponibilizados\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Categoria\"\u003eInferência local e no dispositivo\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eMétodo executado diretamente em PCs, smartphones, veículos ou equipamentos internos de uma empresa\u003c/td\u003e\n\u003ctd data-label=\"Conceito oposto\"\u003eMétodo executado em um data center externo\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Categoria\"\u003eHospedagem própria\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eMétodo em que o usuário opera o modelo em um servidor ou data center de sua escolha\u003c/td\u003e\n\u003ctd data-label=\"Conceito oposto\"\u003eMétodo que utiliza a API do fornecedor do modelo\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003ePesos abertos não significam necessariamente execução local. Uma empresa pode oferecer um modelo de pesos abertos em um cluster de GPUs alugado ou em seu próprio data center. Por outro lado, um fabricante de dispositivos também pode instalar em smartphones um modelo pequeno cujos pesos não são públicos.\u003c/p\u003e\n\u003cp\u003ePortanto, a verdadeira pergunta não é “os modelos públicos estão avançando?”, mas sim “em qual ambiente computacional é mais vantajoso processar cada tarefa em termos de desempenho, custo, proteção de dados pessoais e operação?”.\u003c/p\u003e\n\u003cp\u003ePesos abertos também não significam necessariamente código aberto completo. Como as condições aplicáveis ao uso, à redistribuição e aos modelos derivados variam de acordo com a licença de cada modelo, é necessário verificar separadamente a licença correspondente antes da distribuição comercial.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#os-modelos-locais-do-futuro-poder%C3%A3o-alcan%C3%A7ar-os-melhores-modelos-atuais\" class=\"anchor\" id=\"os-modelos-locais-do-futuro-poderão-alcançar-os-melhores-modelos-atuais\"\u003e\u003c/a\u003eOs modelos locais do futuro poderão alcançar os melhores modelos atuais\u003c/h2\u003e\n\u003cp\u003eOs avanços em quantização, destilação de conhecimento, poda, otimização de mecanismos de inferência e NPUs dedicadas permitem processar tarefas do mesmo nível com menos memória e energia. É bastante razoável prever que parte das capacidades que hoje exigem servidores possa migrar para notebooks ou smartphones daqui a alguns anos.\u003c/p\u003e\n\u003cp\u003eNo entanto, o parâmetro de comparação não é fixo. Enquanto os modelos locais do futuro se aproximam dos melhores modelos atuais, os modelos de data center também podem avançar nas seguintes direções.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eRaciocínio e planejamento mais complexos\u003c/li\u003e\n\u003cli\u003eProcessamento de contextos mais longos e resultados de busca em grande escala\u003c/li\u003e\n\u003cli\u003eTarefas multimodais que combinam imagens, áudio e vídeo\u003c/li\u003e\n\u003cli\u003eUso confiável de várias ferramentas e sistemas externos\u003c/li\u003e\n\u003cli\u003eRaciocínio que utiliza múltiplos agentes ou caminhos candidatos\u003c/li\u003e\n\u003cli\u003eCapacidade de detectar erros e se recuperar durante tarefas longas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePortanto, a afirmação de que “um dia será possível implementar localmente o melhor desempenho atual” é diferente da afirmação de que “também será possível implementar localmente o melhor desempenho daquele momento”. A primeira tem grande probabilidade de se concretizar com o aumento da eficiência tecnológica, mas a segunda pode continuar sendo difícil enquanto também avançarem a escala de energia, memória, redes e aceleradores oferecida pelos data centers.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#o-padr%C3%A3o-de-desempenho-suficiente-para-os-usu%C3%A1rios-tamb%C3%A9m-aumenta\" class=\"anchor\" id=\"o-padrão-de-desempenho-suficiente-para-os-usuários-também-aumenta\"\u003e\u003c/a\u003eO padrão de desempenho suficiente para os usuários também aumenta\u003c/h2\u003e\n\u003cp\u003eAs tarefas representativas do início da IA generativa eram responder a perguntas, resumir documentos curtos, redigir e-mails e gerar código simples. Essas tarefas também podem ser processadas de maneira útil por modelos locais pequenos.\u003c/p\u003e\n\u003cp\u003eEm contrapartida, agentes de IA leem repositórios inteiros de código, modificam vários arquivos, executam testes e repetem buscas e chamadas a ferramentas externas. Agentes de pesquisa precisam trabalhar por longos períodos, comparando diversas fontes e preservando resultados intermediários. Agentes de automação empresarial também precisam lidar com permissões, bancos de dados e sistemas internos.\u003c/p\u003e\n\u003cp\u003eEm tarefas longas, os erros de cada etapa se acumulam. Mesmo que a taxa de sucesso de uma etapa seja alta, a probabilidade de sucesso da tarefa inteira pode cair significativamente quando dezenas de decisões e chamadas a ferramentas são executadas em sequência. Por isso, os usuários passam a avaliar as seguintes capacidades, e não apenas a qualidade de uma única resposta.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eMantém objetivos e restrições por longos períodos?\u003c/li\u003e\n\u003cli\u003eDiagnostica e corrige chamadas malsucedidas a ferramentas?\u003c/li\u003e\n\u003cli\u003eEvita apresentar conteúdo não verificado como se fosse fato?\u003c/li\u003e\n\u003cli\u003eCompreende de forma coerente o contexto amplo do código e dos documentos?\u003c/li\u003e\n\u003cli\u003eReduz o número de vezes em que uma pessoa precisa intervir?\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eSe um modelo mais poderoso reduzir o retrabalho e o tempo de supervisão, o custo total da atividade poderá ser menor mesmo que o preço por token seja mais alto. Por outro lado, para tarefas curtas e repetitivas, um modelo local barato pode ser mais racional. No fim, o critério de escolha não é apenas o preço do modelo, mas o custo de cada tarefa concluída e o risco de falha.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#as-principais-vantagens-dos-data-centers-s%C3%A3o-o-processamento-em-lotes-e-o-compartilhamento-de-recursos\" class=\"anchor\" id=\"as-principais-vantagens-dos-data-centers-são-o-processamento-em-lotes-e-o-compartilhamento-de-recursos\"\u003e\u003c/a\u003eAs principais vantagens dos data centers são o processamento em lotes e o compartilhamento de recursos\u003c/h2\u003e\n\u003cp\u003eA geração de tokens por grandes modelos de linguagem depende muito do processo de leitura repetida dos pesos do modelo na memória do acelerador. Quando apenas uma solicitação é processada, parte dos grandes recursos de computação paralela e da largura de banda da memória pode não ser plenamente aproveitada.\u003c/p\u003e\n\u003cp\u003eOs sistemas de serviço agrupam em lotes as solicitações de diferentes usuários para realizar operações matriciais. Assim, várias solicitações podem ser processadas em conjunto em uma única etapa de computação, aumentando a densidade computacional e a vazão. O processamento contínuo em lotes, que remove as solicitações concluídas e inclui novas, é uma tecnologia essencial para elevar a utilização em serviços reais, nos quais os comprimentos de entrada e saída variam.\u003c/p\u003e\n\u003cp\u003eO processamento em lotes não elimina completamente os custos proporcionalmente ao número de solicitações. Há tokens e cache KV que precisam ser calculados para cada solicitação, e o aumento do lote também eleva o uso de memória e a latência. Os operadores precisam equilibrar os seguintes fatores.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNúmero de tokens processados por segundo\u003c/li\u003e\n\u003cli\u003eLatência até a geração do primeiro token\u003c/li\u003e\n\u003cli\u003eLatência dos tokens de saída de cada solicitação\u003c/li\u003e\n\u003cli\u003eMemória ocupada pelo cache KV\u003c/li\u003e\n\u003cli\u003eCombinação de solicitações com contextos longos e curtos\u003c/li\u003e\n\u003cli\u003eMetas de nível de serviço e número máximo de solicitações simultâneas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eAinda assim, como os serviços de grande escala recebem solicitações continuamente, é mais fácil reduzir o tempo ocioso do que com uma GPU pessoal. Também é possível compartilhar réplicas de modelos entre vários clientes, ajustar o número de servidores conforme o tráfego e transferir algumas tarefas para aceleradores adequados.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#gpus-pessoais-tendem-a-ter-baixa-utiliza%C3%A7%C3%A3o-m%C3%A9dia\" class=\"anchor\" id=\"gpus-pessoais-tendem-a-ter-baixa-utilização-média\"\u003e\u003c/a\u003eGPUs pessoais tendem a ter baixa utilização média\u003c/h2\u003e\n\u003cp\u003eEquipamentos pessoais podem ser usados imediatamente quando necessário, mas podem passar a maior parte do dia em espera. Mesmo executando vários agentes ao mesmo tempo, é difícil preencher continuamente solicitações de diferentes durações como fazem os grandes serviços.\u003c/p\u003e\n\u003cp\u003eA viabilidade econômica do equipamento local depende não da velocidade máxima de processamento, mas da utilização real. Mesmo possuindo uma GPU cara, se ela for usada apenas algumas horas por semana, o custo de capital por token útil aumenta. Por outro lado, se houver trabalhos contínuos, como produção de vídeos, testes de software ou processamento de documentos em massa, a utilização do equipamento local pode aumentar, tornando-o competitivo em custos.\u003c/p\u003e\n\u003cp\u003eDisponibilizar um servidor local para várias pessoas aumenta a utilização e as oportunidades de processamento em lotes. No entanto, nesse momento, tornam-se necessários autenticação, controle de acesso, filas de tarefas, resposta a falhas, refrigeração e monitoramento. Mesmo em pequena escala, surgem problemas semelhantes aos da operação de um data center.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#os-aceleradores-para-data-centers-t%C3%AAm-finalidades-e-configura%C3%A7%C3%B5es-diferentes\" class=\"anchor\" id=\"os-aceleradores-para-data-centers-têm-finalidades-e-configurações-diferentes\"\u003e\u003c/a\u003eOs aceleradores para data centers têm finalidades e configurações diferentes\u003c/h2\u003e\n\u003cp\u003eAs GPUs para consumidores também são poderosas em IA generativa, mas são projetadas levando em consideração jogos, gráficos e computação de uso geral. Os aceleradores para data centers se concentram em memória de alta largura de banda e grande capacidade, interconexão entre aceleradores, expansão no nível de racks e computação de IA em baixa precisão.\u003c/p\u003e\n\u003cp\u003eA GeForce RTX 4090 é uma GPU para consumidores, enquanto a NVIDIA B200 é um acelerador de IA para data centers. Segundo as estimativas comparadas pelo autor, a NVIDIA B200 tem desempenho computacional aproximadamente 3 vezes superior ao da RTX 4090 no mesmo nível de consumo de energia, e sua largura de banda de memória é quase 4 vezes maior. Essa diferença favorece os data centers ao carregar grandes modelos na memória e servi-los com alta vazão.\u003c/p\u003e\n\u003cp\u003eNo entanto, os números de desempenho dos dois produtos não devem ser comparados por meio de uma proporção simples. Os valores divulgados de computação de IA podem variar quanto à precisão, à aplicação ou não de esparsidade, ao limite de energia e à configuração do sistema. O desempenho real de inferência deve ser avaliado por benchmarks que igualem até mesmo a arquitetura do modelo, o método de quantização, o tamanho do lote, o comprimento do contexto e a pilha de software.\u003c/p\u003e\n\u003cp\u003eA distribuição de grandes modelos entre vários aceleradores também gera custos de comunicação. Os data centers oferecem interconexões de alta velocidade e redes otimizadas, mas a inferência distribuída não é gratuita. Para modelos pequenos, a execução em uma única GPU para consumidores pode ser mais simples e eficiente.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#como-calcular-o-custo-real-da-infer%C3%AAncia-local\" class=\"anchor\" id=\"como-calcular-o-custo-real-da-inferência-local\"\u003e\u003c/a\u003eComo calcular o custo real da inferência local\u003c/h2\u003e\n\u003cp\u003eO cálculo de que “como a GPU já foi comprada, a inferência posterior é gratuita” desconsidera os custos de capital e operação. É preciso incluir todos os itens a seguir.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eCusto total de propriedade local\u003c/strong\u003e\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003ecusto de compra - valor estimado de revenda + custo de energia + custo de refrigeração + custo de reparos e substituições + valor do tempo operacional\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eAo dividir esse valor pelo número de tokens úteis efetivamente gerados ou pelo número de tarefas concluídas, obtém-se um custo unitário comparável. É mais preciso calcular com base em resultados que possam ser usados após a revisão, e não apenas em tokens de saída.\u003c/p\u003e\n\u003cp\u003eO custo de energia pode ser estimado da seguinte forma.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003econsumo médio de energia (kW) × tempo de execução (h) × tarifa de energia\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eTambém é necessário incluir as perdas da fonte de alimentação e o consumo de energia da CPU, da memória, dos dispositivos de armazenamento e dos equipamentos de refrigeração. Como as tarifas de energia e o tempo de uso dos equipamentos variam muito de uma região para outra, não é adequado apresentar um custo mensal fixo de eletricidade aplicável a todos os usuários.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eO custo total da nuvem\u003c/strong\u003e pode incluir, além das tarifas de API ou assinatura, transferência de dados, latência, custo de troca de fornecedor, limites de uso e custos de gestão de informações sensíveis. Quando o uso é pequeno ou irregular, os serviços pagos conforme o uso tendem a ser vantajosos; para trabalhos contínuos, previsíveis e em grande volume, equipamentos próprios ou infraestrutura reservada podem ser mais vantajosos.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%C3%A1reas-em-que-a-ia-local-%C3%A9-claramente-vantajosa\" class=\"anchor\" id=\"áreas-em-que-a-ia-local-é-claramente-vantajosa\"\u003e\u003c/a\u003eÁreas em que a IA local é claramente vantajosa\u003c/h2\u003e\n\u003cp\u003eA viabilidade econômica dos data centers não elimina a necessidade da IA local. Nas condições a seguir, o controle dos dados, a disponibilidade ou o tempo de resposta podem ser mais importantes do que usar o melhor modelo.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eSituação\u003c/th\u003e\n\u003cth\u003eVantagem da execução local\u003c/th\u003e\n\u003cth\u003eRestrição a verificar\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situação\"\u003eAmbiente offline\u003c/td\u003e\n\u003ctd data-label=\"Vantagem da execução local\"\u003eFunciona independentemente de falhas na internet ou restrições de comunicação\u003c/td\u003e\n\u003ctd data-label=\"Restrição a verificar\"\u003eDesempenho do dispositivo e consumo de bateria\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situação\"\u003eProcessamento de informações sensíveis\u003c/td\u003e\n\u003ctd data-label=\"Vantagem da execução local\"\u003ePode evitar o envio dos dados originais para servidores externos\u003c/td\u003e\n\u003ctd data-label=\"Restrição a verificar\"\u003eRoubo do dispositivo, malware e proteção dos logs locais\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situação\"\u003eAssistência de teclado e voz\u003c/td\u003e\n\u003ctd data-label=\"Vantagem da execução local\"\u003eBaixa latência e resposta imediata\u003c/td\u003e\n\u003ctd data-label=\"Restrição a verificar\"\u003eTamanho e precisão do modelo\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situação\"\u003eClassificação repetitiva em pequena escala\u003c/td\u003e\n\u003ctd data-label=\"Vantagem da execução local\"\u003eBaixo custo marginal se o volume de uso for suficiente\u003c/td\u003e\n\u003ctd data-label=\"Restrição a verificar\"\u003eCustos iniciais de desenvolvimento e equipamentos\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situação\"\u003eControle de veículos, fábricas e operações em campo\u003c/td\u003e\n\u003ctd data-label=\"Vantagem da execução local\"\u003eDecisões rápidas sem ida e volta pela rede\u003c/td\u003e\n\u003ctd data-label=\"Restrição a verificar\"\u003eValidação de segurança e sistema de atualizações\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situação\"\u003eRecursos de personalização\u003c/td\u003e\n\u003ctd data-label=\"Vantagem da execução local\"\u003eUso do contexto do usuário dentro do dispositivo\u003c/td\u003e\n\u003ctd data-label=\"Restrição a verificar\"\u003eGestão de permissões e exclusão de dados\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eA proteção de dados pessoais também não pode ser avaliada de forma binária, como “local é seguro, nuvem é perigosa”. Se o equipamento local estiver infectado ou o disco não estiver criptografado, os dados poderão ser expostos. Por outro lado, serviços em nuvem também podem oferecer limites de retenção de dados, criptografia e ambientes de execução isolados, mas os usuários precisam verificar a arquitetura técnica real e as condições contratuais.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#o-formato-mais-prov%C3%A1vel-%C3%A9-a-ia-h%C3%ADbrida\" class=\"anchor\" id=\"o-formato-mais-provável-é-a-ia-híbrida\"\u003e\u003c/a\u003eO formato mais provável é a IA híbrida\u003c/h2\u003e\n\u003cp\u003eÉ provável que a execução local e os data centers dividam funções, em vez de uma substituir completamente a outra.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eO dispositivo processa detecção de voz, remoção de dados pessoais, classificações curtas e geração simples.\u003c/li\u003e\n\u003cli\u003eUm roteador local avalia a complexidade e a sensibilidade da tarefa.\u003c/li\u003e\n\u003cli\u003eO modelo do data center é chamado apenas quando são necessários raciocínio complexo, contexto longo ou buscas em grande escala.\u003c/li\u003e\n\u003cli\u003eParte do resultado é verificada localmente ou combinada com os dados do usuário.\u003c/li\u003e\n\u003cli\u003eSe a conexão for interrompida, o sistema passa para um modelo local com funcionalidades limitadas.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eEssa arquitetura permite usar um modelo poderoso quando necessário, ao mesmo tempo que reduz o volume de chamadas à nuvem. Os fornecedores podem usar modelos pequenos para filtragem, roteamento e geração de rascunhos, destinando os modelos grandes apenas às solicitações difíceis. Os usuários também podem executar modelos públicos localmente e conectar um modelo separado em um data center como recurso auxiliar.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#primeiro-%C3%A9-preciso-definir-qual-m%C3%A9trica-representa-a-maior-parte-da-infer%C3%AAncia\" class=\"anchor\" id=\"primeiro-é-preciso-definir-qual-métrica-representa-a-maior-parte-da-inferência\"\u003e\u003c/a\u003ePrimeiro é preciso definir qual métrica representa “a maior parte da inferência”\u003c/h2\u003e\n\u003cp\u003eA participação da IA local e da IA em data centers pode parecer completamente diferente conforme a unidade de medição. Essa distinção é um elemento frequentemente ignorado em debates simplificados sobre participação de mercado.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eNúmero de solicitações:\u003c/strong\u003e se aumentarem as conclusões automáticas curtas ou classificações em smartphones, a participação local poderá ser alta.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eNúmero de tokens gerados:\u003c/strong\u003e se documentos longos e tarefas de agentes se concentrarem na nuvem, a participação dos data centers poderá ser alta.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eVolume de computação:\u003c/strong\u003e raciocínios difíceis, geração de vários candidatos e processamento multimodal podem elevar o volume total de computação dos data centers.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eValor dos gastos:\u003c/strong\u003e serviços empresariais e infraestrutura de alto preço podem elevar a participação dos data centers nos gastos.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eTempo percebido pelo usuário:\u003c/strong\u003e recursos auxiliares locais sempre ativos podem fazer com que o usuário sinta que utiliza a IA local com mais frequência.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePortanto, no futuro, é possível que o número de solicitações locais aumente, enquanto o volume total de computação de IA, as tarefas de alta complexidade e os gastos relacionados se concentrem nos data centers. Tanto a frase “toda IA vai se tornar local” quanto “a IA local não é importante” ignoram essa diferença.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#vari%C3%A1veis-que-podem-mudar-a-perspectiva\" class=\"anchor\" id=\"variáveis-que-podem-mudar-a-perspectiva\"\u003e\u003c/a\u003eVariáveis que podem mudar a perspectiva\u003c/h2\u003e\n\u003cp\u003eA perspectiva centrada em data centers não é uma lei estabelecida. As mudanças a seguir podem fazer com que a participação local cresça mais rapidamente do que o esperado.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eA capacidade dos modelos atingir uma saturação real em muitas atividades, reduzindo o valor de modelos mais poderosos\u003c/li\u003e\n\u003cli\u003eDispositivos de baixo consumo com alta capacidade e largura de banda de memória se popularizarem\u003c/li\u003e\n\u003cli\u003eA destilação e a quantização reduzirem significativamente os modelos sem quase nenhuma perda da capacidade de raciocínio complexo\u003c/li\u003e\n\u003cli\u003eRegulamentações de privacidade e segurança nacional restringirem fortemente o envio de dados a servidores externos\u003c/li\u003e\n\u003cli\u003eA expansão dos data centers desacelerar devido a restrições da rede elétrica, de água para refrigeração, do fornecimento de semicondutores ou de licenciamento\u003c/li\u003e\n\u003cli\u003eTecnologias e sistemas de remuneração capazes de agregar com segurança recursos distribuídos de dispositivos amadurecerem\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePor outro lado, se as tarefas de agentes se tornarem mais longas, a geração de vídeos e o processamento multimodal em tempo real se popularizarem, e a utilização dos aceleradores e a eficiência energética dos data centers continuarem melhorando, a vantagem da inferência centralizada poderá se fortalecer.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#conclus%C3%A3o\" class=\"anchor\" id=\"conclusão\"\u003e\u003c/a\u003eConclusão\u003c/h2\u003e\n\u003cp\u003eA IA local não é uma tecnologia periférica destinada a desaparecer. É provável que ela se torne uma camada essencial em recursos auxiliares de smartphones, no processamento de informações sensíveis, em trabalhos offline e em serviços nos quais a latência é importante. Os modelos de pesos abertos também ampliam as opções e a capacidade de hospedagem própria, contribuindo para reduzir a dependência de fornecedores.\u003c/p\u003e\n\u003cp\u003eNo entanto, é difícil considerar que apenas o aumento da eficiência dos modelos eliminará a necessidade dos data centers. O padrão de melhor desempenho e as exigências dos usuários aumentam em conjunto, enquanto os data centers possuem vantagens estruturais no processamento em lotes, na alta utilização dos aceleradores, na memória de alta largura de banda e grande capacidade e no compartilhamento de recursos.\u003c/p\u003e\n\u003cp\u003eA perspectiva de longo prazo mais convincente não é a vitória da execução local nem o monopólio da nuvem. É uma arquitetura em camadas, na qual tarefas curtas, sensíveis e imediatas são processadas no dispositivo, enquanto tarefas complexas, longas e de alto custo são enviadas aos data centers. Nesse ambiente, a principal vantagem competitiva deixa de ser o tamanho de um único modelo e passa a ser o roteamento das tarefas para o local de execução adequado, o controle de custos e a governança de dados.\u003c/p\u003e\n","tags":["Semicondutores","IA generativa","Data center de IA","Proteção de dados","Chips de IA","Estratégia tecnológica"],"faqs":[{"question":"Todos os modelos de pesos abertos podem ser executados em um PC pessoal?","answer":"Não. Pesos abertos significa que os pesos podem ser utilizados, não que sejam adequados para hardware pessoal. Isso depende do tamanho do modelo, da precisão, da capacidade de memória e das condições da licença, e modelos grandes de pesos abertos podem exigir várias GPUs de data center."},{"question":"Os smartphones do futuro poderão oferecer o melhor desempenho de IA atual?","answer":"Com os avanços em quantização, destilação e NPUs, é muito provável que parte das capacidades atuais de nível de servidor migre para os smartphones. No entanto, como os modelos de data center daquela época também evoluirão, isso não significa que os smartphones alcançarão os melhores modelos do futuro."},{"question":"Comprar uma GPU torna a IA local sempre mais barata do que uma API?","answer":"Nem sempre. É preciso calcular o custo de compra e o valor de revenda, além de eletricidade, refrigeração, manutenção e taxa real de utilização. Se o uso for baixo ou irregular, serviços com cobrança conforme o uso podem ser mais vantajosos; em trabalhos de grande volume que utilizam o equipamento continuamente, a execução local pode ser mais vantajosa."},{"question":"Por que o processamento em lotes reduz os custos na inferência de IA?","answer":"Processar várias solicitações em conjunto permite usar com mais eficiência a capacidade de processamento paralelo e a largura de banda da memória do acelerador. O processamento contínuo em lotes aumenta a taxa de utilização ao remover solicitações concluídas e adicionar novas, mas não é possível aumentar o lote indefinidamente devido ao cache KV e à latência."},{"question":"A IA local é sempre mais segura para a proteção de dados pessoais?","answer":"Ela é vantajosa por não enviar os dados a servidores externos, mas isso não a torna automaticamente segura. É necessário gerenciar a criptografia do dispositivo, a proteção contra malware, as permissões de acesso, os logs e os backups. Ao usar a nuvem, é preciso verificar a retenção de dados, se eles são usados para treinamento, e os métodos de criptografia e isolamento."},{"question":"É possível comparar o desempenho de IA de GPUs de consumo e GPUs de data center apenas pelos FLOPS?","answer":"Não. A precisão, a esparsidade, os limites de energia e as condições de medição podem ser diferentes. A inferência real de LLM também é fortemente influenciada pela capacidade e largura de banda da memória, pelo tamanho do lote, pelo comprimento do contexto, pelo cache KV, pelas interconexões entre aceleradores e pelo software de serviço."},{"question":"Para quais tarefas a IA local é mais adequada?","answer":"Ela é adequada para tarefas em que a latência e o controle dos dados são importantes, como preenchimento automático no teclado, resumos curtos e classificação, processamento de voz offline, pré-processamento de informações confidenciais e controle em campo. Data centers provavelmente são mais vantajosos para tarefas prolongadas de agentes, processamento multimodal em grande escala e inferências que exigem desempenho máximo."},{"question":"No longo prazo, qual vencerá: a IA local ou a IA na nuvem?","answer":"Em vez de uma substituir completamente a outra, uma arquitetura híbrida é a opção mais provável. O dispositivo processa tarefas simples e confidenciais e envia apenas as solicitações complexas ao data center. Mesmo que a IA local processe mais solicitações, o volume total de computação e as tarefas de alta complexidade podem se concentrar nos data centers."}],"sources":[{"url":"https://arxiv.org/abs/2309.06180","title":"Gerenciamento eficiente de memória para execução de grandes modelos de linguagem com PagedAttention","type":"source"},{"url":"https://arxiv.org/abs/2206.02658","title":"Orca: um sistema distribuído de execução para modelos generativos baseados em transformers","type":"source"},{"url":"https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/","title":"Arquitetura NVIDIA Blackwell","type":"data_point"},{"url":"https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/","title":"NVIDIA GeForce RTX 4090","type":"data_point"},{"url":"https://mlcommons.org/benchmarks/inference-datacenter/","title":"MLPerf Inference: data center","type":"source"},{"url":"https://security.apple.com/blog/private-cloud-compute/","title":"Private Cloud Compute: uma nova fronteira para a privacidade da IA na nuvem","type":"source"},{"url":"https://developer.android.com/ai/gemini-nano","title":"SDK do Google AI Edge com Gemini Nano","type":"source"}],"images":[{"id":932,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTAsInB1ciI6ImJsb2JfaWQifX0=--34abeef97dfe63b15e2b649c2c6ae8c564924b28/ai-0fdb0281.webp","is_representative":true,"generation_method":"ai_photo","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"서버 랙 앞에서 소형 장비에 케이블을 연결하는 데이터센터 기술자","caption":"기술자가 데이터센터 서버 옆에서 네트워크 장비와 모니터링 노트북을 점검하고 있다.","description":null},"en":{"alt":"Data center technician connecting a cable to a compact device beside server racks","caption":"A technician checks network hardware and a monitoring laptop beside data center servers.","description":null},"ja":{"alt":"サーバーラックの前で小型機器にケーブルを接続するデータセンター技術者","caption":"技術者がデータセンターのサーバー脇でネットワーク機器と監視用ノートPCを点検している。","description":null},"es":{"alt":"Técnico de centro de datos conectando un cable a un equipo compacto junto a servidores","caption":"Un técnico revisa el equipo de red y un portátil de monitoreo junto a los servidores.","description":null},"id":{"alt":"Teknisi pusat data menghubungkan kabel ke perangkat ringkas di depan rak server","caption":"Teknisi memeriksa perangkat jaringan dan laptop pemantau di samping server pusat data.","description":null},"pt":{"alt":"Técnico de data center conectando um cabo a um equipamento compacto junto aos servidores","caption":"Um técnico verifica o equipamento de rede e um notebook de monitoramento ao lado dos servidores.","description":null},"zh-hant":{"alt":"資料中心技術人員在伺服器機櫃前為小型設備連接纜線","caption":"技術人員在資料中心伺服器旁檢查網路設備與監控筆電。","description":null},"de":{"alt":"Rechenzentrumstechniker verbindet vor Serverracks ein Kabel mit einem kompakten Gerät","caption":"Ein Techniker prüft neben den Servern Netzwerkhardware und einen Monitoring-Laptop.","description":null}}},{"id":933,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTYsInB1ciI6ImJsb2JfaWQifX0=--4b642e72ce104856aa40ed5bc224e337cf7877c2/ai-70dfbb70.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"노트북과 스마트폰의 로컬 AI가 서버, GPU, 데이터센터와 연결된 구조를 비교한 도식","caption":"로컬 기기와 대규모 데이터센터 추론 인프라의 연결과 자원 차이를 보여준다.","description":null},"en":{"alt":"Diagram comparing local AI on a laptop and phone with servers, GPUs, and data center infrastructure","caption":"The graphic contrasts connected local devices with large-scale data center inference resources.","description":null},"ja":{"alt":"ノートPCとスマートフォンのローカルAIをサーバー、GPU、データセンターと比較した図","caption":"ローカル端末と大規模なデータセンター推論基盤の接続や資源の違いを示している。","description":null},"es":{"alt":"Diagrama que compara IA local en portátil y móvil con servidores, GPU e infraestructura de centro de datos","caption":"El gráfico contrasta los dispositivos locales conectados con los recursos de inferencia de un centro de datos.","description":null},"id":{"alt":"Diagram perbandingan AI lokal di laptop dan ponsel dengan server, GPU, dan infrastruktur pusat data","caption":"Grafik ini membandingkan perangkat lokal terhubung dengan sumber daya inferensi pusat data berskala besar.","description":null},"pt":{"alt":"Diagrama compara IA local em notebook e celular com servidores, GPUs e infraestrutura de data center","caption":"O gráfico contrasta dispositivos locais conectados com recursos de inferência de data center em grande escala.","description":null},"zh-hant":{"alt":"比較筆電與手機本地 AI 和伺服器、GPU及資料中心基礎設施的示意圖","caption":"圖中對比連網的本地裝置與大規模資料中心推論資源。","description":null},"de":{"alt":"Schaubild vergleicht lokale KI auf Laptop und Smartphone mit Servern, GPUs und Rechenzentrum","caption":"Die Grafik stellt vernetzte lokale Geräte den umfangreichen Inferenzressourcen eines Rechenzentrums gegenüber.","description":null}}}],"published_at":"2026-08-28T11:45:54+09:00","updated_at":"2026-08-28T11:45:54+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/why-most-ai-inference-will-remain-in-data-centers"}