---
title: "Por qué es probable que la inferencia en centros de datos siga predominando aunque avance la IA local"
locale: es
category: trends
category_name: "Tendencias"
translation_status: reviewed
license: cc_by
author: "Equipo editorial de Injoys"
source_url: https://injoys.com/es/articles/why-most-ai-inference-will-remain-in-data-centers
published_at: 2026-08-28T11:45:54+09:00
---

# Por qué es probable que la inferencia en centros de datos siga predominando aunque avance la IA local

> La IA local desempeñará un papel importante en la protección de la privacidad, el funcionamiento sin conexión y las respuestas inmediatas, pero es probable que el máximo rendimiento y el procesamiento a gran escala sigan concentrados en los centros de datos. Las causas principales son un listón de rendimiento en constante evolución, el procesamiento por lotes, la alta utilización de los aceleradores, el hardware para centros de datos y la creciente complejidad de las tareas de los agentes.

## Key Points

- El hecho de poder utilizar modelos de pesos abiertos y el de poder ejecutarlos eficientemente en dispositivos personales son cosas distintas.
- Aunque los portátiles del futuro puedan ejecutar los mejores modelos actuales, los modelos de los centros de datos de entonces podrían ofrecer un mayor rendimiento y la capacidad de realizar tareas más prolongadas.
- Los centros de datos pueden agrupar dinámicamente múltiples solicitudes y compartir aceleradores para lograr un mayor rendimiento y una mayor tasa de utilización que los equipos personales.
- El coste de la inferencia local debe calcularse teniendo en cuenta no solo la compra de GPU, sino también la depreciación, la electricidad, la refrigeración, el mantenimiento y la baja tasa de utilización.
- Es probable que el mercado real se acerque más a una estructura híbrida que conecte ambos entornos según la tarea que a un escenario en el que desaparezca la opción local o la nube.

A medida que los modelos de pesos abiertos y los modelos lingüísticos pequeños avanzan rápidamente, se repite la previsión de que toda la IA acabará ejecutándose en PC o smartphones. La ejecución local ofrece ventajas claras: reduce las tarifas de uso de API, evita enviar datos sensibles al exterior y funciona incluso sin internet.

Sin embargo, el crecimiento de la IA local y el declive de la IA en centros de datos no son la misma afirmación. Aunque en el futuro aumente considerablemente la IA ejecutada en dispositivos personales, si se consideran el volumen total de cómputo y las tareas de alta dificultad, es probable que los centros de datos sigan siendo el núcleo de la inferencia. Esto se debe no solo al tamaño de los modelos, sino también a la interacción entre la competencia por el rendimiento, la demanda de los usuarios, el procesamiento por lotes, la tasa de utilización del hardware y el coste total de propiedad.

## Tres conceptos que primero deben distinguirse

En el debate sobre la IA local suelen mezclarse ejes distintos.

| Distinción | Significado | Concepto opuesto |
|---|---|---|
| Pesos abiertos | Modelo cuyos pesos entrenados pueden descargarse y utilizarse dentro de los límites de una licencia determinada | Modelo cuyos pesos no se han publicado |
| Inferencia local o en el dispositivo | Modalidad que se ejecuta directamente en un PC, smartphone, vehículo o equipo interno de una empresa | Modalidad que se ejecuta en un centro de datos externo |
| Alojamiento propio | Modalidad en la que el usuario opera el modelo en un servidor o centro de datos de su elección | Modalidad que utiliza la API del proveedor del modelo |

Los pesos abiertos no implican necesariamente una ejecución local. Una empresa puede ofrecer un modelo de pesos abiertos desde un clúster de GPU alquilado o desde su propio centro de datos. A la inversa, un fabricante de dispositivos también puede incorporar en un smartphone un modelo pequeño que no sea público.

Por tanto, la verdadera pregunta no es «si avanzan los modelos públicos», sino «en qué entorno de cómputo resulta más conveniente procesar cada tarea en términos de rendimiento, coste, protección de datos personales y operación».

Los pesos abiertos tampoco significan necesariamente que el modelo sea completamente de código abierto. Dado que las condiciones aplicables al uso, la redistribución y los modelos derivados varían según la licencia de cada modelo, antes de una implementación comercial debe revisarse por separado la licencia correspondiente.

## Los modelos locales del futuro pueden alcanzar a los mejores modelos actuales

Los avances en cuantización, destilación de conocimiento, poda, optimización de motores de inferencia y NPU especializadas permiten realizar tareas del mismo nivel con menos memoria y energía. Resulta perfectamente razonable prever que algunas capacidades que ahora requieren servidores puedan trasladarse dentro de unos años a portátiles o smartphones.

Sin embargo, el criterio de comparación no permanece fijo. Mientras los modelos locales del futuro se aproximan a los mejores modelos actuales, los modelos de los centros de datos también pueden avanzar en las siguientes direcciones.

- Razonamiento y planificación más complejos
- Procesamiento de contextos más largos y resultados de búsqueda a gran escala
- Tareas multimodales que combinan imágenes, audio y vídeo
- Uso fiable de múltiples herramientas y sistemas externos
- Razonamiento mediante múltiples agentes o rutas candidatas
- Capacidad para detectar errores y recuperarse durante tareas prolongadas

Por ello, la afirmación «algún día será posible implementar localmente el máximo rendimiento actual» es distinta de «también será posible implementar localmente el máximo rendimiento de ese momento». Es muy probable que la primera se haga realidad gracias a la mejora de la eficiencia tecnológica, pero la segunda puede seguir siendo difícil mientras también continúen avanzando la energía, la memoria, las redes y la escala de aceleradores que ofrecen los centros de datos.

## También aumenta el nivel de rendimiento que los usuarios consideran suficiente

Las tareas representativas de la primera IA generativa eran responder preguntas, resumir documentos breves, redactar borradores de correos electrónicos y generar código sencillo. Estas tareas pueden gestionarse de manera útil incluso con modelos locales pequeños.

En cambio, un agente de IA lee repositorios de código completos, modifica varios archivos, ejecuta pruebas y realiza repetidamente búsquedas y llamadas a herramientas externas. Un agente de investigación debe trabajar durante mucho tiempo, comparando distintas fuentes y conservando resultados intermedios. Un agente de automatización empresarial también debe gestionar permisos, bases de datos y sistemas internos.

En las tareas prolongadas, los errores de cada etapa se acumulan. Aunque la tasa de éxito de una etapa sea alta, si se realizan de forma consecutiva decenas de decisiones y llamadas a herramientas, la probabilidad de completar con éxito toda la tarea puede disminuir considerablemente. Por ello, los usuarios empiezan a evaluar las siguientes capacidades, más allá de la calidad de una sola respuesta.

- Si mantiene durante mucho tiempo los objetivos y las restricciones
- Si diagnostica y corrige las llamadas fallidas a herramientas
- Si evita presentar como hechos contenidos no verificados
- Si comprende de forma coherente el contexto amplio del código y los documentos
- Si reduce el número de veces que debe intervenir una persona

Si un modelo más potente reduce el trabajo repetido y el tiempo de supervisión, el coste total del trabajo puede ser menor aunque el precio por token sea más alto. Por el contrario, para tareas breves y repetitivas puede ser más razonable utilizar un modelo local económico. En definitiva, el criterio de elección no es solo el precio del modelo, sino el coste de cada tarea completada y el riesgo de fracaso.

## La principal ventaja de los centros de datos es el procesamiento por lotes y el uso compartido de recursos

La generación de tokens en los grandes modelos lingüísticos depende en gran medida del proceso de leer repetidamente los pesos del modelo desde la memoria del acelerador. Cuando se procesa una sola solicitud, es posible que no se aproveche por completo una parte de los grandes dispositivos de cálculo paralelo y del ancho de banda de memoria.

Los sistemas de servicio agrupan en lotes las solicitudes de distintos usuarios para realizar operaciones matriciales. De este modo pueden procesar varias solicitudes de forma conjunta en una sola operación, aumentando la densidad de cálculo y el rendimiento. El procesamiento continuo por lotes, que retira las solicitudes que terminan antes e incorpora otras nuevas, es una tecnología clave para elevar la utilización en servicios reales donde las longitudes de entrada y salida son diferentes.

El procesamiento por lotes no elimina por completo los costes en proporción al número de solicitudes. Cada solicitud tiene tokens que deben calcularse y una caché KV, y cuando aumenta el tamaño del lote también crecen el uso de memoria y el tiempo de espera. Los operadores deben equilibrar los siguientes elementos.

- Número de tokens procesados por segundo
- Latencia hasta la aparición del primer token
- Latencia de los tokens de salida de cada solicitud
- Memoria ocupada por la caché KV
- Mezcla de solicitudes con contextos largos y cortos
- Objetivos de nivel de servicio y número máximo de solicitudes simultáneas

Aun así, como los grandes servicios reciben solicitudes de forma continua, les resulta más fácil reducir el tiempo de inactividad que a una GPU personal. También pueden compartir réplicas de modelos entre múltiples clientes, ajustar el número de servidores según el tráfico y trasladar determinadas tareas a aceleradores adecuados.

## Las GPU personales suelen tener una tasa de utilización media baja

Los equipos personales pueden utilizarse inmediatamente cuando se necesitan, pero pueden pasar la mayor parte del día en espera. Incluso si se ejecutan varios agentes simultáneamente, resulta difícil mantener de forma continua solicitudes de distintas longitudes como hacen los grandes servicios.

La viabilidad económica del equipo local depende de su tasa de utilización real, no de su velocidad máxima de procesamiento. Aunque se posea una GPU costosa, si solo se utiliza unas horas por semana, aumenta el coste de capital por token útil. Por el contrario, si hay tareas continuas, como producción de vídeo, pruebas de software o procesamiento masivo de documentos, la utilización del equipo local puede elevarse y hacerlo competitivo en costes.

Si se abre un servidor local a varias personas, aumentan la tasa de utilización y las oportunidades de procesamiento por lotes. Sin embargo, en ese momento se vuelven necesarios la autenticación, el control de acceso, las colas de trabajo, la respuesta ante fallos, la refrigeración y la supervisión. Aunque la escala sea pequeña, surgen problemas similares a los de la operación de un centro de datos.

## Los aceleradores para centros de datos tienen objetivos y configuraciones diferentes

Las GPU de consumo también son potentes para la IA generativa, pero se diseñan teniendo en cuenta simultáneamente los videojuegos, los gráficos y el cómputo de uso general. Los aceleradores para centros de datos se centran en grandes memorias de alto ancho de banda, conexiones entre aceleradores, escalabilidad a nivel de rack y operaciones de IA de baja precisión.

GeForce RTX 4090 es una GPU de consumo y NVIDIA B200 es un acelerador de IA para centros de datos. Según las estimaciones comparadas por el autor, NVIDIA B200 ofrece aproximadamente 3 veces más rendimiento de cálculo que RTX 4090 con un nivel de consumo energético similar, y su ancho de banda de memoria es casi 4 veces mayor. Esta diferencia favorece a los centros de datos cuando se cargan modelos grandes en memoria y se prestan servicios con un alto rendimiento.

No obstante, las cifras de rendimiento de ambos productos no deben compararse mediante una simple proporción. El volumen de operaciones de IA publicado puede variar según la precisión, la aplicación o no de dispersión, el límite de potencia y la configuración del sistema. El rendimiento real de inferencia debe evaluarse mediante pruebas comparativas que mantengan iguales la arquitectura del modelo, el método de cuantización, el tamaño del lote, la longitud del contexto y la pila de software.

Dividir un modelo grande entre varios aceleradores también genera costes de comunicación. Los centros de datos ofrecen interconexiones de alta velocidad y redes optimizadas, pero la inferencia distribuida no es gratuita. En el caso de un modelo pequeño, puede resultar más sencillo y eficiente ejecutarlo en una sola GPU de consumo.

## Cómo calcular el coste real de la inferencia local

El cálculo de que «como ya se compró la GPU, la inferencia posterior es gratuita» omite el coste de capital y los gastos operativos. Deben incluirse todos los conceptos siguientes.

**Coste total de propiedad local**

`Coste de compra - valor de reventa previsto + coste de electricidad + coste de refrigeración + coste de reparación y sustitución + valor del tiempo de operación`

Si se divide este importe por el número de tokens útiles generados realmente o por el número de tareas completadas, se obtiene un coste unitario comparable. Es más preciso calcularlo tomando como referencia los resultados utilizables tras la revisión, y no simplemente los tokens de salida.

El coste de electricidad puede estimarse de la siguiente manera.

`Consumo eléctrico medio (kW) × tiempo de ejecución (h) × tarifa eléctrica`

También deben incluirse las pérdidas de la fuente de alimentación y el consumo eléctrico de la CPU, la memoria, los dispositivos de almacenamiento y los equipos de refrigeración. Dado que la tarifa eléctrica y el tiempo de uso del equipo varían considerablemente según la región, no resulta apropiado proponer un coste eléctrico mensual fijo aplicable a todos los usuarios.

El **coste total de la nube** puede incluir, además de las tarifas de API o suscripción, la transferencia de datos, los tiempos de espera, el coste de cambiar de proveedor, los límites de uso y el coste de gestionar información sensible. Cuando el uso es reducido o irregular, los servicios de pago por uso suelen ser ventajosos; para grandes volúmenes de trabajo constantes y predecibles, pueden resultar más favorables los equipos propios o la infraestructura reservada.

## Ámbitos en los que la IA local tiene una ventaja clara

La viabilidad económica de los centros de datos no elimina la necesidad de la IA local. En las siguientes condiciones, el control de los datos, la disponibilidad o el tiempo de respuesta pueden ser más importantes que disponer del mejor modelo.

| Situación | Ventaja de la ejecución local | Restricciones que deben comprobarse |
|---|---|---|
| Entorno sin conexión | Funciona independientemente de fallos de internet o restricciones de comunicación | Rendimiento del dispositivo y consumo de batería |
| Tratamiento de información sensible | Permite no enviar los datos originales a servidores externos | Robo del dispositivo, malware y protección de registros locales |
| Asistencia de teclado y voz | Baja latencia y respuesta inmediata | Tamaño y precisión del modelo |
| Clasificación repetitiva a pequeña escala | Bajo coste marginal si el volumen de uso es suficiente | Costes iniciales de desarrollo y equipos |
| Control de vehículos, fábricas y entornos de campo | Decisiones rápidas sin recorridos de ida y vuelta por la red | Validación de seguridad y sistema de actualizaciones |
| Funciones de personalización | Uso del contexto del usuario dentro del dispositivo | Gestión de permisos y eliminación de datos |

La protección de datos personales tampoco puede evaluarse de forma binaria, como «local es seguro y la nube es peligrosa». Si el equipo local está infectado o el disco no está cifrado, los datos pueden quedar expuestos. Por otra parte, los servicios en la nube también pueden ofrecer limitaciones a la conservación de datos, cifrado y entornos de ejecución aislados, pero el usuario debe verificar la arquitectura técnica real y las condiciones contractuales.

## La forma más probable es una IA híbrida

Es probable que la IA local y los centros de datos se repartan las funciones, en lugar de que uno sustituya por completo al otro.

1. El dispositivo gestiona la detección de voz, la eliminación de datos personales, las clasificaciones breves y la generación sencilla.
2. Un enrutador local evalúa la dificultad y la sensibilidad de la tarea.
3. Solo se llama al modelo del centro de datos cuando se requieren razonamientos complejos, contextos largos o búsquedas a gran escala.
4. Parte del resultado se verifica localmente o se combina con los datos del usuario.
5. Si se pierde la conexión, se cambia a un modelo local con funciones limitadas.

Esta arquitectura permite utilizar un modelo potente cuando sea necesario y, al mismo tiempo, reducir el volumen de llamadas a la nube. Los proveedores pueden emplear modelos pequeños para filtrar, enrutar y generar borradores, y asignar los modelos grandes únicamente a las solicitudes difíciles. Los usuarios también pueden ejecutar modelos públicos localmente y conectar un modelo independiente del centro de datos como recurso auxiliar.

## Primero debe definirse qué indicador representa «la mayor parte de la inferencia»

La proporción de IA local y de IA en centros de datos puede parecer completamente diferente según la unidad de medida. Esta distinción suele omitirse en los debates simplistas sobre cuota de mercado.

- **Número de solicitudes:** si aumentan las funciones breves de autocompletado o clasificación en smartphones, la proporción local puede ser alta.
- **Número de tokens generados:** si los documentos largos y las tareas de agentes se concentran en la nube, puede aumentar la proporción de los centros de datos.
- **Volumen de cómputo:** el razonamiento difícil, la generación de múltiples candidatos y el procesamiento multimodal pueden elevar el volumen total de cómputo de los centros de datos.
- **Importe del gasto:** los costosos servicios empresariales y la infraestructura pueden aumentar la proporción del gasto correspondiente a los centros de datos.
- **Tiempo percibido por el usuario:** las funciones locales de asistencia siempre activas pueden hacer que el usuario sienta que utiliza la IA local con mayor frecuencia.

Por tanto, en el futuro podría aumentar el número de solicitudes locales mientras el volumen total de cómputo de IA, las tareas de alta dificultad y el gasto asociado se concentran en los centros de datos. Tanto «toda la IA se trasladará al entorno local» como «la IA local no es importante» son expresiones que ignoran esta diferencia.

## Variables que pueden cambiar las previsiones

La perspectiva centrada en los centros de datos no es una ley inmutable. Si se producen los siguientes cambios, la proporción local podría aumentar más rápido de lo previsto.

- Que las capacidades de los modelos se saturen realmente en muchas tareas y disminuya el valor de modelos más potentes
- Que se generalicen dispositivos de bajo consumo con gran capacidad y ancho de banda de memoria
- Que la destilación y la cuantización reduzcan considerablemente los modelos sin apenas perder capacidades de razonamiento complejo
- Que las normativas sobre datos personales y seguridad nacional restrinjan fuertemente la transmisión a servidores externos
- Que la expansión de los centros de datos se ralentice por restricciones de la red eléctrica, el agua de refrigeración, el suministro de semiconductores o los permisos
- Que maduren las tecnologías y los sistemas de compensación para agrupar de forma segura los recursos de dispositivos distribuidos

Por el contrario, si las tareas de los agentes se prolongan, se generalizan la generación de vídeo y el procesamiento multimodal en tiempo real, y continúan mejorando la tasa de utilización de los aceleradores y la eficiencia energética de los centros de datos, puede reforzarse la ventaja de la inferencia centralizada.

## Conclusión

La IA local no es una tecnología periférica destinada a desaparecer. Es muy probable que se convierta en una capa esencial para las funciones de asistencia de los smartphones, el tratamiento de información sensible, el trabajo sin conexión y los servicios en los que la latencia es importante. Los modelos de pesos abiertos también amplían las posibilidades de elección y las capacidades de alojamiento propio, y contribuyen a reducir la dependencia de los proveedores.

Sin embargo, resulta difícil considerar que la necesidad de centros de datos desaparecerá únicamente gracias a la mejora de la eficiencia de los modelos. Los estándares de máximo rendimiento y las exigencias de los usuarios aumentan simultáneamente, y los centros de datos poseen ventajas estructurales en el procesamiento por lotes, la alta utilización de aceleradores, la memoria de gran capacidad y alto ancho de banda, y el uso compartido de recursos.

La perspectiva a largo plazo más convincente no es el triunfo del entorno local ni el monopolio de la nube. Es una arquitectura por capas en la que las tareas breves, sensibles e inmediatas se procesan en el dispositivo, mientras que las tareas complejas, largas y costosas se envían a los centros de datos. En este entorno, la principal ventaja competitiva no será el tamaño de un único modelo, sino el enrutamiento que envíe cada tarea al lugar de ejecución adecuado, el control de costes y la gobernanza de datos.

## FAQ

### ¿Todos los modelos de pesos abiertos pueden ejecutarse en un PC personal?
No. Que un modelo sea de pesos abiertos significa que sus pesos están disponibles, no que sea adecuado para hardware de uso personal. Depende del tamaño del modelo, la precisión, la capacidad de memoria y las condiciones de la licencia, y los grandes modelos de pesos abiertos pueden requerir varias GPU de centros de datos.

### ¿Podrán los smartphones del futuro ofrecer el mejor rendimiento de IA actual?
Gracias a la cuantización, la destilación y los avances de las NPU, es muy probable que algunas de las capacidades actuales propias de servidores pasen a los smartphones. Sin embargo, como los modelos de los centros de datos también avanzarán para entonces, esto no significa que los smartphones vayan a alcanzar a los mejores modelos del futuro.

### Si compro una GPU, ¿la IA local siempre resulta más barata que una API?
No siempre. Hay que calcular el precio de compra y el valor de reventa, la electricidad, la refrigeración, el mantenimiento y el índice de utilización real. Si el uso es escaso o irregular, un servicio de pago por uso puede resultar más conveniente, mientras que la ejecución local puede ser más ventajosa para trabajos de gran volumen que utilicen los equipos de forma continua.

### ¿Por qué el procesamiento por lotes reduce los costes en la inferencia de IA?
Procesar varias solicitudes juntas permite utilizar de forma más eficiente la capacidad de cálculo paralelo y el ancho de banda de memoria del acelerador. El procesamiento continuo por lotes aumenta el índice de utilización al retirar las solicitudes completadas y añadir otras nuevas, pero no se puede ampliar el lote de forma ilimitada debido a la caché KV y la latencia.

### ¿La IA local siempre es más segura para proteger la información personal?
Es ventajosa porque no se envían los datos a servidores externos, pero esto no garantiza automáticamente la seguridad. Se necesita cifrado del dispositivo, protección contra software malicioso y gestión de permisos de acceso, registros y copias de seguridad. Al usar la nube, hay que comprobar la conservación de los datos, si se utilizan para entrenamiento y los métodos de cifrado y aislamiento.

### ¿Se puede comparar el rendimiento de IA de las GPU de consumo y las GPU de centros de datos basándose únicamente en los FLOPS?
No. La precisión, la dispersión, los límites de consumo y las condiciones de medición pueden diferir. La inferencia real de LLM también depende en gran medida de la capacidad y el ancho de banda de la memoria, el tamaño del lote, la longitud del contexto, la caché KV, la interconexión entre aceleradores y el software de servicio.

### ¿Para qué tareas es más adecuada la IA local?
Es adecuada para tareas en las que son importantes la latencia y el control de los datos, como el autocompletado del teclado, los resúmenes breves y la clasificación, el procesamiento de voz sin conexión, el preprocesamiento de información sensible y el control in situ. Es muy probable que los centros de datos sean más ventajosos para tareas de agentes de larga duración, el procesamiento multimodal a gran escala y la inferencia que requiere el máximo rendimiento.

### A largo plazo, ¿cuál ganará, la IA local o la IA en la nube?
En vez de que una sustituya por completo a la otra, lo más probable es una arquitectura híbrida. El dispositivo procesa las tareas sencillas y sensibles y envía al centro de datos únicamente las solicitudes complejas. Aunque la IA local gestione un mayor número de solicitudes, el volumen total de cálculo y las tareas de alta complejidad pueden concentrarse en los centros de datos.

## Sources

- [Gestión eficiente de la memoria para el servicio de grandes modelos de lenguaje con PagedAttention](https://arxiv.org/abs/2309.06180)
- [Orca: un sistema de servicio distribuido para modelos generativos basados en transformadores](https://arxiv.org/abs/2206.02658)
- [Arquitectura NVIDIA Blackwell](https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/)
- [NVIDIA GeForce RTX 4090](https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/)
- [Inferencia de MLPerf: centro de datos](https://mlcommons.org/benchmarks/inference-datacenter/)
- [Private Cloud Compute: una nueva frontera para la privacidad de la IA en la nube](https://security.apple.com/blog/private-cloud-compute/)
- [SDK de Google AI Edge con Gemini Nano](https://developer.android.com/ai/gemini-nano)

## Images

![Técnico de centro de datos conectando un cable a un equipo compacto junto a servidores](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTAsInB1ciI6ImJsb2JfaWQifX0=--34abeef97dfe63b15e2b649c2c6ae8c564924b28/ai-0fdb0281.webp)
![Diagrama que compara IA local en portátil y móvil con servidores, GPU e infraestructura de centro de datos](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTYsInB1ciI6ImJsb2JfaWQifX0=--4b642e72ce104856aa40ed5bc224e337cf7877c2/ai-70dfbb70.webp)