Por qué es probable que la inferencia en centros de datos siga predominando aunque avance la IA local

La IA local desempeñará un papel importante en la protección de la privacidad, el funcionamiento sin conexión y las respuestas inmediatas, pero es probable que el máximo rendimiento y el procesamiento a gran escala sigan concentrados en los centros de datos. Las causas principales son un listón de rendimiento en constante evolución, el procesamiento por lotes, la alta utilización de los aceleradores, el hardware para centros de datos y la creciente complejidad de las tareas de los agentes.

A medida que los modelos de pesos abiertos y los modelos lingüísticos pequeños avanzan rápidamente, se repite la previsión de que toda la IA acabará ejecutándose en PC o smartphones. La ejecución local ofrece ventajas claras: reduce las tarifas de uso de API, evita enviar datos sensibles al exterior y funciona incluso sin internet.

Sin embargo, el crecimiento de la IA local y el declive de la IA en centros de datos no son la misma afirmación. Aunque en el futuro aumente considerablemente la IA ejecutada en dispositivos personales, si se consideran el volumen total de cómputo y las tareas de alta dificultad, es probable que los centros de datos sigan siendo el núcleo de la inferencia. Esto se debe no solo al tamaño de los modelos, sino también a la interacción entre la competencia por el rendimiento, la demanda de los usuarios, el procesamiento por lotes, la tasa de utilización del hardware y el coste total de propiedad.

Tres conceptos que primero deben distinguirse

En el debate sobre la IA local suelen mezclarse ejes distintos.

Distinción Significado Concepto opuesto
Pesos abiertos Modelo cuyos pesos entrenados pueden descargarse y utilizarse dentro de los límites de una licencia determinada Modelo cuyos pesos no se han publicado
Inferencia local o en el dispositivo Modalidad que se ejecuta directamente en un PC, smartphone, vehículo o equipo interno de una empresa Modalidad que se ejecuta en un centro de datos externo
Alojamiento propio Modalidad en la que el usuario opera el modelo en un servidor o centro de datos de su elección Modalidad que utiliza la API del proveedor del modelo

Los pesos abiertos no implican necesariamente una ejecución local. Una empresa puede ofrecer un modelo de pesos abiertos desde un clúster de GPU alquilado o desde su propio centro de datos. A la inversa, un fabricante de dispositivos también puede incorporar en un smartphone un modelo pequeño que no sea público.

Por tanto, la verdadera pregunta no es «si avanzan los modelos públicos», sino «en qué entorno de cómputo resulta más conveniente procesar cada tarea en términos de rendimiento, coste, protección de datos personales y operación».

Los pesos abiertos tampoco significan necesariamente que el modelo sea completamente de código abierto. Dado que las condiciones aplicables al uso, la redistribución y los modelos derivados varían según la licencia de cada modelo, antes de una implementación comercial debe revisarse por separado la licencia correspondiente.

Los modelos locales del futuro pueden alcanzar a los mejores modelos actuales

Los avances en cuantización, destilación de conocimiento, poda, optimización de motores de inferencia y NPU especializadas permiten realizar tareas del mismo nivel con menos memoria y energía. Resulta perfectamente razonable prever que algunas capacidades que ahora requieren servidores puedan trasladarse dentro de unos años a portátiles o smartphones.

Sin embargo, el criterio de comparación no permanece fijo. Mientras los modelos locales del futuro se aproximan a los mejores modelos actuales, los modelos de los centros de datos también pueden avanzar en las siguientes direcciones.

Por ello, la afirmación «algún día será posible implementar localmente el máximo rendimiento actual» es distinta de «también será posible implementar localmente el máximo rendimiento de ese momento». Es muy probable que la primera se haga realidad gracias a la mejora de la eficiencia tecnológica, pero la segunda puede seguir siendo difícil mientras también continúen avanzando la energía, la memoria, las redes y la escala de aceleradores que ofrecen los centros de datos.

También aumenta el nivel de rendimiento que los usuarios consideran suficiente

Las tareas representativas de la primera IA generativa eran responder preguntas, resumir documentos breves, redactar borradores de correos electrónicos y generar código sencillo. Estas tareas pueden gestionarse de manera útil incluso con modelos locales pequeños.

En cambio, un agente de IA lee repositorios de código completos, modifica varios archivos, ejecuta pruebas y realiza repetidamente búsquedas y llamadas a herramientas externas. Un agente de investigación debe trabajar durante mucho tiempo, comparando distintas fuentes y conservando resultados intermedios. Un agente de automatización empresarial también debe gestionar permisos, bases de datos y sistemas internos.

En las tareas prolongadas, los errores de cada etapa se acumulan. Aunque la tasa de éxito de una etapa sea alta, si se realizan de forma consecutiva decenas de decisiones y llamadas a herramientas, la probabilidad de completar con éxito toda la tarea puede disminuir considerablemente. Por ello, los usuarios empiezan a evaluar las siguientes capacidades, más allá de la calidad de una sola respuesta.

Si un modelo más potente reduce el trabajo repetido y el tiempo de supervisión, el coste total del trabajo puede ser menor aunque el precio por token sea más alto. Por el contrario, para tareas breves y repetitivas puede ser más razonable utilizar un modelo local económico. En definitiva, el criterio de elección no es solo el precio del modelo, sino el coste de cada tarea completada y el riesgo de fracaso.

La principal ventaja de los centros de datos es el procesamiento por lotes y el uso compartido de recursos

La generación de tokens en los grandes modelos lingüísticos depende en gran medida del proceso de leer repetidamente los pesos del modelo desde la memoria del acelerador. Cuando se procesa una sola solicitud, es posible que no se aproveche por completo una parte de los grandes dispositivos de cálculo paralelo y del ancho de banda de memoria.

Los sistemas de servicio agrupan en lotes las solicitudes de distintos usuarios para realizar operaciones matriciales. De este modo pueden procesar varias solicitudes de forma conjunta en una sola operación, aumentando la densidad de cálculo y el rendimiento. El procesamiento continuo por lotes, que retira las solicitudes que terminan antes e incorpora otras nuevas, es una tecnología clave para elevar la utilización en servicios reales donde las longitudes de entrada y salida son diferentes.

El procesamiento por lotes no elimina por completo los costes en proporción al número de solicitudes. Cada solicitud tiene tokens que deben calcularse y una caché KV, y cuando aumenta el tamaño del lote también crecen el uso de memoria y el tiempo de espera. Los operadores deben equilibrar los siguientes elementos.

Aun así, como los grandes servicios reciben solicitudes de forma continua, les resulta más fácil reducir el tiempo de inactividad que a una GPU personal. También pueden compartir réplicas de modelos entre múltiples clientes, ajustar el número de servidores según el tráfico y trasladar determinadas tareas a aceleradores adecuados.

Las GPU personales suelen tener una tasa de utilización media baja

Los equipos personales pueden utilizarse inmediatamente cuando se necesitan, pero pueden pasar la mayor parte del día en espera. Incluso si se ejecutan varios agentes simultáneamente, resulta difícil mantener de forma continua solicitudes de distintas longitudes como hacen los grandes servicios.

La viabilidad económica del equipo local depende de su tasa de utilización real, no de su velocidad máxima de procesamiento. Aunque se posea una GPU costosa, si solo se utiliza unas horas por semana, aumenta el coste de capital por token útil. Por el contrario, si hay tareas continuas, como producción de vídeo, pruebas de software o procesamiento masivo de documentos, la utilización del equipo local puede elevarse y hacerlo competitivo en costes.

Si se abre un servidor local a varias personas, aumentan la tasa de utilización y las oportunidades de procesamiento por lotes. Sin embargo, en ese momento se vuelven necesarios la autenticación, el control de acceso, las colas de trabajo, la respuesta ante fallos, la refrigeración y la supervisión. Aunque la escala sea pequeña, surgen problemas similares a los de la operación de un centro de datos.

Los aceleradores para centros de datos tienen objetivos y configuraciones diferentes

Las GPU de consumo también son potentes para la IA generativa, pero se diseñan teniendo en cuenta simultáneamente los videojuegos, los gráficos y el cómputo de uso general. Los aceleradores para centros de datos se centran en grandes memorias de alto ancho de banda, conexiones entre aceleradores, escalabilidad a nivel de rack y operaciones de IA de baja precisión.

GeForce RTX 4090 es una GPU de consumo y NVIDIA B200 es un acelerador de IA para centros de datos. Según las estimaciones comparadas por el autor, NVIDIA B200 ofrece aproximadamente 3 veces más rendimiento de cálculo que RTX 4090 con un nivel de consumo energético similar, y su ancho de banda de memoria es casi 4 veces mayor. Esta diferencia favorece a los centros de datos cuando se cargan modelos grandes en memoria y se prestan servicios con un alto rendimiento.

No obstante, las cifras de rendimiento de ambos productos no deben compararse mediante una simple proporción. El volumen de operaciones de IA publicado puede variar según la precisión, la aplicación o no de dispersión, el límite de potencia y la configuración del sistema. El rendimiento real de inferencia debe evaluarse mediante pruebas comparativas que mantengan iguales la arquitectura del modelo, el método de cuantización, el tamaño del lote, la longitud del contexto y la pila de software.

Dividir un modelo grande entre varios aceleradores también genera costes de comunicación. Los centros de datos ofrecen interconexiones de alta velocidad y redes optimizadas, pero la inferencia distribuida no es gratuita. En el caso de un modelo pequeño, puede resultar más sencillo y eficiente ejecutarlo en una sola GPU de consumo.

Cómo calcular el coste real de la inferencia local

El cálculo de que «como ya se compró la GPU, la inferencia posterior es gratuita» omite el coste de capital y los gastos operativos. Deben incluirse todos los conceptos siguientes.

Coste total de propiedad local

Coste de compra - valor de reventa previsto + coste de electricidad + coste de refrigeración + coste de reparación y sustitución + valor del tiempo de operación

Si se divide este importe por el número de tokens útiles generados realmente o por el número de tareas completadas, se obtiene un coste unitario comparable. Es más preciso calcularlo tomando como referencia los resultados utilizables tras la revisión, y no simplemente los tokens de salida.

El coste de electricidad puede estimarse de la siguiente manera.

Consumo eléctrico medio (kW) × tiempo de ejecución (h) × tarifa eléctrica

También deben incluirse las pérdidas de la fuente de alimentación y el consumo eléctrico de la CPU, la memoria, los dispositivos de almacenamiento y los equipos de refrigeración. Dado que la tarifa eléctrica y el tiempo de uso del equipo varían considerablemente según la región, no resulta apropiado proponer un coste eléctrico mensual fijo aplicable a todos los usuarios.

El coste total de la nube puede incluir, además de las tarifas de API o suscripción, la transferencia de datos, los tiempos de espera, el coste de cambiar de proveedor, los límites de uso y el coste de gestionar información sensible. Cuando el uso es reducido o irregular, los servicios de pago por uso suelen ser ventajosos; para grandes volúmenes de trabajo constantes y predecibles, pueden resultar más favorables los equipos propios o la infraestructura reservada.

Ámbitos en los que la IA local tiene una ventaja clara

La viabilidad económica de los centros de datos no elimina la necesidad de la IA local. En las siguientes condiciones, el control de los datos, la disponibilidad o el tiempo de respuesta pueden ser más importantes que disponer del mejor modelo.

Situación Ventaja de la ejecución local Restricciones que deben comprobarse
Entorno sin conexión Funciona independientemente de fallos de internet o restricciones de comunicación Rendimiento del dispositivo y consumo de batería
Tratamiento de información sensible Permite no enviar los datos originales a servidores externos Robo del dispositivo, malware y protección de registros locales
Asistencia de teclado y voz Baja latencia y respuesta inmediata Tamaño y precisión del modelo
Clasificación repetitiva a pequeña escala Bajo coste marginal si el volumen de uso es suficiente Costes iniciales de desarrollo y equipos
Control de vehículos, fábricas y entornos de campo Decisiones rápidas sin recorridos de ida y vuelta por la red Validación de seguridad y sistema de actualizaciones
Funciones de personalización Uso del contexto del usuario dentro del dispositivo Gestión de permisos y eliminación de datos

La protección de datos personales tampoco puede evaluarse de forma binaria, como «local es seguro y la nube es peligrosa». Si el equipo local está infectado o el disco no está cifrado, los datos pueden quedar expuestos. Por otra parte, los servicios en la nube también pueden ofrecer limitaciones a la conservación de datos, cifrado y entornos de ejecución aislados, pero el usuario debe verificar la arquitectura técnica real y las condiciones contractuales.

La forma más probable es una IA híbrida

Es probable que la IA local y los centros de datos se repartan las funciones, en lugar de que uno sustituya por completo al otro.

  1. El dispositivo gestiona la detección de voz, la eliminación de datos personales, las clasificaciones breves y la generación sencilla.
  2. Un enrutador local evalúa la dificultad y la sensibilidad de la tarea.
  3. Solo se llama al modelo del centro de datos cuando se requieren razonamientos complejos, contextos largos o búsquedas a gran escala.
  4. Parte del resultado se verifica localmente o se combina con los datos del usuario.
  5. Si se pierde la conexión, se cambia a un modelo local con funciones limitadas.

Esta arquitectura permite utilizar un modelo potente cuando sea necesario y, al mismo tiempo, reducir el volumen de llamadas a la nube. Los proveedores pueden emplear modelos pequeños para filtrar, enrutar y generar borradores, y asignar los modelos grandes únicamente a las solicitudes difíciles. Los usuarios también pueden ejecutar modelos públicos localmente y conectar un modelo independiente del centro de datos como recurso auxiliar.

Primero debe definirse qué indicador representa «la mayor parte de la inferencia»

La proporción de IA local y de IA en centros de datos puede parecer completamente diferente según la unidad de medida. Esta distinción suele omitirse en los debates simplistas sobre cuota de mercado.

Por tanto, en el futuro podría aumentar el número de solicitudes locales mientras el volumen total de cómputo de IA, las tareas de alta dificultad y el gasto asociado se concentran en los centros de datos. Tanto «toda la IA se trasladará al entorno local» como «la IA local no es importante» son expresiones que ignoran esta diferencia.

Variables que pueden cambiar las previsiones

La perspectiva centrada en los centros de datos no es una ley inmutable. Si se producen los siguientes cambios, la proporción local podría aumentar más rápido de lo previsto.

Por el contrario, si las tareas de los agentes se prolongan, se generalizan la generación de vídeo y el procesamiento multimodal en tiempo real, y continúan mejorando la tasa de utilización de los aceleradores y la eficiencia energética de los centros de datos, puede reforzarse la ventaja de la inferencia centralizada.

Conclusión

La IA local no es una tecnología periférica destinada a desaparecer. Es muy probable que se convierta en una capa esencial para las funciones de asistencia de los smartphones, el tratamiento de información sensible, el trabajo sin conexión y los servicios en los que la latencia es importante. Los modelos de pesos abiertos también amplían las posibilidades de elección y las capacidades de alojamiento propio, y contribuyen a reducir la dependencia de los proveedores.

Sin embargo, resulta difícil considerar que la necesidad de centros de datos desaparecerá únicamente gracias a la mejora de la eficiencia de los modelos. Los estándares de máximo rendimiento y las exigencias de los usuarios aumentan simultáneamente, y los centros de datos poseen ventajas estructurales en el procesamiento por lotes, la alta utilización de aceleradores, la memoria de gran capacidad y alto ancho de banda, y el uso compartido de recursos.

La perspectiva a largo plazo más convincente no es el triunfo del entorno local ni el monopolio de la nube. Es una arquitectura por capas en la que las tareas breves, sensibles e inmediatas se procesan en el dispositivo, mientras que las tareas complejas, largas y costosas se envían a los centros de datos. En este entorno, la principal ventaja competitiva no será el tamaño de un único modelo, sino el enrutamiento que envíe cada tarea al lugar de ejecución adecuado, el control de costes y la gobernanza de datos.

FAQ

¿Todos los modelos de pesos abiertos pueden ejecutarse en un PC personal?

No. Que un modelo sea de pesos abiertos significa que sus pesos están disponibles, no que sea adecuado para hardware de uso personal. Depende del tamaño del modelo, la precisión, la capacidad de memoria y las condiciones de la licencia, y los grandes modelos de pesos abiertos pueden requerir varias GPU de centros de datos.

¿Podrán los smartphones del futuro ofrecer el mejor rendimiento de IA actual?

Gracias a la cuantización, la destilación y los avances de las NPU, es muy probable que algunas de las capacidades actuales propias de servidores pasen a los smartphones. Sin embargo, como los modelos de los centros de datos también avanzarán para entonces, esto no significa que los smartphones vayan a alcanzar a los mejores modelos del futuro.

Si compro una GPU, ¿la IA local siempre resulta más barata que una API?

No siempre. Hay que calcular el precio de compra y el valor de reventa, la electricidad, la refrigeración, el mantenimiento y el índice de utilización real. Si el uso es escaso o irregular, un servicio de pago por uso puede resultar más conveniente, mientras que la ejecución local puede ser más ventajosa para trabajos de gran volumen que utilicen los equipos de forma continua.

¿Por qué el procesamiento por lotes reduce los costes en la inferencia de IA?

Procesar varias solicitudes juntas permite utilizar de forma más eficiente la capacidad de cálculo paralelo y el ancho de banda de memoria del acelerador. El procesamiento continuo por lotes aumenta el índice de utilización al retirar las solicitudes completadas y añadir otras nuevas, pero no se puede ampliar el lote de forma ilimitada debido a la caché KV y la latencia.

¿La IA local siempre es más segura para proteger la información personal?

Es ventajosa porque no se envían los datos a servidores externos, pero esto no garantiza automáticamente la seguridad. Se necesita cifrado del dispositivo, protección contra software malicioso y gestión de permisos de acceso, registros y copias de seguridad. Al usar la nube, hay que comprobar la conservación de los datos, si se utilizan para entrenamiento y los métodos de cifrado y aislamiento.

¿Se puede comparar el rendimiento de IA de las GPU de consumo y las GPU de centros de datos basándose únicamente en los FLOPS?

No. La precisión, la dispersión, los límites de consumo y las condiciones de medición pueden diferir. La inferencia real de LLM también depende en gran medida de la capacidad y el ancho de banda de la memoria, el tamaño del lote, la longitud del contexto, la caché KV, la interconexión entre aceleradores y el software de servicio.

¿Para qué tareas es más adecuada la IA local?

Es adecuada para tareas en las que son importantes la latencia y el control de los datos, como el autocompletado del teclado, los resúmenes breves y la clasificación, el procesamiento de voz sin conexión, el preprocesamiento de información sensible y el control in situ. Es muy probable que los centros de datos sean más ventajosos para tareas de agentes de larga duración, el procesamiento multimodal a gran escala y la inferencia que requiere el máximo rendimiento.

A largo plazo, ¿cuál ganará, la IA local o la IA en la nube?

En vez de que una sustituya por completo a la otra, lo más probable es una arquitectura híbrida. El dispositivo procesa las tareas sencillas y sensibles y envía al centro de datos únicamente las solicitudes complejas. Aunque la IA local gestione un mayor número de solicitudes, el volumen total de cálculo y las tareas de alta complejidad pueden concentrarse en los centros de datos.

Sources

Images

Técnico de centro de datos conectando un cable a un equipo compacto junto a servidores
Técnico de centro de datos conectando un cable a un equipo compacto junto a servidores
Diagrama que compara IA local en portátil y móvil con servidores, GPU e infraestructura de centro de datos
Diagrama que compara IA local en portátil y móvil con servidores, GPU e infraestructura de centro de datos