A medida que los modelos de pesos abiertos y los modelos lingüísticos pequeños avanzan rápidamente, se repite la previsión de que toda la IA acabará ejecutándose en PC o smartphones. La ejecución local ofrece ventajas claras: reduce las tarifas de uso de API, evita enviar datos sensibles al exterior y funciona incluso sin internet.
Sin embargo, el crecimiento de la IA local y el declive de la IA en centros de datos no son la misma afirmación. Aunque en el futuro aumente considerablemente la IA ejecutada en dispositivos personales, si se consideran el volumen total de cómputo y las tareas de alta dificultad, es probable que los centros de datos sigan siendo el núcleo de la inferencia. Esto se debe no solo al tamaño de los modelos, sino también a la interacción entre la competencia por el rendimiento, la demanda de los usuarios, el procesamiento por lotes, la tasa de utilización del hardware y el coste total de propiedad.
Tres conceptos que primero deben distinguirse
En el debate sobre la IA local suelen mezclarse ejes distintos.
| Distinción | Significado | Concepto opuesto |
|---|---|---|
| Pesos abiertos | Modelo cuyos pesos entrenados pueden descargarse y utilizarse dentro de los límites de una licencia determinada | Modelo cuyos pesos no se han publicado |
| Inferencia local o en el dispositivo | Modalidad que se ejecuta directamente en un PC, smartphone, vehículo o equipo interno de una empresa | Modalidad que se ejecuta en un centro de datos externo |
| Alojamiento propio | Modalidad en la que el usuario opera el modelo en un servidor o centro de datos de su elección | Modalidad que utiliza la API del proveedor del modelo |
Los pesos abiertos no implican necesariamente una ejecución local. Una empresa puede ofrecer un modelo de pesos abiertos desde un clúster de GPU alquilado o desde su propio centro de datos. A la inversa, un fabricante de dispositivos también puede incorporar en un smartphone un modelo pequeño que no sea público.
Por tanto, la verdadera pregunta no es «si avanzan los modelos públicos», sino «en qué entorno de cómputo resulta más conveniente procesar cada tarea en términos de rendimiento, coste, protección de datos personales y operación».
Los pesos abiertos tampoco significan necesariamente que el modelo sea completamente de código abierto. Dado que las condiciones aplicables al uso, la redistribución y los modelos derivados varían según la licencia de cada modelo, antes de una implementación comercial debe revisarse por separado la licencia correspondiente.
Los modelos locales del futuro pueden alcanzar a los mejores modelos actuales
Los avances en cuantización, destilación de conocimiento, poda, optimización de motores de inferencia y NPU especializadas permiten realizar tareas del mismo nivel con menos memoria y energía. Resulta perfectamente razonable prever que algunas capacidades que ahora requieren servidores puedan trasladarse dentro de unos años a portátiles o smartphones.
Sin embargo, el criterio de comparación no permanece fijo. Mientras los modelos locales del futuro se aproximan a los mejores modelos actuales, los modelos de los centros de datos también pueden avanzar en las siguientes direcciones.
- Razonamiento y planificación más complejos
- Procesamiento de contextos más largos y resultados de búsqueda a gran escala
- Tareas multimodales que combinan imágenes, audio y vídeo
- Uso fiable de múltiples herramientas y sistemas externos
- Razonamiento mediante múltiples agentes o rutas candidatas
- Capacidad para detectar errores y recuperarse durante tareas prolongadas
Por ello, la afirmación «algún día será posible implementar localmente el máximo rendimiento actual» es distinta de «también será posible implementar localmente el máximo rendimiento de ese momento». Es muy probable que la primera se haga realidad gracias a la mejora de la eficiencia tecnológica, pero la segunda puede seguir siendo difícil mientras también continúen avanzando la energía, la memoria, las redes y la escala de aceleradores que ofrecen los centros de datos.
También aumenta el nivel de rendimiento que los usuarios consideran suficiente
Las tareas representativas de la primera IA generativa eran responder preguntas, resumir documentos breves, redactar borradores de correos electrónicos y generar código sencillo. Estas tareas pueden gestionarse de manera útil incluso con modelos locales pequeños.
En cambio, un agente de IA lee repositorios de código completos, modifica varios archivos, ejecuta pruebas y realiza repetidamente búsquedas y llamadas a herramientas externas. Un agente de investigación debe trabajar durante mucho tiempo, comparando distintas fuentes y conservando resultados intermedios. Un agente de automatización empresarial también debe gestionar permisos, bases de datos y sistemas internos.
En las tareas prolongadas, los errores de cada etapa se acumulan. Aunque la tasa de éxito de una etapa sea alta, si se realizan de forma consecutiva decenas de decisiones y llamadas a herramientas, la probabilidad de completar con éxito toda la tarea puede disminuir considerablemente. Por ello, los usuarios empiezan a evaluar las siguientes capacidades, más allá de la calidad de una sola respuesta.
- Si mantiene durante mucho tiempo los objetivos y las restricciones
- Si diagnostica y corrige las llamadas fallidas a herramientas
- Si evita presentar como hechos contenidos no verificados
- Si comprende de forma coherente el contexto amplio del código y los documentos
- Si reduce el número de veces que debe intervenir una persona
Si un modelo más potente reduce el trabajo repetido y el tiempo de supervisión, el coste total del trabajo puede ser menor aunque el precio por token sea más alto. Por el contrario, para tareas breves y repetitivas puede ser más razonable utilizar un modelo local económico. En definitiva, el criterio de elección no es solo el precio del modelo, sino el coste de cada tarea completada y el riesgo de fracaso.
La principal ventaja de los centros de datos es el procesamiento por lotes y el uso compartido de recursos
La generación de tokens en los grandes modelos lingüísticos depende en gran medida del proceso de leer repetidamente los pesos del modelo desde la memoria del acelerador. Cuando se procesa una sola solicitud, es posible que no se aproveche por completo una parte de los grandes dispositivos de cálculo paralelo y del ancho de banda de memoria.
Los sistemas de servicio agrupan en lotes las solicitudes de distintos usuarios para realizar operaciones matriciales. De este modo pueden procesar varias solicitudes de forma conjunta en una sola operación, aumentando la densidad de cálculo y el rendimiento. El procesamiento continuo por lotes, que retira las solicitudes que terminan antes e incorpora otras nuevas, es una tecnología clave para elevar la utilización en servicios reales donde las longitudes de entrada y salida son diferentes.
El procesamiento por lotes no elimina por completo los costes en proporción al número de solicitudes. Cada solicitud tiene tokens que deben calcularse y una caché KV, y cuando aumenta el tamaño del lote también crecen el uso de memoria y el tiempo de espera. Los operadores deben equilibrar los siguientes elementos.
- Número de tokens procesados por segundo
- Latencia hasta la aparición del primer token
- Latencia de los tokens de salida de cada solicitud
- Memoria ocupada por la caché KV
- Mezcla de solicitudes con contextos largos y cortos
- Objetivos de nivel de servicio y número máximo de solicitudes simultáneas
Aun así, como los grandes servicios reciben solicitudes de forma continua, les resulta más fácil reducir el tiempo de inactividad que a una GPU personal. También pueden compartir réplicas de modelos entre múltiples clientes, ajustar el número de servidores según el tráfico y trasladar determinadas tareas a aceleradores adecuados.
Las GPU personales suelen tener una tasa de utilización media baja
Los equipos personales pueden utilizarse inmediatamente cuando se necesitan, pero pueden pasar la mayor parte del día en espera. Incluso si se ejecutan varios agentes simultáneamente, resulta difícil mantener de forma continua solicitudes de distintas longitudes como hacen los grandes servicios.
La viabilidad económica del equipo local depende de su tasa de utilización real, no de su velocidad máxima de procesamiento. Aunque se posea una GPU costosa, si solo se utiliza unas horas por semana, aumenta el coste de capital por token útil. Por el contrario, si hay tareas continuas, como producción de vídeo, pruebas de software o procesamiento masivo de documentos, la utilización del equipo local puede elevarse y hacerlo competitivo en costes.
Si se abre un servidor local a varias personas, aumentan la tasa de utilización y las oportunidades de procesamiento por lotes. Sin embargo, en ese momento se vuelven necesarios la autenticación, el control de acceso, las colas de trabajo, la respuesta ante fallos, la refrigeración y la supervisión. Aunque la escala sea pequeña, surgen problemas similares a los de la operación de un centro de datos.
Los aceleradores para centros de datos tienen objetivos y configuraciones diferentes
Las GPU de consumo también son potentes para la IA generativa, pero se diseñan teniendo en cuenta simultáneamente los videojuegos, los gráficos y el cómputo de uso general. Los aceleradores para centros de datos se centran en grandes memorias de alto ancho de banda, conexiones entre aceleradores, escalabilidad a nivel de rack y operaciones de IA de baja precisión.
GeForce RTX 4090 es una GPU de consumo y NVIDIA B200 es un acelerador de IA para centros de datos. Según las estimaciones comparadas por el autor, NVIDIA B200 ofrece aproximadamente 3 veces más rendimiento de cálculo que RTX 4090 con un nivel de consumo energético similar, y su ancho de banda de memoria es casi 4 veces mayor. Esta diferencia favorece a los centros de datos cuando se cargan modelos grandes en memoria y se prestan servicios con un alto rendimiento.
No obstante, las cifras de rendimiento de ambos productos no deben compararse mediante una simple proporción. El volumen de operaciones de IA publicado puede variar según la precisión, la aplicación o no de dispersión, el límite de potencia y la configuración del sistema. El rendimiento real de inferencia debe evaluarse mediante pruebas comparativas que mantengan iguales la arquitectura del modelo, el método de cuantización, el tamaño del lote, la longitud del contexto y la pila de software.
Dividir un modelo grande entre varios aceleradores también genera costes de comunicación. Los centros de datos ofrecen interconexiones de alta velocidad y redes optimizadas, pero la inferencia distribuida no es gratuita. En el caso de un modelo pequeño, puede resultar más sencillo y eficiente ejecutarlo en una sola GPU de consumo.