{"content_id":"flazlbamrl","slug":"why-most-ai-inference-will-remain-in-data-centers","locale":"es","schema_type":"TechArticle","category":"trends","category_name":"Tendencias","title":"Por qué es probable que la inferencia en centros de datos siga predominando aunque avance la IA local","summary":"La IA local desempeñará un papel importante en la protección de la privacidad, el funcionamiento sin conexión y las respuestas inmediatas, pero es probable que el máximo rendimiento y el procesamiento a gran escala sigan concentrados en los centros de datos. Las causas principales son un listón de rendimiento en constante evolución, el procesamiento por lotes, la alta utilización de los aceleradores, el hardware para centros de datos y la creciente complejidad de las tareas de los agentes.","sponsorship_disclosure":null,"affiliate_disclosure":null,"commerce_disclosure":null,"author":{"name":"Equipo editorial de Injoys","url":"https://injoys.com/ko/about"},"key_points":["El hecho de poder utilizar modelos de pesos abiertos y el de poder ejecutarlos eficientemente en dispositivos personales son cosas distintas.","Aunque los portátiles del futuro puedan ejecutar los mejores modelos actuales, los modelos de los centros de datos de entonces podrían ofrecer un mayor rendimiento y la capacidad de realizar tareas más prolongadas.","Los centros de datos pueden agrupar dinámicamente múltiples solicitudes y compartir aceleradores para lograr un mayor rendimiento y una mayor tasa de utilización que los equipos personales.","El coste de la inferencia local debe calcularse teniendo en cuenta no solo la compra de GPU, sino también la depreciación, la electricidad, la refrigeración, el mantenimiento y la baja tasa de utilización.","Es probable que el mercado real se acerque más a una estructura híbrida que conecte ambos entornos según la tarea que a un escenario en el que desaparezca la opción local o la nube."],"content_markdown":"A medida que los modelos de pesos abiertos y los modelos lingüísticos pequeños avanzan rápidamente, se repite la previsión de que toda la IA acabará ejecutándose en PC o smartphones. La ejecución local ofrece ventajas claras: reduce las tarifas de uso de API, evita enviar datos sensibles al exterior y funciona incluso sin internet.\n\nSin embargo, el crecimiento de la IA local y el declive de la IA en centros de datos no son la misma afirmación. Aunque en el futuro aumente considerablemente la IA ejecutada en dispositivos personales, si se consideran el volumen total de cómputo y las tareas de alta dificultad, es probable que los centros de datos sigan siendo el núcleo de la inferencia. Esto se debe no solo al tamaño de los modelos, sino también a la interacción entre la competencia por el rendimiento, la demanda de los usuarios, el procesamiento por lotes, la tasa de utilización del hardware y el coste total de propiedad.\n\n## Tres conceptos que primero deben distinguirse\n\nEn el debate sobre la IA local suelen mezclarse ejes distintos.\n\n| Distinción | Significado | Concepto opuesto |\n|---|---|---|\n| Pesos abiertos | Modelo cuyos pesos entrenados pueden descargarse y utilizarse dentro de los límites de una licencia determinada | Modelo cuyos pesos no se han publicado |\n| Inferencia local o en el dispositivo | Modalidad que se ejecuta directamente en un PC, smartphone, vehículo o equipo interno de una empresa | Modalidad que se ejecuta en un centro de datos externo |\n| Alojamiento propio | Modalidad en la que el usuario opera el modelo en un servidor o centro de datos de su elección | Modalidad que utiliza la API del proveedor del modelo |\n\nLos pesos abiertos no implican necesariamente una ejecución local. Una empresa puede ofrecer un modelo de pesos abiertos desde un clúster de GPU alquilado o desde su propio centro de datos. A la inversa, un fabricante de dispositivos también puede incorporar en un smartphone un modelo pequeño que no sea público.\n\nPor tanto, la verdadera pregunta no es «si avanzan los modelos públicos», sino «en qué entorno de cómputo resulta más conveniente procesar cada tarea en términos de rendimiento, coste, protección de datos personales y operación».\n\nLos pesos abiertos tampoco significan necesariamente que el modelo sea completamente de código abierto. Dado que las condiciones aplicables al uso, la redistribución y los modelos derivados varían según la licencia de cada modelo, antes de una implementación comercial debe revisarse por separado la licencia correspondiente.\n\n## Los modelos locales del futuro pueden alcanzar a los mejores modelos actuales\n\nLos avances en cuantización, destilación de conocimiento, poda, optimización de motores de inferencia y NPU especializadas permiten realizar tareas del mismo nivel con menos memoria y energía. Resulta perfectamente razonable prever que algunas capacidades que ahora requieren servidores puedan trasladarse dentro de unos años a portátiles o smartphones.\n\nSin embargo, el criterio de comparación no permanece fijo. Mientras los modelos locales del futuro se aproximan a los mejores modelos actuales, los modelos de los centros de datos también pueden avanzar en las siguientes direcciones.\n\n- Razonamiento y planificación más complejos\n- Procesamiento de contextos más largos y resultados de búsqueda a gran escala\n- Tareas multimodales que combinan imágenes, audio y vídeo\n- Uso fiable de múltiples herramientas y sistemas externos\n- Razonamiento mediante múltiples agentes o rutas candidatas\n- Capacidad para detectar errores y recuperarse durante tareas prolongadas\n\nPor ello, la afirmación «algún día será posible implementar localmente el máximo rendimiento actual» es distinta de «también será posible implementar localmente el máximo rendimiento de ese momento». Es muy probable que la primera se haga realidad gracias a la mejora de la eficiencia tecnológica, pero la segunda puede seguir siendo difícil mientras también continúen avanzando la energía, la memoria, las redes y la escala de aceleradores que ofrecen los centros de datos.\n\n## También aumenta el nivel de rendimiento que los usuarios consideran suficiente\n\nLas tareas representativas de la primera IA generativa eran responder preguntas, resumir documentos breves, redactar borradores de correos electrónicos y generar código sencillo. Estas tareas pueden gestionarse de manera útil incluso con modelos locales pequeños.\n\nEn cambio, un agente de IA lee repositorios de código completos, modifica varios archivos, ejecuta pruebas y realiza repetidamente búsquedas y llamadas a herramientas externas. Un agente de investigación debe trabajar durante mucho tiempo, comparando distintas fuentes y conservando resultados intermedios. Un agente de automatización empresarial también debe gestionar permisos, bases de datos y sistemas internos.\n\nEn las tareas prolongadas, los errores de cada etapa se acumulan. Aunque la tasa de éxito de una etapa sea alta, si se realizan de forma consecutiva decenas de decisiones y llamadas a herramientas, la probabilidad de completar con éxito toda la tarea puede disminuir considerablemente. Por ello, los usuarios empiezan a evaluar las siguientes capacidades, más allá de la calidad de una sola respuesta.\n\n- Si mantiene durante mucho tiempo los objetivos y las restricciones\n- Si diagnostica y corrige las llamadas fallidas a herramientas\n- Si evita presentar como hechos contenidos no verificados\n- Si comprende de forma coherente el contexto amplio del código y los documentos\n- Si reduce el número de veces que debe intervenir una persona\n\nSi un modelo más potente reduce el trabajo repetido y el tiempo de supervisión, el coste total del trabajo puede ser menor aunque el precio por token sea más alto. Por el contrario, para tareas breves y repetitivas puede ser más razonable utilizar un modelo local económico. En definitiva, el criterio de elección no es solo el precio del modelo, sino el coste de cada tarea completada y el riesgo de fracaso.\n\n## La principal ventaja de los centros de datos es el procesamiento por lotes y el uso compartido de recursos\n\nLa generación de tokens en los grandes modelos lingüísticos depende en gran medida del proceso de leer repetidamente los pesos del modelo desde la memoria del acelerador. Cuando se procesa una sola solicitud, es posible que no se aproveche por completo una parte de los grandes dispositivos de cálculo paralelo y del ancho de banda de memoria.\n\nLos sistemas de servicio agrupan en lotes las solicitudes de distintos usuarios para realizar operaciones matriciales. De este modo pueden procesar varias solicitudes de forma conjunta en una sola operación, aumentando la densidad de cálculo y el rendimiento. El procesamiento continuo por lotes, que retira las solicitudes que terminan antes e incorpora otras nuevas, es una tecnología clave para elevar la utilización en servicios reales donde las longitudes de entrada y salida son diferentes.\n\nEl procesamiento por lotes no elimina por completo los costes en proporción al número de solicitudes. Cada solicitud tiene tokens que deben calcularse y una caché KV, y cuando aumenta el tamaño del lote también crecen el uso de memoria y el tiempo de espera. Los operadores deben equilibrar los siguientes elementos.\n\n- Número de tokens procesados por segundo\n- Latencia hasta la aparición del primer token\n- Latencia de los tokens de salida de cada solicitud\n- Memoria ocupada por la caché KV\n- Mezcla de solicitudes con contextos largos y cortos\n- Objetivos de nivel de servicio y número máximo de solicitudes simultáneas\n\nAun así, como los grandes servicios reciben solicitudes de forma continua, les resulta más fácil reducir el tiempo de inactividad que a una GPU personal. También pueden compartir réplicas de modelos entre múltiples clientes, ajustar el número de servidores según el tráfico y trasladar determinadas tareas a aceleradores adecuados.\n\n## Las GPU personales suelen tener una tasa de utilización media baja\n\nLos equipos personales pueden utilizarse inmediatamente cuando se necesitan, pero pueden pasar la mayor parte del día en espera. Incluso si se ejecutan varios agentes simultáneamente, resulta difícil mantener de forma continua solicitudes de distintas longitudes como hacen los grandes servicios.\n\nLa viabilidad económica del equipo local depende de su tasa de utilización real, no de su velocidad máxima de procesamiento. Aunque se posea una GPU costosa, si solo se utiliza unas horas por semana, aumenta el coste de capital por token útil. Por el contrario, si hay tareas continuas, como producción de vídeo, pruebas de software o procesamiento masivo de documentos, la utilización del equipo local puede elevarse y hacerlo competitivo en costes.\n\nSi se abre un servidor local a varias personas, aumentan la tasa de utilización y las oportunidades de procesamiento por lotes. Sin embargo, en ese momento se vuelven necesarios la autenticación, el control de acceso, las colas de trabajo, la respuesta ante fallos, la refrigeración y la supervisión. Aunque la escala sea pequeña, surgen problemas similares a los de la operación de un centro de datos.\n\n## Los aceleradores para centros de datos tienen objetivos y configuraciones diferentes\n\nLas GPU de consumo también son potentes para la IA generativa, pero se diseñan teniendo en cuenta simultáneamente los videojuegos, los gráficos y el cómputo de uso general. Los aceleradores para centros de datos se centran en grandes memorias de alto ancho de banda, conexiones entre aceleradores, escalabilidad a nivel de rack y operaciones de IA de baja precisión.\n\nGeForce RTX 4090 es una GPU de consumo y NVIDIA B200 es un acelerador de IA para centros de datos. Según las estimaciones comparadas por el autor, NVIDIA B200 ofrece aproximadamente 3 veces más rendimiento de cálculo que RTX 4090 con un nivel de consumo energético similar, y su ancho de banda de memoria es casi 4 veces mayor. Esta diferencia favorece a los centros de datos cuando se cargan modelos grandes en memoria y se prestan servicios con un alto rendimiento.\n\nNo obstante, las cifras de rendimiento de ambos productos no deben compararse mediante una simple proporción. El volumen de operaciones de IA publicado puede variar según la precisión, la aplicación o no de dispersión, el límite de potencia y la configuración del sistema. El rendimiento real de inferencia debe evaluarse mediante pruebas comparativas que mantengan iguales la arquitectura del modelo, el método de cuantización, el tamaño del lote, la longitud del contexto y la pila de software.\n\nDividir un modelo grande entre varios aceleradores también genera costes de comunicación. Los centros de datos ofrecen interconexiones de alta velocidad y redes optimizadas, pero la inferencia distribuida no es gratuita. En el caso de un modelo pequeño, puede resultar más sencillo y eficiente ejecutarlo en una sola GPU de consumo.\n\n## Cómo calcular el coste real de la inferencia local\n\nEl cálculo de que «como ya se compró la GPU, la inferencia posterior es gratuita» omite el coste de capital y los gastos operativos. Deben incluirse todos los conceptos siguientes.\n\n**Coste total de propiedad local**\n\n`Coste de compra - valor de reventa previsto + coste de electricidad + coste de refrigeración + coste de reparación y sustitución + valor del tiempo de operación`\n\nSi se divide este importe por el número de tokens útiles generados realmente o por el número de tareas completadas, se obtiene un coste unitario comparable. Es más preciso calcularlo tomando como referencia los resultados utilizables tras la revisión, y no simplemente los tokens de salida.\n\nEl coste de electricidad puede estimarse de la siguiente manera.\n\n`Consumo eléctrico medio (kW) × tiempo de ejecución (h) × tarifa eléctrica`\n\nTambién deben incluirse las pérdidas de la fuente de alimentación y el consumo eléctrico de la CPU, la memoria, los dispositivos de almacenamiento y los equipos de refrigeración. Dado que la tarifa eléctrica y el tiempo de uso del equipo varían considerablemente según la región, no resulta apropiado proponer un coste eléctrico mensual fijo aplicable a todos los usuarios.\n\nEl **coste total de la nube** puede incluir, además de las tarifas de API o suscripción, la transferencia de datos, los tiempos de espera, el coste de cambiar de proveedor, los límites de uso y el coste de gestionar información sensible. Cuando el uso es reducido o irregular, los servicios de pago por uso suelen ser ventajosos; para grandes volúmenes de trabajo constantes y predecibles, pueden resultar más favorables los equipos propios o la infraestructura reservada.\n\n## Ámbitos en los que la IA local tiene una ventaja clara\n\nLa viabilidad económica de los centros de datos no elimina la necesidad de la IA local. En las siguientes condiciones, el control de los datos, la disponibilidad o el tiempo de respuesta pueden ser más importantes que disponer del mejor modelo.\n\n| Situación | Ventaja de la ejecución local | Restricciones que deben comprobarse |\n|---|---|---|\n| Entorno sin conexión | Funciona independientemente de fallos de internet o restricciones de comunicación | Rendimiento del dispositivo y consumo de batería |\n| Tratamiento de información sensible | Permite no enviar los datos originales a servidores externos | Robo del dispositivo, malware y protección de registros locales |\n| Asistencia de teclado y voz | Baja latencia y respuesta inmediata | Tamaño y precisión del modelo |\n| Clasificación repetitiva a pequeña escala | Bajo coste marginal si el volumen de uso es suficiente | Costes iniciales de desarrollo y equipos |\n| Control de vehículos, fábricas y entornos de campo | Decisiones rápidas sin recorridos de ida y vuelta por la red | Validación de seguridad y sistema de actualizaciones |\n| Funciones de personalización | Uso del contexto del usuario dentro del dispositivo | Gestión de permisos y eliminación de datos |\n\nLa protección de datos personales tampoco puede evaluarse de forma binaria, como «local es seguro y la nube es peligrosa». Si el equipo local está infectado o el disco no está cifrado, los datos pueden quedar expuestos. Por otra parte, los servicios en la nube también pueden ofrecer limitaciones a la conservación de datos, cifrado y entornos de ejecución aislados, pero el usuario debe verificar la arquitectura técnica real y las condiciones contractuales.\n\n## La forma más probable es una IA híbrida\n\nEs probable que la IA local y los centros de datos se repartan las funciones, en lugar de que uno sustituya por completo al otro.\n\n1. El dispositivo gestiona la detección de voz, la eliminación de datos personales, las clasificaciones breves y la generación sencilla.\n2. Un enrutador local evalúa la dificultad y la sensibilidad de la tarea.\n3. Solo se llama al modelo del centro de datos cuando se requieren razonamientos complejos, contextos largos o búsquedas a gran escala.\n4. Parte del resultado se verifica localmente o se combina con los datos del usuario.\n5. Si se pierde la conexión, se cambia a un modelo local con funciones limitadas.\n\nEsta arquitectura permite utilizar un modelo potente cuando sea necesario y, al mismo tiempo, reducir el volumen de llamadas a la nube. Los proveedores pueden emplear modelos pequeños para filtrar, enrutar y generar borradores, y asignar los modelos grandes únicamente a las solicitudes difíciles. Los usuarios también pueden ejecutar modelos públicos localmente y conectar un modelo independiente del centro de datos como recurso auxiliar.\n\n## Primero debe definirse qué indicador representa «la mayor parte de la inferencia»\n\nLa proporción de IA local y de IA en centros de datos puede parecer completamente diferente según la unidad de medida. Esta distinción suele omitirse en los debates simplistas sobre cuota de mercado.\n\n- **Número de solicitudes:** si aumentan las funciones breves de autocompletado o clasificación en smartphones, la proporción local puede ser alta.\n- **Número de tokens generados:** si los documentos largos y las tareas de agentes se concentran en la nube, puede aumentar la proporción de los centros de datos.\n- **Volumen de cómputo:** el razonamiento difícil, la generación de múltiples candidatos y el procesamiento multimodal pueden elevar el volumen total de cómputo de los centros de datos.\n- **Importe del gasto:** los costosos servicios empresariales y la infraestructura pueden aumentar la proporción del gasto correspondiente a los centros de datos.\n- **Tiempo percibido por el usuario:** las funciones locales de asistencia siempre activas pueden hacer que el usuario sienta que utiliza la IA local con mayor frecuencia.\n\nPor tanto, en el futuro podría aumentar el número de solicitudes locales mientras el volumen total de cómputo de IA, las tareas de alta dificultad y el gasto asociado se concentran en los centros de datos. Tanto «toda la IA se trasladará al entorno local» como «la IA local no es importante» son expresiones que ignoran esta diferencia.\n\n## Variables que pueden cambiar las previsiones\n\nLa perspectiva centrada en los centros de datos no es una ley inmutable. Si se producen los siguientes cambios, la proporción local podría aumentar más rápido de lo previsto.\n\n- Que las capacidades de los modelos se saturen realmente en muchas tareas y disminuya el valor de modelos más potentes\n- Que se generalicen dispositivos de bajo consumo con gran capacidad y ancho de banda de memoria\n- Que la destilación y la cuantización reduzcan considerablemente los modelos sin apenas perder capacidades de razonamiento complejo\n- Que las normativas sobre datos personales y seguridad nacional restrinjan fuertemente la transmisión a servidores externos\n- Que la expansión de los centros de datos se ralentice por restricciones de la red eléctrica, el agua de refrigeración, el suministro de semiconductores o los permisos\n- Que maduren las tecnologías y los sistemas de compensación para agrupar de forma segura los recursos de dispositivos distribuidos\n\nPor el contrario, si las tareas de los agentes se prolongan, se generalizan la generación de vídeo y el procesamiento multimodal en tiempo real, y continúan mejorando la tasa de utilización de los aceleradores y la eficiencia energética de los centros de datos, puede reforzarse la ventaja de la inferencia centralizada.\n\n## Conclusión\n\nLa IA local no es una tecnología periférica destinada a desaparecer. Es muy probable que se convierta en una capa esencial para las funciones de asistencia de los smartphones, el tratamiento de información sensible, el trabajo sin conexión y los servicios en los que la latencia es importante. Los modelos de pesos abiertos también amplían las posibilidades de elección y las capacidades de alojamiento propio, y contribuyen a reducir la dependencia de los proveedores.\n\nSin embargo, resulta difícil considerar que la necesidad de centros de datos desaparecerá únicamente gracias a la mejora de la eficiencia de los modelos. Los estándares de máximo rendimiento y las exigencias de los usuarios aumentan simultáneamente, y los centros de datos poseen ventajas estructurales en el procesamiento por lotes, la alta utilización de aceleradores, la memoria de gran capacidad y alto ancho de banda, y el uso compartido de recursos.\n\nLa perspectiva a largo plazo más convincente no es el triunfo del entorno local ni el monopolio de la nube. Es una arquitectura por capas en la que las tareas breves, sensibles e inmediatas se procesan en el dispositivo, mientras que las tareas complejas, largas y costosas se envían a los centros de datos. En este entorno, la principal ventaja competitiva no será el tamaño de un único modelo, sino el enrutamiento que envíe cada tarea al lugar de ejecución adecuado, el control de costes y la gobernanza de datos.","content_html":"\u003cp\u003eA medida que los modelos de pesos abiertos y los modelos lingüísticos pequeños avanzan rápidamente, se repite la previsión de que toda la IA acabará ejecutándose en PC o smartphones. La ejecución local ofrece ventajas claras: reduce las tarifas de uso de API, evita enviar datos sensibles al exterior y funciona incluso sin internet.\u003c/p\u003e\n\u003cp\u003eSin embargo, el crecimiento de la IA local y el declive de la IA en centros de datos no son la misma afirmación. Aunque en el futuro aumente considerablemente la IA ejecutada en dispositivos personales, si se consideran el volumen total de cómputo y las tareas de alta dificultad, es probable que los centros de datos sigan siendo el núcleo de la inferencia. Esto se debe no solo al tamaño de los modelos, sino también a la interacción entre la competencia por el rendimiento, la demanda de los usuarios, el procesamiento por lotes, la tasa de utilización del hardware y el coste total de propiedad.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#tres-conceptos-que-primero-deben-distinguirse\" class=\"anchor\" id=\"tres-conceptos-que-primero-deben-distinguirse\"\u003e\u003c/a\u003eTres conceptos que primero deben distinguirse\u003c/h2\u003e\n\u003cp\u003eEn el debate sobre la IA local suelen mezclarse ejes distintos.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eDistinción\u003c/th\u003e\n\u003cth\u003eSignificado\u003c/th\u003e\n\u003cth\u003eConcepto opuesto\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Distinción\"\u003ePesos abiertos\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eModelo cuyos pesos entrenados pueden descargarse y utilizarse dentro de los límites de una licencia determinada\u003c/td\u003e\n\u003ctd data-label=\"Concepto opuesto\"\u003eModelo cuyos pesos no se han publicado\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Distinción\"\u003eInferencia local o en el dispositivo\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eModalidad que se ejecuta directamente en un PC, smartphone, vehículo o equipo interno de una empresa\u003c/td\u003e\n\u003ctd data-label=\"Concepto opuesto\"\u003eModalidad que se ejecuta en un centro de datos externo\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Distinción\"\u003eAlojamiento propio\u003c/td\u003e\n\u003ctd data-label=\"Significado\"\u003eModalidad en la que el usuario opera el modelo en un servidor o centro de datos de su elección\u003c/td\u003e\n\u003ctd data-label=\"Concepto opuesto\"\u003eModalidad que utiliza la API del proveedor del modelo\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eLos pesos abiertos no implican necesariamente una ejecución local. Una empresa puede ofrecer un modelo de pesos abiertos desde un clúster de GPU alquilado o desde su propio centro de datos. A la inversa, un fabricante de dispositivos también puede incorporar en un smartphone un modelo pequeño que no sea público.\u003c/p\u003e\n\u003cp\u003ePor tanto, la verdadera pregunta no es «si avanzan los modelos públicos», sino «en qué entorno de cómputo resulta más conveniente procesar cada tarea en términos de rendimiento, coste, protección de datos personales y operación».\u003c/p\u003e\n\u003cp\u003eLos pesos abiertos tampoco significan necesariamente que el modelo sea completamente de código abierto. Dado que las condiciones aplicables al uso, la redistribución y los modelos derivados varían según la licencia de cada modelo, antes de una implementación comercial debe revisarse por separado la licencia correspondiente.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#los-modelos-locales-del-futuro-pueden-alcanzar-a-los-mejores-modelos-actuales\" class=\"anchor\" id=\"los-modelos-locales-del-futuro-pueden-alcanzar-a-los-mejores-modelos-actuales\"\u003e\u003c/a\u003eLos modelos locales del futuro pueden alcanzar a los mejores modelos actuales\u003c/h2\u003e\n\u003cp\u003eLos avances en cuantización, destilación de conocimiento, poda, optimización de motores de inferencia y NPU especializadas permiten realizar tareas del mismo nivel con menos memoria y energía. Resulta perfectamente razonable prever que algunas capacidades que ahora requieren servidores puedan trasladarse dentro de unos años a portátiles o smartphones.\u003c/p\u003e\n\u003cp\u003eSin embargo, el criterio de comparación no permanece fijo. Mientras los modelos locales del futuro se aproximan a los mejores modelos actuales, los modelos de los centros de datos también pueden avanzar en las siguientes direcciones.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eRazonamiento y planificación más complejos\u003c/li\u003e\n\u003cli\u003eProcesamiento de contextos más largos y resultados de búsqueda a gran escala\u003c/li\u003e\n\u003cli\u003eTareas multimodales que combinan imágenes, audio y vídeo\u003c/li\u003e\n\u003cli\u003eUso fiable de múltiples herramientas y sistemas externos\u003c/li\u003e\n\u003cli\u003eRazonamiento mediante múltiples agentes o rutas candidatas\u003c/li\u003e\n\u003cli\u003eCapacidad para detectar errores y recuperarse durante tareas prolongadas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePor ello, la afirmación «algún día será posible implementar localmente el máximo rendimiento actual» es distinta de «también será posible implementar localmente el máximo rendimiento de ese momento». Es muy probable que la primera se haga realidad gracias a la mejora de la eficiencia tecnológica, pero la segunda puede seguir siendo difícil mientras también continúen avanzando la energía, la memoria, las redes y la escala de aceleradores que ofrecen los centros de datos.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#tambi%C3%A9n-aumenta-el-nivel-de-rendimiento-que-los-usuarios-consideran-suficiente\" class=\"anchor\" id=\"también-aumenta-el-nivel-de-rendimiento-que-los-usuarios-consideran-suficiente\"\u003e\u003c/a\u003eTambién aumenta el nivel de rendimiento que los usuarios consideran suficiente\u003c/h2\u003e\n\u003cp\u003eLas tareas representativas de la primera IA generativa eran responder preguntas, resumir documentos breves, redactar borradores de correos electrónicos y generar código sencillo. Estas tareas pueden gestionarse de manera útil incluso con modelos locales pequeños.\u003c/p\u003e\n\u003cp\u003eEn cambio, un agente de IA lee repositorios de código completos, modifica varios archivos, ejecuta pruebas y realiza repetidamente búsquedas y llamadas a herramientas externas. Un agente de investigación debe trabajar durante mucho tiempo, comparando distintas fuentes y conservando resultados intermedios. Un agente de automatización empresarial también debe gestionar permisos, bases de datos y sistemas internos.\u003c/p\u003e\n\u003cp\u003eEn las tareas prolongadas, los errores de cada etapa se acumulan. Aunque la tasa de éxito de una etapa sea alta, si se realizan de forma consecutiva decenas de decisiones y llamadas a herramientas, la probabilidad de completar con éxito toda la tarea puede disminuir considerablemente. Por ello, los usuarios empiezan a evaluar las siguientes capacidades, más allá de la calidad de una sola respuesta.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eSi mantiene durante mucho tiempo los objetivos y las restricciones\u003c/li\u003e\n\u003cli\u003eSi diagnostica y corrige las llamadas fallidas a herramientas\u003c/li\u003e\n\u003cli\u003eSi evita presentar como hechos contenidos no verificados\u003c/li\u003e\n\u003cli\u003eSi comprende de forma coherente el contexto amplio del código y los documentos\u003c/li\u003e\n\u003cli\u003eSi reduce el número de veces que debe intervenir una persona\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eSi un modelo más potente reduce el trabajo repetido y el tiempo de supervisión, el coste total del trabajo puede ser menor aunque el precio por token sea más alto. Por el contrario, para tareas breves y repetitivas puede ser más razonable utilizar un modelo local económico. En definitiva, el criterio de elección no es solo el precio del modelo, sino el coste de cada tarea completada y el riesgo de fracaso.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#la-principal-ventaja-de-los-centros-de-datos-es-el-procesamiento-por-lotes-y-el-uso-compartido-de-recursos\" class=\"anchor\" id=\"la-principal-ventaja-de-los-centros-de-datos-es-el-procesamiento-por-lotes-y-el-uso-compartido-de-recursos\"\u003e\u003c/a\u003eLa principal ventaja de los centros de datos es el procesamiento por lotes y el uso compartido de recursos\u003c/h2\u003e\n\u003cp\u003eLa generación de tokens en los grandes modelos lingüísticos depende en gran medida del proceso de leer repetidamente los pesos del modelo desde la memoria del acelerador. Cuando se procesa una sola solicitud, es posible que no se aproveche por completo una parte de los grandes dispositivos de cálculo paralelo y del ancho de banda de memoria.\u003c/p\u003e\n\u003cp\u003eLos sistemas de servicio agrupan en lotes las solicitudes de distintos usuarios para realizar operaciones matriciales. De este modo pueden procesar varias solicitudes de forma conjunta en una sola operación, aumentando la densidad de cálculo y el rendimiento. El procesamiento continuo por lotes, que retira las solicitudes que terminan antes e incorpora otras nuevas, es una tecnología clave para elevar la utilización en servicios reales donde las longitudes de entrada y salida son diferentes.\u003c/p\u003e\n\u003cp\u003eEl procesamiento por lotes no elimina por completo los costes en proporción al número de solicitudes. Cada solicitud tiene tokens que deben calcularse y una caché KV, y cuando aumenta el tamaño del lote también crecen el uso de memoria y el tiempo de espera. Los operadores deben equilibrar los siguientes elementos.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNúmero de tokens procesados por segundo\u003c/li\u003e\n\u003cli\u003eLatencia hasta la aparición del primer token\u003c/li\u003e\n\u003cli\u003eLatencia de los tokens de salida de cada solicitud\u003c/li\u003e\n\u003cli\u003eMemoria ocupada por la caché KV\u003c/li\u003e\n\u003cli\u003eMezcla de solicitudes con contextos largos y cortos\u003c/li\u003e\n\u003cli\u003eObjetivos de nivel de servicio y número máximo de solicitudes simultáneas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eAun así, como los grandes servicios reciben solicitudes de forma continua, les resulta más fácil reducir el tiempo de inactividad que a una GPU personal. También pueden compartir réplicas de modelos entre múltiples clientes, ajustar el número de servidores según el tráfico y trasladar determinadas tareas a aceleradores adecuados.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#las-gpu-personales-suelen-tener-una-tasa-de-utilizaci%C3%B3n-media-baja\" class=\"anchor\" id=\"las-gpu-personales-suelen-tener-una-tasa-de-utilización-media-baja\"\u003e\u003c/a\u003eLas GPU personales suelen tener una tasa de utilización media baja\u003c/h2\u003e\n\u003cp\u003eLos equipos personales pueden utilizarse inmediatamente cuando se necesitan, pero pueden pasar la mayor parte del día en espera. Incluso si se ejecutan varios agentes simultáneamente, resulta difícil mantener de forma continua solicitudes de distintas longitudes como hacen los grandes servicios.\u003c/p\u003e\n\u003cp\u003eLa viabilidad económica del equipo local depende de su tasa de utilización real, no de su velocidad máxima de procesamiento. Aunque se posea una GPU costosa, si solo se utiliza unas horas por semana, aumenta el coste de capital por token útil. Por el contrario, si hay tareas continuas, como producción de vídeo, pruebas de software o procesamiento masivo de documentos, la utilización del equipo local puede elevarse y hacerlo competitivo en costes.\u003c/p\u003e\n\u003cp\u003eSi se abre un servidor local a varias personas, aumentan la tasa de utilización y las oportunidades de procesamiento por lotes. Sin embargo, en ese momento se vuelven necesarios la autenticación, el control de acceso, las colas de trabajo, la respuesta ante fallos, la refrigeración y la supervisión. Aunque la escala sea pequeña, surgen problemas similares a los de la operación de un centro de datos.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#los-aceleradores-para-centros-de-datos-tienen-objetivos-y-configuraciones-diferentes\" class=\"anchor\" id=\"los-aceleradores-para-centros-de-datos-tienen-objetivos-y-configuraciones-diferentes\"\u003e\u003c/a\u003eLos aceleradores para centros de datos tienen objetivos y configuraciones diferentes\u003c/h2\u003e\n\u003cp\u003eLas GPU de consumo también son potentes para la IA generativa, pero se diseñan teniendo en cuenta simultáneamente los videojuegos, los gráficos y el cómputo de uso general. Los aceleradores para centros de datos se centran en grandes memorias de alto ancho de banda, conexiones entre aceleradores, escalabilidad a nivel de rack y operaciones de IA de baja precisión.\u003c/p\u003e\n\u003cp\u003eGeForce RTX 4090 es una GPU de consumo y NVIDIA B200 es un acelerador de IA para centros de datos. Según las estimaciones comparadas por el autor, NVIDIA B200 ofrece aproximadamente 3 veces más rendimiento de cálculo que RTX 4090 con un nivel de consumo energético similar, y su ancho de banda de memoria es casi 4 veces mayor. Esta diferencia favorece a los centros de datos cuando se cargan modelos grandes en memoria y se prestan servicios con un alto rendimiento.\u003c/p\u003e\n\u003cp\u003eNo obstante, las cifras de rendimiento de ambos productos no deben compararse mediante una simple proporción. El volumen de operaciones de IA publicado puede variar según la precisión, la aplicación o no de dispersión, el límite de potencia y la configuración del sistema. El rendimiento real de inferencia debe evaluarse mediante pruebas comparativas que mantengan iguales la arquitectura del modelo, el método de cuantización, el tamaño del lote, la longitud del contexto y la pila de software.\u003c/p\u003e\n\u003cp\u003eDividir un modelo grande entre varios aceleradores también genera costes de comunicación. Los centros de datos ofrecen interconexiones de alta velocidad y redes optimizadas, pero la inferencia distribuida no es gratuita. En el caso de un modelo pequeño, puede resultar más sencillo y eficiente ejecutarlo en una sola GPU de consumo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#c%C3%B3mo-calcular-el-coste-real-de-la-inferencia-local\" class=\"anchor\" id=\"cómo-calcular-el-coste-real-de-la-inferencia-local\"\u003e\u003c/a\u003eCómo calcular el coste real de la inferencia local\u003c/h2\u003e\n\u003cp\u003eEl cálculo de que «como ya se compró la GPU, la inferencia posterior es gratuita» omite el coste de capital y los gastos operativos. Deben incluirse todos los conceptos siguientes.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eCoste total de propiedad local\u003c/strong\u003e\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eCoste de compra - valor de reventa previsto + coste de electricidad + coste de refrigeración + coste de reparación y sustitución + valor del tiempo de operación\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eSi se divide este importe por el número de tokens útiles generados realmente o por el número de tareas completadas, se obtiene un coste unitario comparable. Es más preciso calcularlo tomando como referencia los resultados utilizables tras la revisión, y no simplemente los tokens de salida.\u003c/p\u003e\n\u003cp\u003eEl coste de electricidad puede estimarse de la siguiente manera.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eConsumo eléctrico medio (kW) × tiempo de ejecución (h) × tarifa eléctrica\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eTambién deben incluirse las pérdidas de la fuente de alimentación y el consumo eléctrico de la CPU, la memoria, los dispositivos de almacenamiento y los equipos de refrigeración. Dado que la tarifa eléctrica y el tiempo de uso del equipo varían considerablemente según la región, no resulta apropiado proponer un coste eléctrico mensual fijo aplicable a todos los usuarios.\u003c/p\u003e\n\u003cp\u003eEl \u003cstrong\u003ecoste total de la nube\u003c/strong\u003e puede incluir, además de las tarifas de API o suscripción, la transferencia de datos, los tiempos de espera, el coste de cambiar de proveedor, los límites de uso y el coste de gestionar información sensible. Cuando el uso es reducido o irregular, los servicios de pago por uso suelen ser ventajosos; para grandes volúmenes de trabajo constantes y predecibles, pueden resultar más favorables los equipos propios o la infraestructura reservada.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%C3%A1mbitos-en-los-que-la-ia-local-tiene-una-ventaja-clara\" class=\"anchor\" id=\"ámbitos-en-los-que-la-ia-local-tiene-una-ventaja-clara\"\u003e\u003c/a\u003eÁmbitos en los que la IA local tiene una ventaja clara\u003c/h2\u003e\n\u003cp\u003eLa viabilidad económica de los centros de datos no elimina la necesidad de la IA local. En las siguientes condiciones, el control de los datos, la disponibilidad o el tiempo de respuesta pueden ser más importantes que disponer del mejor modelo.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eSituación\u003c/th\u003e\n\u003cth\u003eVentaja de la ejecución local\u003c/th\u003e\n\u003cth\u003eRestricciones que deben comprobarse\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situación\"\u003eEntorno sin conexión\u003c/td\u003e\n\u003ctd data-label=\"Ventaja de la ejecución local\"\u003eFunciona independientemente de fallos de internet o restricciones de comunicación\u003c/td\u003e\n\u003ctd data-label=\"Restricciones que deben comprobarse\"\u003eRendimiento del dispositivo y consumo de batería\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situación\"\u003eTratamiento de información sensible\u003c/td\u003e\n\u003ctd data-label=\"Ventaja de la ejecución local\"\u003ePermite no enviar los datos originales a servidores externos\u003c/td\u003e\n\u003ctd data-label=\"Restricciones que deben comprobarse\"\u003eRobo del dispositivo, malware y protección de registros locales\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situación\"\u003eAsistencia de teclado y voz\u003c/td\u003e\n\u003ctd data-label=\"Ventaja de la ejecución local\"\u003eBaja latencia y respuesta inmediata\u003c/td\u003e\n\u003ctd data-label=\"Restricciones que deben comprobarse\"\u003eTamaño y precisión del modelo\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situación\"\u003eClasificación repetitiva a pequeña escala\u003c/td\u003e\n\u003ctd data-label=\"Ventaja de la ejecución local\"\u003eBajo coste marginal si el volumen de uso es suficiente\u003c/td\u003e\n\u003ctd data-label=\"Restricciones que deben comprobarse\"\u003eCostes iniciales de desarrollo y equipos\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situación\"\u003eControl de vehículos, fábricas y entornos de campo\u003c/td\u003e\n\u003ctd data-label=\"Ventaja de la ejecución local\"\u003eDecisiones rápidas sin recorridos de ida y vuelta por la red\u003c/td\u003e\n\u003ctd data-label=\"Restricciones que deben comprobarse\"\u003eValidación de seguridad y sistema de actualizaciones\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situación\"\u003eFunciones de personalización\u003c/td\u003e\n\u003ctd data-label=\"Ventaja de la ejecución local\"\u003eUso del contexto del usuario dentro del dispositivo\u003c/td\u003e\n\u003ctd data-label=\"Restricciones que deben comprobarse\"\u003eGestión de permisos y eliminación de datos\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eLa protección de datos personales tampoco puede evaluarse de forma binaria, como «local es seguro y la nube es peligrosa». Si el equipo local está infectado o el disco no está cifrado, los datos pueden quedar expuestos. Por otra parte, los servicios en la nube también pueden ofrecer limitaciones a la conservación de datos, cifrado y entornos de ejecución aislados, pero el usuario debe verificar la arquitectura técnica real y las condiciones contractuales.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#la-forma-m%C3%A1s-probable-es-una-ia-h%C3%ADbrida\" class=\"anchor\" id=\"la-forma-más-probable-es-una-ia-híbrida\"\u003e\u003c/a\u003eLa forma más probable es una IA híbrida\u003c/h2\u003e\n\u003cp\u003eEs probable que la IA local y los centros de datos se repartan las funciones, en lugar de que uno sustituya por completo al otro.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eEl dispositivo gestiona la detección de voz, la eliminación de datos personales, las clasificaciones breves y la generación sencilla.\u003c/li\u003e\n\u003cli\u003eUn enrutador local evalúa la dificultad y la sensibilidad de la tarea.\u003c/li\u003e\n\u003cli\u003eSolo se llama al modelo del centro de datos cuando se requieren razonamientos complejos, contextos largos o búsquedas a gran escala.\u003c/li\u003e\n\u003cli\u003eParte del resultado se verifica localmente o se combina con los datos del usuario.\u003c/li\u003e\n\u003cli\u003eSi se pierde la conexión, se cambia a un modelo local con funciones limitadas.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eEsta arquitectura permite utilizar un modelo potente cuando sea necesario y, al mismo tiempo, reducir el volumen de llamadas a la nube. Los proveedores pueden emplear modelos pequeños para filtrar, enrutar y generar borradores, y asignar los modelos grandes únicamente a las solicitudes difíciles. Los usuarios también pueden ejecutar modelos públicos localmente y conectar un modelo independiente del centro de datos como recurso auxiliar.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#primero-debe-definirse-qu%C3%A9-indicador-representa-la-mayor-parte-de-la-inferencia\" class=\"anchor\" id=\"primero-debe-definirse-qué-indicador-representa-la-mayor-parte-de-la-inferencia\"\u003e\u003c/a\u003ePrimero debe definirse qué indicador representa «la mayor parte de la inferencia»\u003c/h2\u003e\n\u003cp\u003eLa proporción de IA local y de IA en centros de datos puede parecer completamente diferente según la unidad de medida. Esta distinción suele omitirse en los debates simplistas sobre cuota de mercado.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eNúmero de solicitudes:\u003c/strong\u003e si aumentan las funciones breves de autocompletado o clasificación en smartphones, la proporción local puede ser alta.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eNúmero de tokens generados:\u003c/strong\u003e si los documentos largos y las tareas de agentes se concentran en la nube, puede aumentar la proporción de los centros de datos.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eVolumen de cómputo:\u003c/strong\u003e el razonamiento difícil, la generación de múltiples candidatos y el procesamiento multimodal pueden elevar el volumen total de cómputo de los centros de datos.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eImporte del gasto:\u003c/strong\u003e los costosos servicios empresariales y la infraestructura pueden aumentar la proporción del gasto correspondiente a los centros de datos.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eTiempo percibido por el usuario:\u003c/strong\u003e las funciones locales de asistencia siempre activas pueden hacer que el usuario sienta que utiliza la IA local con mayor frecuencia.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePor tanto, en el futuro podría aumentar el número de solicitudes locales mientras el volumen total de cómputo de IA, las tareas de alta dificultad y el gasto asociado se concentran en los centros de datos. Tanto «toda la IA se trasladará al entorno local» como «la IA local no es importante» son expresiones que ignoran esta diferencia.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#variables-que-pueden-cambiar-las-previsiones\" class=\"anchor\" id=\"variables-que-pueden-cambiar-las-previsiones\"\u003e\u003c/a\u003eVariables que pueden cambiar las previsiones\u003c/h2\u003e\n\u003cp\u003eLa perspectiva centrada en los centros de datos no es una ley inmutable. Si se producen los siguientes cambios, la proporción local podría aumentar más rápido de lo previsto.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eQue las capacidades de los modelos se saturen realmente en muchas tareas y disminuya el valor de modelos más potentes\u003c/li\u003e\n\u003cli\u003eQue se generalicen dispositivos de bajo consumo con gran capacidad y ancho de banda de memoria\u003c/li\u003e\n\u003cli\u003eQue la destilación y la cuantización reduzcan considerablemente los modelos sin apenas perder capacidades de razonamiento complejo\u003c/li\u003e\n\u003cli\u003eQue las normativas sobre datos personales y seguridad nacional restrinjan fuertemente la transmisión a servidores externos\u003c/li\u003e\n\u003cli\u003eQue la expansión de los centros de datos se ralentice por restricciones de la red eléctrica, el agua de refrigeración, el suministro de semiconductores o los permisos\u003c/li\u003e\n\u003cli\u003eQue maduren las tecnologías y los sistemas de compensación para agrupar de forma segura los recursos de dispositivos distribuidos\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePor el contrario, si las tareas de los agentes se prolongan, se generalizan la generación de vídeo y el procesamiento multimodal en tiempo real, y continúan mejorando la tasa de utilización de los aceleradores y la eficiencia energética de los centros de datos, puede reforzarse la ventaja de la inferencia centralizada.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#conclusi%C3%B3n\" class=\"anchor\" id=\"conclusión\"\u003e\u003c/a\u003eConclusión\u003c/h2\u003e\n\u003cp\u003eLa IA local no es una tecnología periférica destinada a desaparecer. Es muy probable que se convierta en una capa esencial para las funciones de asistencia de los smartphones, el tratamiento de información sensible, el trabajo sin conexión y los servicios en los que la latencia es importante. Los modelos de pesos abiertos también amplían las posibilidades de elección y las capacidades de alojamiento propio, y contribuyen a reducir la dependencia de los proveedores.\u003c/p\u003e\n\u003cp\u003eSin embargo, resulta difícil considerar que la necesidad de centros de datos desaparecerá únicamente gracias a la mejora de la eficiencia de los modelos. Los estándares de máximo rendimiento y las exigencias de los usuarios aumentan simultáneamente, y los centros de datos poseen ventajas estructurales en el procesamiento por lotes, la alta utilización de aceleradores, la memoria de gran capacidad y alto ancho de banda, y el uso compartido de recursos.\u003c/p\u003e\n\u003cp\u003eLa perspectiva a largo plazo más convincente no es el triunfo del entorno local ni el monopolio de la nube. Es una arquitectura por capas en la que las tareas breves, sensibles e inmediatas se procesan en el dispositivo, mientras que las tareas complejas, largas y costosas se envían a los centros de datos. En este entorno, la principal ventaja competitiva no será el tamaño de un único modelo, sino el enrutamiento que envíe cada tarea al lugar de ejecución adecuado, el control de costes y la gobernanza de datos.\u003c/p\u003e\n","tags":["Semiconductores","IA generativa","Centro de datos IA","Protección de datos","Chips de IA","Estrategia tecnológica"],"faqs":[{"question":"¿Todos los modelos de pesos abiertos pueden ejecutarse en un PC personal?","answer":"No. Que un modelo sea de pesos abiertos significa que sus pesos están disponibles, no que sea adecuado para hardware de uso personal. Depende del tamaño del modelo, la precisión, la capacidad de memoria y las condiciones de la licencia, y los grandes modelos de pesos abiertos pueden requerir varias GPU de centros de datos."},{"question":"¿Podrán los smartphones del futuro ofrecer el mejor rendimiento de IA actual?","answer":"Gracias a la cuantización, la destilación y los avances de las NPU, es muy probable que algunas de las capacidades actuales propias de servidores pasen a los smartphones. Sin embargo, como los modelos de los centros de datos también avanzarán para entonces, esto no significa que los smartphones vayan a alcanzar a los mejores modelos del futuro."},{"question":"Si compro una GPU, ¿la IA local siempre resulta más barata que una API?","answer":"No siempre. Hay que calcular el precio de compra y el valor de reventa, la electricidad, la refrigeración, el mantenimiento y el índice de utilización real. Si el uso es escaso o irregular, un servicio de pago por uso puede resultar más conveniente, mientras que la ejecución local puede ser más ventajosa para trabajos de gran volumen que utilicen los equipos de forma continua."},{"question":"¿Por qué el procesamiento por lotes reduce los costes en la inferencia de IA?","answer":"Procesar varias solicitudes juntas permite utilizar de forma más eficiente la capacidad de cálculo paralelo y el ancho de banda de memoria del acelerador. El procesamiento continuo por lotes aumenta el índice de utilización al retirar las solicitudes completadas y añadir otras nuevas, pero no se puede ampliar el lote de forma ilimitada debido a la caché KV y la latencia."},{"question":"¿La IA local siempre es más segura para proteger la información personal?","answer":"Es ventajosa porque no se envían los datos a servidores externos, pero esto no garantiza automáticamente la seguridad. Se necesita cifrado del dispositivo, protección contra software malicioso y gestión de permisos de acceso, registros y copias de seguridad. Al usar la nube, hay que comprobar la conservación de los datos, si se utilizan para entrenamiento y los métodos de cifrado y aislamiento."},{"question":"¿Se puede comparar el rendimiento de IA de las GPU de consumo y las GPU de centros de datos basándose únicamente en los FLOPS?","answer":"No. La precisión, la dispersión, los límites de consumo y las condiciones de medición pueden diferir. La inferencia real de LLM también depende en gran medida de la capacidad y el ancho de banda de la memoria, el tamaño del lote, la longitud del contexto, la caché KV, la interconexión entre aceleradores y el software de servicio."},{"question":"¿Para qué tareas es más adecuada la IA local?","answer":"Es adecuada para tareas en las que son importantes la latencia y el control de los datos, como el autocompletado del teclado, los resúmenes breves y la clasificación, el procesamiento de voz sin conexión, el preprocesamiento de información sensible y el control in situ. Es muy probable que los centros de datos sean más ventajosos para tareas de agentes de larga duración, el procesamiento multimodal a gran escala y la inferencia que requiere el máximo rendimiento."},{"question":"A largo plazo, ¿cuál ganará, la IA local o la IA en la nube?","answer":"En vez de que una sustituya por completo a la otra, lo más probable es una arquitectura híbrida. El dispositivo procesa las tareas sencillas y sensibles y envía al centro de datos únicamente las solicitudes complejas. Aunque la IA local gestione un mayor número de solicitudes, el volumen total de cálculo y las tareas de alta complejidad pueden concentrarse en los centros de datos."}],"sources":[{"url":"https://arxiv.org/abs/2309.06180","title":"Gestión eficiente de la memoria para el servicio de grandes modelos de lenguaje con PagedAttention","type":"source"},{"url":"https://arxiv.org/abs/2206.02658","title":"Orca: un sistema de servicio distribuido para modelos generativos basados en transformadores","type":"source"},{"url":"https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/","title":"Arquitectura NVIDIA Blackwell","type":"data_point"},{"url":"https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/","title":"NVIDIA GeForce RTX 4090","type":"data_point"},{"url":"https://mlcommons.org/benchmarks/inference-datacenter/","title":"Inferencia de MLPerf: centro de datos","type":"source"},{"url":"https://security.apple.com/blog/private-cloud-compute/","title":"Private Cloud Compute: una nueva frontera para la privacidad de la IA en la nube","type":"source"},{"url":"https://developer.android.com/ai/gemini-nano","title":"SDK de Google AI Edge con Gemini Nano","type":"source"}],"images":[{"id":932,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTAsInB1ciI6ImJsb2JfaWQifX0=--34abeef97dfe63b15e2b649c2c6ae8c564924b28/ai-0fdb0281.webp","is_representative":true,"generation_method":"ai_photo","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"서버 랙 앞에서 소형 장비에 케이블을 연결하는 데이터센터 기술자","caption":"기술자가 데이터센터 서버 옆에서 네트워크 장비와 모니터링 노트북을 점검하고 있다.","description":null},"en":{"alt":"Data center technician connecting a cable to a compact device beside server racks","caption":"A technician checks network hardware and a monitoring laptop beside data center servers.","description":null},"ja":{"alt":"サーバーラックの前で小型機器にケーブルを接続するデータセンター技術者","caption":"技術者がデータセンターのサーバー脇でネットワーク機器と監視用ノートPCを点検している。","description":null},"es":{"alt":"Técnico de centro de datos conectando un cable a un equipo compacto junto a servidores","caption":"Un técnico revisa el equipo de red y un portátil de monitoreo junto a los servidores.","description":null},"id":{"alt":"Teknisi pusat data menghubungkan kabel ke perangkat ringkas di depan rak server","caption":"Teknisi memeriksa perangkat jaringan dan laptop pemantau di samping server pusat data.","description":null},"pt":{"alt":"Técnico de data center conectando um cabo a um equipamento compacto junto aos servidores","caption":"Um técnico verifica o equipamento de rede e um notebook de monitoramento ao lado dos servidores.","description":null},"zh-hant":{"alt":"資料中心技術人員在伺服器機櫃前為小型設備連接纜線","caption":"技術人員在資料中心伺服器旁檢查網路設備與監控筆電。","description":null},"de":{"alt":"Rechenzentrumstechniker verbindet vor Serverracks ein Kabel mit einem kompakten Gerät","caption":"Ein Techniker prüft neben den Servern Netzwerkhardware und einen Monitoring-Laptop.","description":null}}},{"id":933,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTYsInB1ciI6ImJsb2JfaWQifX0=--4b642e72ce104856aa40ed5bc224e337cf7877c2/ai-70dfbb70.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"노트북과 스마트폰의 로컬 AI가 서버, GPU, 데이터센터와 연결된 구조를 비교한 도식","caption":"로컬 기기와 대규모 데이터센터 추론 인프라의 연결과 자원 차이를 보여준다.","description":null},"en":{"alt":"Diagram comparing local AI on a laptop and phone with servers, GPUs, and data center infrastructure","caption":"The graphic contrasts connected local devices with large-scale data center inference resources.","description":null},"ja":{"alt":"ノートPCとスマートフォンのローカルAIをサーバー、GPU、データセンターと比較した図","caption":"ローカル端末と大規模なデータセンター推論基盤の接続や資源の違いを示している。","description":null},"es":{"alt":"Diagrama que compara IA local en portátil y móvil con servidores, GPU e infraestructura de centro de datos","caption":"El gráfico contrasta los dispositivos locales conectados con los recursos de inferencia de un centro de datos.","description":null},"id":{"alt":"Diagram perbandingan AI lokal di laptop dan ponsel dengan server, GPU, dan infrastruktur pusat data","caption":"Grafik ini membandingkan perangkat lokal terhubung dengan sumber daya inferensi pusat data berskala besar.","description":null},"pt":{"alt":"Diagrama compara IA local em notebook e celular com servidores, GPUs e infraestrutura de data center","caption":"O gráfico contrasta dispositivos locais conectados com recursos de inferência de data center em grande escala.","description":null},"zh-hant":{"alt":"比較筆電與手機本地 AI 和伺服器、GPU及資料中心基礎設施的示意圖","caption":"圖中對比連網的本地裝置與大規模資料中心推論資源。","description":null},"de":{"alt":"Schaubild vergleicht lokale KI auf Laptop und Smartphone mit Servern, GPUs und Rechenzentrum","caption":"Die Grafik stellt vernetzte lokale Geräte den umfangreichen Inferenzressourcen eines Rechenzentrums gegenüber.","description":null}}}],"published_at":"2026-08-28T11:45:54+09:00","updated_at":"2026-08-28T11:45:54+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/es/articles/why-most-ai-inference-will-remain-in-data-centers"}