Saltar al contenido
Injoys
Datos de IA

El nuevo referente en la competencia de semiconductores de IA: el coste por token

En el mercado de la IA generativa, además del máximo rendimiento de cómputo, se ha vuelto importante producir tokens al menor coste posible manteniendo una calidad y una velocidad de respuesta constantes. Los ASIC personalizados, los sistemas a escala de rack y la optimización de la memoria y las redes son claves para competir, pero los costes no pueden compararse únicamente mediante las especificaciones de los chips.

Escucha o lee este artículo

22:37

Escúchalo o lee solo el texto.

El nuevo referente en la competencia de semiconductores de IA: el coste por token

Supertonic 3 Voz generada por IA

0:00 22:37

Publicidad

Descargar audio

Nombre de archivo
ai-chip-token-economics-and-hardware-strategies-es.mp3
Formato
MP3 (audio/mpeg)
Duración
22:37
Tamaño
15.5 MB
Motor
Supertonic 3

Este audio fue generado por IA.

Puedes descargarlo y usarlo libremente para uso personal.

El nuevo referente en la competencia de semiconductores de IA: el coste por token

15 min de lectura

El nuevo referente en la competencia de semiconductores de IA: el coste por token
En el mercado de la IA generativa, además del máximo rendimiento de cómputo, se ha vuelto importante producir tokens al menor coste posible manteniendo una calidad y una velocidad de respuesta constantes. Los ASIC personalizados, los sistemas a escala de rack y la optimización de la memoria y las redes son claves para competir, pero los costes no pueden compararse únicamente mediante las especificaciones de los chips.
A medida que crecen los servicios de IA, los costes recurrentes de inferencia determinan directamente el precio y la rentabilidad del producto.
El coste por token debe calcularse como coste total, incluyendo energía, memoria, redes, tasa de utilización, software y calidad del modelo, no solo el precio del chip.
Google, AWS, Microsoft y Meta buscan controlar los costes y la cadena de suministro mediante aceleradores adaptados a sus propias cargas de trabajo.
NVIDIA y AMD responden a los chips personalizados combinando versatilidad, ecosistemas de desarrollo y optimización a escala de rack.
En la práctica, una métrica más útil que el simple coste por token es el coste por tarea completada con éxito, que refleja la calidad y los reintentos.
La competencia en semiconductores para IA generativa está ampliando sus criterios, desde la capacidad máxima de cómputo hasta la rentabilidad real del servicio. El término informal rentabilidad de tokens, utilizado en el sector, se refiere a cuántos tokens pueden procesarse de forma útil con un coste o una cantidad de energía determinados.
Sin embargo, el token más barato no siempre produce el resultado más económico. Para evaluar la competitividad real, también deben medirse la precisión del modelo, la latencia de respuesta, el número de reintentos y la tasa de utilización del centro de datos.
Qué es la rentabilidad de tokens
Un token es una unidad de procesamiento de texto que los modelos de lenguaje utilizan al leer entradas y generar salidas. Los proveedores de API suelen fijar precios distintos para los tokens de entrada y de salida, y a veces aplican una tarifa separada a las entradas almacenadas en caché.
La rentabilidad de tokens no es un término contable oficial ni un benchmark estandarizado. En la práctica, deben distinguirse los siguientes indicadores.
Indicador | Significado | Elementos fáciles de pasar por alto Tokens por dólar | Número de tokens procesados con el mismo coste | Calidad, latencia y diferencia de precio entre entrada y salida Tokens por segundo | Velocidad de procesamiento de la generación | Número de usuarios simultáneos y latencia del primer token Tokens por vatio | Eficiencia energética | Pérdidas de refrigeración y conversión eléctrica Rendimiento por servidor | Rendimiento total de un servidor o rack | Baja utilización y tiempo de espera Coste por tarea exitosa | Coste total necesario para completar el objetivo | Reintentos, llamadas a herramientas y rutas fallidas
Conceptualmente, el coste total por token puede expresarse del siguiente modo.
Coste total por token = depreciación + electricidad y refrigeración + memoria y red + costes operativos + costes de software ÷ tokens procesados válidos
Aquí, los tokens procesados válidos no se refieren simplemente al volumen generado, sino a los tokens que cumplen los criterios de calidad del servicio. Como los distintos modelos utilizan tokenizadores y longitudes de respuesta diferentes, comparar directamente solo el precio por 1 millón de tokens puede producir distorsiones.
Por qué el coste de inferencia está cambiando la competencia entre semiconductores
El coste se repite cada vez que se utiliza el servicio
El entrenamiento a gran escala es una fase en la que se concentra un coste enorme, pero no constituye un gasto completamente único. Después del preentrenamiento también se repiten el ajuste fino, el aprendizaje por refuerzo, la evaluación y el entrenamiento de nuevas versiones. Aun así, el coste de inferencia generado con cada solicitud del usuario influye más directamente en el modelo de negocio, ya que aumenta casi al mismo ritmo que el crecimiento del servicio.
Stanford AI Index 2025 analizó que el coste de inferencia necesario para ofrecer un determinado nivel de rendimiento del modelo había caído rápidamente. Este resultado no solo se debe a las mejoras de los semiconductores, sino también a los modelos pequeños, la cuantización, los motores de inferencia y el aumento de la competencia. Cuando baja el coste unitario, más funciones pasan a ser rentables, aunque también puede aparecer el efecto Jevons, por el que el aumento del uso compensa la reducción del coste unitario.
Los agentes de IA amplifican el uso de tokens
En un chatbot convencional, las preguntas y respuestas suelen terminar con relativa brevedad. En cambio, un agente de IA puede repetir las siguientes tareas.
· Elaboración y revisión de planes · Lectura de documentos extensos o repositorios de código · Llamadas a herramientas como buscadores, bases de datos y terminales · Revisión de resultados de ejecución y corrección de errores · Generación y evaluación de varios candidatos
Cuanto más se prolongan las etapas de una tarea, más se acumulan el contexto de entrada, el razonamiento intermedio, los resultados de las herramientas y los reintentos. En la era de los agentes, el coste total de completar con éxito una tarea es más importante que el precio de una sola llamada al modelo.
La electricidad y las instalaciones crean el límite real de suministro
Aunque se consigan aceleradores de IA, no pueden ponerse en funcionamiento si faltan conexiones eléctricas, refrigeración, memoria de gran ancho de banda, redes o espacio en los centros de datos. Por eso, los tokens por vatio y los tokens por rack tienen un significado que va más allá del ahorro en la factura eléctrica. Determinan el volumen de servicio que puede ofrecerse con una capacidad eléctrica limitada.
Estrategias de hardware para reducir el coste por token
1. Aceleradores propios adaptados a cargas de trabajo específicas
Las GPU de propósito general admiten diversos modelos y operaciones, pero esa flexibilidad tiene un coste. Los grandes proveedores de nube pueden analizar las cargas de trabajo internas que ejecutan repetidamente, eliminar funciones innecesarias y optimizar las rutas de movimiento de datos.
Empresa | Familia de aceleradores anunciada | Orientación principal | Precauciones al interpretarla Google | TPU, Ironwood | Codiseño del modelo, el compilador y la infraestructura de nube | No puede darse por hecho que se reproduzca la misma eficiencia fuera del entorno interno de Google AWS | Trainium, Inferentia | Chips exclusivos de AWS y software Neuron adaptados al entrenamiento y la inferencia | Deben comprobarse las operaciones compatibles y el coste de migración de los modelos Microsoft | Maia 100 | Acelerador propio para cargas de trabajo de Azure AI | Es difícil calcular el coste de las cargas de trabajo comerciales solo con las especificaciones públicas Meta | MTIA | Optimización de cargas de trabajo internas de inferencia a gran escala, como recomendación y clasificación | No es un chip LLM de propósito general que sustituya a todos los modelos de IA generativa
Ironwood, presentado por Google en 2025, es una TPU de séptima generación diseñada principalmente para la inferencia. Es más preciso entenderlo como parte de una estrategia de integración vertical que optimiza conjuntamente los modelos de Google, el compilador XLA y los centros de datos, en lugar de considerarlo un chip ligado exclusivamente a un único modelo Gemini.
El objetivo de los chips propios no se limita a reducir el coste de adquisición. También intervienen el control del calendario de suministro, la mejora de la eficiencia energética, la optimización de las cargas de trabajo internas y el fortalecimiento del poder de negociación frente a proveedores externos.
2. Diseñar todo el rack como un único ordenador
Como los modelos grandes no caben en la memoria de un solo acelerador, se distribuyen entre varios. En ese caso, el rendimiento puede depender más de la velocidad de comunicación entre aceleradores, el ancho de banda de la memoria y la planificación del software que de la capacidad de cómputo de cada chip.
La plataforma NVIDIA Blackwell ha puesto en primer plano un enfoque a escala de rack que integra GPU, CPU, NVLink, redes y software. AMD también está reforzando sus aceleradores Instinct, su ecosistema de software abierto y sus sistemas a escala de rack. En esta competencia, los siguientes elementos son más importantes que los benchmarks de un solo chip.
· Número de solicitudes que pueden procesarse simultáneamente en un rack · Coste de mover pesos y KV cache entre aceleradores · Capacidad de utilizar los equipos restantes cuando se produce un fallo · Rendimiento sostenido dentro de los límites de suministro eléctrico y refrigeración · Tiempo de desarrollo necesario para desplegar realmente un modelo
Aunque el precio del rack sea elevado, el coste por token puede bajar si la utilización y el rendimiento son suficientemente altos. Por el contrario, incluso un chip barato pierde rentabilidad si permanece inactivo durante mucho tiempo debido a la inmadurez del software o a cuellos de botella en las comunicaciones.
3. Reducir los límites de comunicación a escala de oblea
Cerebras desarrolló la familia WSE, que utiliza procesadores del tamaño de una oblea en lugar de múltiples chips individuales convencionales. Este enfoque sitúa grandes recursos de cómputo y ancho de banda de memoria en una sola oblea para reducir parte de la comunicación entre chips que se produce en los clústeres tradicionales.
La arquitectura a escala de oblea puede aspirar a una baja latencia y un alto rendimiento, pero no elimina todas las comunicaciones. Al conectar varios sistemas u operar modelos grandes, siguen siendo necesarios la memoria externa, la red, la recuperación ante fallos y el compilador. Tampoco pueden compararse directamente los récords de tokens por segundo de modelos específicos cuando difieren la precisión, el tamaño del lote, la longitud del contexto y las condiciones de salida.
4. Priorizar la optimización de la memoria y del movimiento de datos
En la inferencia, el proceso de mover los pesos del modelo y el KV cache suele convertirse en un cuello de botella mayor que el propio cálculo. En particular, la fase de decodificación, que genera los tokens uno a uno, está muy condicionada por el ancho de banda de la memoria.
Esta es la razón por la que los proveedores de hardware destacan la memoria de gran ancho de banda, los chiplets, las interconexiones de alta velocidad y las cachés de mayor tamaño. Aunque las cifras de rendimiento computacional sean elevadas, el rendimiento real de tokens no aumenta si los datos necesarios no se suministran a tiempo.
5. Codiseñar el hardware y el software de inferencia
La rentabilidad de tokens no está determinada únicamente por los semiconductores. Incluso con el mismo hardware, el rendimiento puede variar considerablemente según las siguientes técnicas.
· Cuantización: reduce la precisión de los pesos y de las operaciones para disminuir el uso de memoria y el volumen de cálculo. · Procesamiento continuo por lotes: agrupa eficientemente solicitudes con distintas horas de llegada. · Almacenamiento en caché de prefijos: reutiliza los cálculos de prompts del sistema y contextos repetidos. · Decodificación especulativa: un modelo pequeño genera candidatos de tokens y un modelo grande los verifica. · Separación de prefill y decode: asigna el procesamiento de entrada y la generación de salida a recursos distintos. · Enrutamiento de modelos dispersos: activa solo algunos de los expertos necesarios en los modelos Mixture-of-Experts.
Los chips personalizados solo resultan eficaces cuando el compilador y el modelo están preparados conjuntamente. CUDA es una importante barrera defensiva para NVIDIA porque ya existe un ecosistema acumulado que incluye bibliotecas, herramientas de desarrollo, conocimientos de optimización y personal especializado.
Por qué la dependencia de NVIDIA no desaparece rápidamente
Las empresas que introducen chips propios o aceleradores AMD también pueden utilizar simultáneamente sistemas NVIDIA. Esto se asemeja más a una distribución de cargas de trabajo que a una contradicción estratégica.
Las fortalezas de NVIDIA son las siguientes.
· Compatibilidad con CUDA y una amplia gama de bibliotecas de IA · Versatilidad para probar rápidamente modelos nuevos · Madurez integral en servidores, redes y software de gestión · Experiencia acumulada de desarrolladores y personal de operaciones · Amplia disponibilidad entre proveedores de nube y fabricantes de servidores
En cambio, los ASIC propios tienden a obtener ventajas en cargas de trabajo a gran escala, constantes y repetitivas. Por tanto, es probable que el mercado evolucione hacia una estructura en la que las GPU de propósito general y los aceleradores especializados se repartan las funciones, en lugar de que un único tipo de chip sustituya a todos los demás.
Condiciones que deben controlarse al comparar la rentabilidad de tokens
El rendimiento máximo o los porcentajes de ahorro anunciados por los proveedores no pueden compararse directamente si no proceden de benchmarks independientes realizados bajo las mismas condiciones. Como mínimo, deben igualarse las siguientes condiciones.
Condición de comparación | Impacto en el coste Modelo y número de parámetros | Cambian la memoria y el volumen de cálculo necesarios Precisión numérica | La velocidad y la calidad difieren entre FP8, BF16, INT8 y otros formatos Longitud de entrada y salida | Cambia la proporción de prefill y decode Tamaño del lote y solicitudes simultáneas | Cambia el equilibrio entre rendimiento y latencia Latencia del primer token | Determina la calidad percibida de un servicio en tiempo real Tasa de utilización | Sirve como base para dividir los costes fijos entre el rendimiento real Alcance energético | Varía según si se mide solo el chip o también se incluyen la refrigeración y la red Calidad de la respuesta | Una respuesta breve pero incorrecta genera costes de reintento
Los resultados que especifican el modelo, el escenario y las condiciones de calidad, como MLPerf Inference de MLCommons, son relativamente útiles. Sin embargo, ni siquiera los benchmarks públicos pueden reproducir por completo la configuración de modelos, los costes eléctricos regionales y los patrones de tráfico reales de cada empresa.
Más allá del simple precio por token: coste por tarea exitosa
Los tokens son fáciles de medir, pero no representan directamente el valor del resultado final. Aunque el modelo A tenga un precio por token inferior al del modelo B, el coste de completar una tarea puede ser mayor si produce respuestas más largas o falla con frecuencia.
Para los servicios de agentes resulta más adecuado el siguiente cálculo.
Coste por tarea exitosa = coste total de modelos, herramientas e infraestructura ÷ número de tareas que superan los criterios de calidad
Esto incluye no solo el coste de los tokens, sino también las API de búsqueda, la ejecución de código, las bases de datos, la revisión humana, los intentos fallidos y los costes causados por la latencia. Esta perspectiva suele quedar fuera de la competencia por el rendimiento puro y del debate sobre la rentabilidad de tokens.
Cómo distinguir las afirmaciones públicas de las cifras no verificadas
Las hojas de ruta de productos y las previsiones del mercado de semiconductores cambian con frecuencia. Entre algunos de los nombres y cifras incluidos en los materiales proporcionados, no se utilizaron como hechos confirmados aquellos que no estaban suficientemente verificados mediante documentación oficial del producto o benchmarks reproducibles. Entre ellos se encuentran Frozen V2 y Claude Fable 5, descritos como exclusivos para modelos específicos, la velocidad de Cerebras con determinados modelos no anunciados, los costes fijos por 1 millón de tokens de cada chip y las futuras cifras de cuota de mercado.
Además, las siguientes expresiones exigen comprobar sus condiciones.
· Eficiencia de hasta 10 veces: deben comprobarse el objeto de comparación, la precisión y el alcance del sistema. · Reducción del 50% en el coste de tokens: deben especificarse el modelo, la región, la utilización y las condiciones de depreciación. · Cientos de tokens por segundo: debe distinguirse si se trata de la velocidad de un solo usuario o del rendimiento total. · Abandono de NVIDIA: debe comprobarse si se trata de una sustitución completa o de la migración de parte de las cargas de trabajo internas.
Para tomar decisiones de inversión o adquisición de infraestructura, no deben utilizarse únicamente los materiales de presentación; también deben revisarse los benchmarks independientes, los calendarios reales de suministro, el alcance de la compatibilidad del software y el coste total de propiedad.
Conclusión del mercado
La competencia en semiconductores de IA está pasando de una etapa centrada únicamente en la velocidad máxima a otra en la que se compite por producir tokens y completar tareas que cumplan los criterios de calidad con el menor coste total posible.
Los ASIC personalizados buscan una alta eficiencia en cargas de trabajo repetitivas y a gran escala, mientras que las GPU de propósito general responden con compatibilidad flexible con distintos modelos y un ecosistema maduro. El diseño a escala de rack, el ancho de banda de la memoria, las redes, la energía y el software de inferencia se han vuelto tan importantes como el propio chip.
En definitiva, el indicador que determina al ganador no es simplemente el número de tokens por segundo ni el precio por 1 millón de tokens. El coste total por tarea exitosa, que refleja la calidad, la latencia, la utilización y las limitaciones energéticas del tráfico real, es un criterio más preciso.
0:00 0:00
1 / 70

Publicidad

Descargar texto

Nombre de archivo
ai-chip-token-economics-and-hardware-strategies-es.txt
Formato
TXT (text/plain)
Párrafos
70

Descarga exactamente lo que ves como archivo de texto.

Cita la fuente al reproducirlo.

Texto grande

Aumenta el texto y hace los colores más nítidos. Actívalo si el texto te resulta pequeño.

La ilustración representa el equilibrio entre energía, rendimiento y coste en la infraestructura de IA.

Puntos clave

  • A medida que crecen los servicios de IA, los costes recurrentes de inferencia determinan directamente el precio y la rentabilidad del producto.
  • El coste por token debe calcularse como coste total, incluyendo energía, memoria, redes, tasa de utilización, software y calidad del modelo, no solo el precio del chip.
  • Google, AWS, Microsoft y Meta buscan controlar los costes y la cadena de suministro mediante aceleradores adaptados a sus propias cargas de trabajo.
  • NVIDIA y AMD responden a los chips personalizados combinando versatilidad, ecosistemas de desarrollo y optimización a escala de rack.
  • En la práctica, una métrica más útil que el simple coste por token es el coste por tarea completada con éxito, que refleja la calidad y los reintentos.

La competencia en semiconductores para IA generativa está ampliando sus criterios, desde la capacidad máxima de cómputo hasta la rentabilidad real del servicio. El término informal rentabilidad de tokens, utilizado en el sector, se refiere a cuántos tokens pueden procesarse de forma útil con un coste o una cantidad de energía determinados.

Sin embargo, el token más barato no siempre produce el resultado más económico. Para evaluar la competitividad real, también deben medirse la precisión del modelo, la latencia de respuesta, el número de reintentos y la tasa de utilización del centro de datos.

Qué es la rentabilidad de tokens

Un token es una unidad de procesamiento de texto que los modelos de lenguaje utilizan al leer entradas y generar salidas. Los proveedores de API suelen fijar precios distintos para los tokens de entrada y de salida, y a veces aplican una tarifa separada a las entradas almacenadas en caché.

La rentabilidad de tokens no es un término contable oficial ni un benchmark estandarizado. En la práctica, deben distinguirse los siguientes indicadores.

Indicador Significado Elementos fáciles de pasar por alto
Tokens por dólar Número de tokens procesados con el mismo coste Calidad, latencia y diferencia de precio entre entrada y salida
Tokens por segundo Velocidad de procesamiento de la generación Número de usuarios simultáneos y latencia del primer token
Tokens por vatio Eficiencia energética Pérdidas de refrigeración y conversión eléctrica
Rendimiento por servidor Rendimiento total de un servidor o rack Baja utilización y tiempo de espera
Coste por tarea exitosa Coste total necesario para completar el objetivo Reintentos, llamadas a herramientas y rutas fallidas

Conceptualmente, el coste total por token puede expresarse del siguiente modo.

Coste total por token = depreciación + electricidad y refrigeración + memoria y red + costes operativos + costes de software ÷ tokens procesados válidos

Aquí, los tokens procesados válidos no se refieren simplemente al volumen generado, sino a los tokens que cumplen los criterios de calidad del servicio. Como los distintos modelos utilizan tokenizadores y longitudes de respuesta diferentes, comparar directamente solo el precio por 1 millón de tokens puede producir distorsiones.

Por qué el coste de inferencia está cambiando la competencia entre semiconductores

El coste se repite cada vez que se utiliza el servicio

El entrenamiento a gran escala es una fase en la que se concentra un coste enorme, pero no constituye un gasto completamente único. Después del preentrenamiento también se repiten el ajuste fino, el aprendizaje por refuerzo, la evaluación y el entrenamiento de nuevas versiones. Aun así, el coste de inferencia generado con cada solicitud del usuario influye más directamente en el modelo de negocio, ya que aumenta casi al mismo ritmo que el crecimiento del servicio.

Stanford AI Index 2025 analizó que el coste de inferencia necesario para ofrecer un determinado nivel de rendimiento del modelo había caído rápidamente. Este resultado no solo se debe a las mejoras de los semiconductores, sino también a los modelos pequeños, la cuantización, los motores de inferencia y el aumento de la competencia. Cuando baja el coste unitario, más funciones pasan a ser rentables, aunque también puede aparecer el efecto Jevons, por el que el aumento del uso compensa la reducción del coste unitario.

Los agentes de IA amplifican el uso de tokens

En un chatbot convencional, las preguntas y respuestas suelen terminar con relativa brevedad. En cambio, un agente de IA puede repetir las siguientes tareas.

  • Elaboración y revisión de planes
  • Lectura de documentos extensos o repositorios de código
  • Llamadas a herramientas como buscadores, bases de datos y terminales
  • Revisión de resultados de ejecución y corrección de errores
  • Generación y evaluación de varios candidatos

Cuanto más se prolongan las etapas de una tarea, más se acumulan el contexto de entrada, el razonamiento intermedio, los resultados de las herramientas y los reintentos. En la era de los agentes, el coste total de completar con éxito una tarea es más importante que el precio de una sola llamada al modelo.

La electricidad y las instalaciones crean el límite real de suministro

Aunque se consigan aceleradores de IA, no pueden ponerse en funcionamiento si faltan conexiones eléctricas, refrigeración, memoria de gran ancho de banda, redes o espacio en los centros de datos. Por eso, los tokens por vatio y los tokens por rack tienen un significado que va más allá del ahorro en la factura eléctrica. Determinan el volumen de servicio que puede ofrecerse con una capacidad eléctrica limitada.

Estrategias de hardware para reducir el coste por token

1. Aceleradores propios adaptados a cargas de trabajo específicas

Las GPU de propósito general admiten diversos modelos y operaciones, pero esa flexibilidad tiene un coste. Los grandes proveedores de nube pueden analizar las cargas de trabajo internas que ejecutan repetidamente, eliminar funciones innecesarias y optimizar las rutas de movimiento de datos.

Empresa Familia de aceleradores anunciada Orientación principal Precauciones al interpretarla
Google TPU, Ironwood Codiseño del modelo, el compilador y la infraestructura de nube No puede darse por hecho que se reproduzca la misma eficiencia fuera del entorno interno de Google
AWS Trainium, Inferentia Chips exclusivos de AWS y software Neuron adaptados al entrenamiento y la inferencia Deben comprobarse las operaciones compatibles y el coste de migración de los modelos
Microsoft Maia 100 Acelerador propio para cargas de trabajo de Azure AI Es difícil calcular el coste de las cargas de trabajo comerciales solo con las especificaciones públicas
Meta MTIA Optimización de cargas de trabajo internas de inferencia a gran escala, como recomendación y clasificación No es un chip LLM de propósito general que sustituya a todos los modelos de IA generativa

Ironwood, presentado por Google en 2025, es una TPU de séptima generación diseñada principalmente para la inferencia. Es más preciso entenderlo como parte de una estrategia de integración vertical que optimiza conjuntamente los modelos de Google, el compilador XLA y los centros de datos, en lugar de considerarlo un chip ligado exclusivamente a un único modelo Gemini.

El objetivo de los chips propios no se limita a reducir el coste de adquisición. También intervienen el control del calendario de suministro, la mejora de la eficiencia energética, la optimización de las cargas de trabajo internas y el fortalecimiento del poder de negociación frente a proveedores externos.

2. Diseñar todo el rack como un único ordenador

Como los modelos grandes no caben en la memoria de un solo acelerador, se distribuyen entre varios. En ese caso, el rendimiento puede depender más de la velocidad de comunicación entre aceleradores, el ancho de banda de la memoria y la planificación del software que de la capacidad de cómputo de cada chip.

La plataforma NVIDIA Blackwell ha puesto en primer plano un enfoque a escala de rack que integra GPU, CPU, NVLink, redes y software. AMD también está reforzando sus aceleradores Instinct, su ecosistema de software abierto y sus sistemas a escala de rack. En esta competencia, los siguientes elementos son más importantes que los benchmarks de un solo chip.

  • Número de solicitudes que pueden procesarse simultáneamente en un rack
  • Coste de mover pesos y KV cache entre aceleradores
  • Capacidad de utilizar los equipos restantes cuando se produce un fallo
  • Rendimiento sostenido dentro de los límites de suministro eléctrico y refrigeración
  • Tiempo de desarrollo necesario para desplegar realmente un modelo

Aunque el precio del rack sea elevado, el coste por token puede bajar si la utilización y el rendimiento son suficientemente altos. Por el contrario, incluso un chip barato pierde rentabilidad si permanece inactivo durante mucho tiempo debido a la inmadurez del software o a cuellos de botella en las comunicaciones.

3. Reducir los límites de comunicación a escala de oblea

Cerebras desarrolló la familia WSE, que utiliza procesadores del tamaño de una oblea en lugar de múltiples chips individuales convencionales. Este enfoque sitúa grandes recursos de cómputo y ancho de banda de memoria en una sola oblea para reducir parte de la comunicación entre chips que se produce en los clústeres tradicionales.

La arquitectura a escala de oblea puede aspirar a una baja latencia y un alto rendimiento, pero no elimina todas las comunicaciones. Al conectar varios sistemas u operar modelos grandes, siguen siendo necesarios la memoria externa, la red, la recuperación ante fallos y el compilador. Tampoco pueden compararse directamente los récords de tokens por segundo de modelos específicos cuando difieren la precisión, el tamaño del lote, la longitud del contexto y las condiciones de salida.

4. Priorizar la optimización de la memoria y del movimiento de datos

En la inferencia, el proceso de mover los pesos del modelo y el KV cache suele convertirse en un cuello de botella mayor que el propio cálculo. En particular, la fase de decodificación, que genera los tokens uno a uno, está muy condicionada por el ancho de banda de la memoria.

Esta es la razón por la que los proveedores de hardware destacan la memoria de gran ancho de banda, los chiplets, las interconexiones de alta velocidad y las cachés de mayor tamaño. Aunque las cifras de rendimiento computacional sean elevadas, el rendimiento real de tokens no aumenta si los datos necesarios no se suministran a tiempo.

5. Codiseñar el hardware y el software de inferencia

La rentabilidad de tokens no está determinada únicamente por los semiconductores. Incluso con el mismo hardware, el rendimiento puede variar considerablemente según las siguientes técnicas.

  • Cuantización: reduce la precisión de los pesos y de las operaciones para disminuir el uso de memoria y el volumen de cálculo.
  • Procesamiento continuo por lotes: agrupa eficientemente solicitudes con distintas horas de llegada.
  • Almacenamiento en caché de prefijos: reutiliza los cálculos de prompts del sistema y contextos repetidos.
  • Decodificación especulativa: un modelo pequeño genera candidatos de tokens y un modelo grande los verifica.
  • Separación de prefill y decode: asigna el procesamiento de entrada y la generación de salida a recursos distintos.
  • Enrutamiento de modelos dispersos: activa solo algunos de los expertos necesarios en los modelos Mixture-of-Experts.

Los chips personalizados solo resultan eficaces cuando el compilador y el modelo están preparados conjuntamente. CUDA es una importante barrera defensiva para NVIDIA porque ya existe un ecosistema acumulado que incluye bibliotecas, herramientas de desarrollo, conocimientos de optimización y personal especializado.

Por qué la dependencia de NVIDIA no desaparece rápidamente

Las empresas que introducen chips propios o aceleradores AMD también pueden utilizar simultáneamente sistemas NVIDIA. Esto se asemeja más a una distribución de cargas de trabajo que a una contradicción estratégica.

Las fortalezas de NVIDIA son las siguientes.

  1. Compatibilidad con CUDA y una amplia gama de bibliotecas de IA
  2. Versatilidad para probar rápidamente modelos nuevos
  3. Madurez integral en servidores, redes y software de gestión
  4. Experiencia acumulada de desarrolladores y personal de operaciones
  5. Amplia disponibilidad entre proveedores de nube y fabricantes de servidores

En cambio, los ASIC propios tienden a obtener ventajas en cargas de trabajo a gran escala, constantes y repetitivas. Por tanto, es probable que el mercado evolucione hacia una estructura en la que las GPU de propósito general y los aceleradores especializados se repartan las funciones, en lugar de que un único tipo de chip sustituya a todos los demás.

Condiciones que deben controlarse al comparar la rentabilidad de tokens

El rendimiento máximo o los porcentajes de ahorro anunciados por los proveedores no pueden compararse directamente si no proceden de benchmarks independientes realizados bajo las mismas condiciones. Como mínimo, deben igualarse las siguientes condiciones.

Condición de comparación Impacto en el coste
Modelo y número de parámetros Cambian la memoria y el volumen de cálculo necesarios
Precisión numérica La velocidad y la calidad difieren entre FP8, BF16, INT8 y otros formatos
Longitud de entrada y salida Cambia la proporción de prefill y decode
Tamaño del lote y solicitudes simultáneas Cambia el equilibrio entre rendimiento y latencia
Latencia del primer token Determina la calidad percibida de un servicio en tiempo real
Tasa de utilización Sirve como base para dividir los costes fijos entre el rendimiento real
Alcance energético Varía según si se mide solo el chip o también se incluyen la refrigeración y la red
Calidad de la respuesta Una respuesta breve pero incorrecta genera costes de reintento

Los resultados que especifican el modelo, el escenario y las condiciones de calidad, como MLPerf Inference de MLCommons, son relativamente útiles. Sin embargo, ni siquiera los benchmarks públicos pueden reproducir por completo la configuración de modelos, los costes eléctricos regionales y los patrones de tráfico reales de cada empresa.

Más allá del simple precio por token: coste por tarea exitosa

Los tokens son fáciles de medir, pero no representan directamente el valor del resultado final. Aunque el modelo A tenga un precio por token inferior al del modelo B, el coste de completar una tarea puede ser mayor si produce respuestas más largas o falla con frecuencia.

Para los servicios de agentes resulta más adecuado el siguiente cálculo.

Coste por tarea exitosa = coste total de modelos, herramientas e infraestructura ÷ número de tareas que superan los criterios de calidad

Esto incluye no solo el coste de los tokens, sino también las API de búsqueda, la ejecución de código, las bases de datos, la revisión humana, los intentos fallidos y los costes causados por la latencia. Esta perspectiva suele quedar fuera de la competencia por el rendimiento puro y del debate sobre la rentabilidad de tokens.

Cómo distinguir las afirmaciones públicas de las cifras no verificadas

Las hojas de ruta de productos y las previsiones del mercado de semiconductores cambian con frecuencia. Entre algunos de los nombres y cifras incluidos en los materiales proporcionados, no se utilizaron como hechos confirmados aquellos que no estaban suficientemente verificados mediante documentación oficial del producto o benchmarks reproducibles. Entre ellos se encuentran Frozen V2 y Claude Fable 5, descritos como exclusivos para modelos específicos, la velocidad de Cerebras con determinados modelos no anunciados, los costes fijos por 1 millón de tokens de cada chip y las futuras cifras de cuota de mercado.

Además, las siguientes expresiones exigen comprobar sus condiciones.

  • Eficiencia de hasta 10 veces: deben comprobarse el objeto de comparación, la precisión y el alcance del sistema.
  • Reducción del 50% en el coste de tokens: deben especificarse el modelo, la región, la utilización y las condiciones de depreciación.
  • Cientos de tokens por segundo: debe distinguirse si se trata de la velocidad de un solo usuario o del rendimiento total.
  • Abandono de NVIDIA: debe comprobarse si se trata de una sustitución completa o de la migración de parte de las cargas de trabajo internas.

Para tomar decisiones de inversión o adquisición de infraestructura, no deben utilizarse únicamente los materiales de presentación; también deben revisarse los benchmarks independientes, los calendarios reales de suministro, el alcance de la compatibilidad del software y el coste total de propiedad.

Conclusión del mercado

La competencia en semiconductores de IA está pasando de una etapa centrada únicamente en la velocidad máxima a otra en la que se compite por producir tokens y completar tareas que cumplan los criterios de calidad con el menor coste total posible.

Los ASIC personalizados buscan una alta eficiencia en cargas de trabajo repetitivas y a gran escala, mientras que las GPU de propósito general responden con compatibilidad flexible con distintos modelos y un ecosistema maduro. El diseño a escala de rack, el ancho de banda de la memoria, las redes, la energía y el software de inferencia se han vuelto tan importantes como el propio chip.

En definitiva, el indicador que determina al ganador no es simplemente el número de tokens por segundo ni el precio por 1 millón de tokens. El coste total por tarea exitosa, que refleja la calidad, la latencia, la utilización y las limitaciones energéticas del tráfico real, es un criterio más preciso.

Inicio de sesión requerido

Inicia sesión con tu cuenta de Google para dar me gusta, comentar y guardar frases.

Imágenes

La ilustración representa el equilibrio entre energía, rendimiento y coste en la infraestructura de IA.
El gráfico contrasta rutas fragmentadas con un sistema integrado de chips de IA más eficiente.

Preguntas frecuentes

¿Es la relación coste-rendimiento de tokens un indicador oficial del rendimiento de los semiconductores de IA?

No. La relación coste-rendimiento de tokens es una expresión informal abreviada. Al hacer comparaciones, se deben distinguir los tokens por dólar, los tokens por vatio, los tokens por segundo, la latencia del primer token y el coste por tarea completada con éxito.

¿Por qué el coste de la inferencia se ha vuelto más importante que el del entrenamiento?

Aunque el entrenamiento y el posprocesamiento también requieren inversiones recurrentes, la inferencia genera costes cada vez que un usuario realiza una solicitud. A medida que aumentan el uso del servicio y las etapas de trabajo de los agentes, siguen acumulándose los costes de electricidad, tiempo de acelerador, memoria y red.

¿Por qué los agentes de IA utilizan más tokens que los chatbots convencionales?

Los agentes de IA repiten procesos de planificación, búsqueda, llamada a herramientas, revisión de resultados y corrección de errores. En cada etapa se vuelven a introducir el contexto y los resultados intermedios, y las rutas fallidas también generan costes, por lo que el uso total de tokens puede aumentar.

¿Los chips de IA propios son siempre más baratos que las GPU de NVIDIA?

No siempre. Los chips propios pueden aumentar la eficiencia en cargas de trabajo internas constantes y repetitivas, pero la portabilidad de modelos, los compiladores, el personal de operaciones y una baja tasa de utilización pueden generar costes adicionales. Deben compararse según el coste total de propiedad, incluida la versatilidad y la velocidad de desarrollo.

Si la cantidad de tokens por segundo es alta, ¿también disminuye el coste por token?

No necesariamente. Los tokens por segundo son un indicador de velocidad y pueden no reflejar el precio del equipo, el consumo eléctrico, el número de solicitudes simultáneas ni la tasa de utilización. La velocidad de generación para un solo usuario y el rendimiento total del servidor también son indicadores diferentes.

¿Se pueden comparar directamente los precios de un millón de tokens de distintos modelos?

Hay que tener cuidado. Cada modelo tiene un tokenizador, una longitud media de respuesta, una precisión y una política de caché diferentes. Se deben comparar conjuntamente los tokens de entrada y salida necesarios, el número de reintentos y los costes de las herramientas para la misma tarea y con los mismos criterios de calidad.

¿Qué significa que la dependencia de CUDA sea fuerte?

Significa que el código, las bibliotecas, los métodos de optimización y el personal de desarrollo de las empresas se han consolidado en el entorno NVIDIA CUDA. Al migrar a otros aceleradores, pueden surgir costes por la modificación del código, la verificación del rendimiento y la reconstrucción de los sistemas operativos.

¿Cuál es el mejor indicador para evaluar la rentabilidad real de los semiconductores de IA?

Depende del objetivo del servicio, pero para los agentes y la automatización de tareas resulta útil el coste total por tarea completada con éxito. Este indicador refleja no solo los tokens, sino también la calidad, los reintentos, las llamadas a herramientas, la latencia, la electricidad y el coste de la revisión humana.

Fuentes

Formatos de datos

Este contenido está disponible en varios formatos amigables para máquinas.

Idiomas solo de datos (traducción automática, solo archivos)

Indonesio JSON MD Portugués JSON MD Chino (tradicional) JSON MD Alemán JSON MD

Reutilización y uso por IA

La indexación en buscadores y la citación por IA con atribución son bienvenidas. Consulte la política de licencias para más detalles.

CC BY · Licencia

Cargando…

Cargando…

Contenido relacionado

Servicios de Injoys

Pide el contenido que quieres y recibe el 70% de lo que genere

Solo deja el tema. Nosotros nos ocupamos de la producción, la revisión, la traducción y la difusión.

Ver el reparto de ingresos

Comentarios