La competencia en semiconductores para IA generativa está ampliando sus criterios, desde la capacidad máxima de cómputo hasta la rentabilidad real del servicio. El término informal rentabilidad de tokens, utilizado en el sector, se refiere a cuántos tokens pueden procesarse de forma útil con un coste o una cantidad de energía determinados.
Sin embargo, el token más barato no siempre produce el resultado más económico. Para evaluar la competitividad real, también deben medirse la precisión del modelo, la latencia de respuesta, el número de reintentos y la tasa de utilización del centro de datos.
Qué es la rentabilidad de tokens
Un token es una unidad de procesamiento de texto que los modelos de lenguaje utilizan al leer entradas y generar salidas. Los proveedores de API suelen fijar precios distintos para los tokens de entrada y de salida, y a veces aplican una tarifa separada a las entradas almacenadas en caché.
La rentabilidad de tokens no es un término contable oficial ni un benchmark estandarizado. En la práctica, deben distinguirse los siguientes indicadores.
| Indicador | Significado | Elementos fáciles de pasar por alto |
|---|---|---|
| Tokens por dólar | Número de tokens procesados con el mismo coste | Calidad, latencia y diferencia de precio entre entrada y salida |
| Tokens por segundo | Velocidad de procesamiento de la generación | Número de usuarios simultáneos y latencia del primer token |
| Tokens por vatio | Eficiencia energética | Pérdidas de refrigeración y conversión eléctrica |
| Rendimiento por servidor | Rendimiento total de un servidor o rack | Baja utilización y tiempo de espera |
| Coste por tarea exitosa | Coste total necesario para completar el objetivo | Reintentos, llamadas a herramientas y rutas fallidas |
Conceptualmente, el coste total por token puede expresarse del siguiente modo.
Coste total por token = depreciación + electricidad y refrigeración + memoria y red + costes operativos + costes de software ÷ tokens procesados válidos
Aquí, los tokens procesados válidos no se refieren simplemente al volumen generado, sino a los tokens que cumplen los criterios de calidad del servicio. Como los distintos modelos utilizan tokenizadores y longitudes de respuesta diferentes, comparar directamente solo el precio por 1 millón de tokens puede producir distorsiones.
Por qué el coste de inferencia está cambiando la competencia entre semiconductores
El coste se repite cada vez que se utiliza el servicio
El entrenamiento a gran escala es una fase en la que se concentra un coste enorme, pero no constituye un gasto completamente único. Después del preentrenamiento también se repiten el ajuste fino, el aprendizaje por refuerzo, la evaluación y el entrenamiento de nuevas versiones. Aun así, el coste de inferencia generado con cada solicitud del usuario influye más directamente en el modelo de negocio, ya que aumenta casi al mismo ritmo que el crecimiento del servicio.
Stanford AI Index 2025 analizó que el coste de inferencia necesario para ofrecer un determinado nivel de rendimiento del modelo había caído rápidamente. Este resultado no solo se debe a las mejoras de los semiconductores, sino también a los modelos pequeños, la cuantización, los motores de inferencia y el aumento de la competencia. Cuando baja el coste unitario, más funciones pasan a ser rentables, aunque también puede aparecer el efecto Jevons, por el que el aumento del uso compensa la reducción del coste unitario.
Los agentes de IA amplifican el uso de tokens
En un chatbot convencional, las preguntas y respuestas suelen terminar con relativa brevedad. En cambio, un agente de IA puede repetir las siguientes tareas.
- Elaboración y revisión de planes
- Lectura de documentos extensos o repositorios de código
- Llamadas a herramientas como buscadores, bases de datos y terminales
- Revisión de resultados de ejecución y corrección de errores
- Generación y evaluación de varios candidatos
Cuanto más se prolongan las etapas de una tarea, más se acumulan el contexto de entrada, el razonamiento intermedio, los resultados de las herramientas y los reintentos. En la era de los agentes, el coste total de completar con éxito una tarea es más importante que el precio de una sola llamada al modelo.
La electricidad y las instalaciones crean el límite real de suministro
Aunque se consigan aceleradores de IA, no pueden ponerse en funcionamiento si faltan conexiones eléctricas, refrigeración, memoria de gran ancho de banda, redes o espacio en los centros de datos. Por eso, los tokens por vatio y los tokens por rack tienen un significado que va más allá del ahorro en la factura eléctrica. Determinan el volumen de servicio que puede ofrecerse con una capacidad eléctrica limitada.
Estrategias de hardware para reducir el coste por token
1. Aceleradores propios adaptados a cargas de trabajo específicas
Las GPU de propósito general admiten diversos modelos y operaciones, pero esa flexibilidad tiene un coste. Los grandes proveedores de nube pueden analizar las cargas de trabajo internas que ejecutan repetidamente, eliminar funciones innecesarias y optimizar las rutas de movimiento de datos.
| Empresa | Familia de aceleradores anunciada | Orientación principal | Precauciones al interpretarla |
|---|---|---|---|
| TPU, Ironwood | Codiseño del modelo, el compilador y la infraestructura de nube | No puede darse por hecho que se reproduzca la misma eficiencia fuera del entorno interno de Google | |
| AWS | Trainium, Inferentia | Chips exclusivos de AWS y software Neuron adaptados al entrenamiento y la inferencia | Deben comprobarse las operaciones compatibles y el coste de migración de los modelos |
| Microsoft | Maia 100 | Acelerador propio para cargas de trabajo de Azure AI | Es difícil calcular el coste de las cargas de trabajo comerciales solo con las especificaciones públicas |
| Meta | MTIA | Optimización de cargas de trabajo internas de inferencia a gran escala, como recomendación y clasificación | No es un chip LLM de propósito general que sustituya a todos los modelos de IA generativa |
Ironwood, presentado por Google en 2025, es una TPU de séptima generación diseñada principalmente para la inferencia. Es más preciso entenderlo como parte de una estrategia de integración vertical que optimiza conjuntamente los modelos de Google, el compilador XLA y los centros de datos, en lugar de considerarlo un chip ligado exclusivamente a un único modelo Gemini.
El objetivo de los chips propios no se limita a reducir el coste de adquisición. También intervienen el control del calendario de suministro, la mejora de la eficiencia energética, la optimización de las cargas de trabajo internas y el fortalecimiento del poder de negociación frente a proveedores externos.
2. Diseñar todo el rack como un único ordenador
Como los modelos grandes no caben en la memoria de un solo acelerador, se distribuyen entre varios. En ese caso, el rendimiento puede depender más de la velocidad de comunicación entre aceleradores, el ancho de banda de la memoria y la planificación del software que de la capacidad de cómputo de cada chip.
La plataforma NVIDIA Blackwell ha puesto en primer plano un enfoque a escala de rack que integra GPU, CPU, NVLink, redes y software. AMD también está reforzando sus aceleradores Instinct, su ecosistema de software abierto y sus sistemas a escala de rack. En esta competencia, los siguientes elementos son más importantes que los benchmarks de un solo chip.
- Número de solicitudes que pueden procesarse simultáneamente en un rack
- Coste de mover pesos y KV cache entre aceleradores
- Capacidad de utilizar los equipos restantes cuando se produce un fallo
- Rendimiento sostenido dentro de los límites de suministro eléctrico y refrigeración
- Tiempo de desarrollo necesario para desplegar realmente un modelo
Aunque el precio del rack sea elevado, el coste por token puede bajar si la utilización y el rendimiento son suficientemente altos. Por el contrario, incluso un chip barato pierde rentabilidad si permanece inactivo durante mucho tiempo debido a la inmadurez del software o a cuellos de botella en las comunicaciones.
3. Reducir los límites de comunicación a escala de oblea
Cerebras desarrolló la familia WSE, que utiliza procesadores del tamaño de una oblea en lugar de múltiples chips individuales convencionales. Este enfoque sitúa grandes recursos de cómputo y ancho de banda de memoria en una sola oblea para reducir parte de la comunicación entre chips que se produce en los clústeres tradicionales.
La arquitectura a escala de oblea puede aspirar a una baja latencia y un alto rendimiento, pero no elimina todas las comunicaciones. Al conectar varios sistemas u operar modelos grandes, siguen siendo necesarios la memoria externa, la red, la recuperación ante fallos y el compilador. Tampoco pueden compararse directamente los récords de tokens por segundo de modelos específicos cuando difieren la precisión, el tamaño del lote, la longitud del contexto y las condiciones de salida.
4. Priorizar la optimización de la memoria y del movimiento de datos
En la inferencia, el proceso de mover los pesos del modelo y el KV cache suele convertirse en un cuello de botella mayor que el propio cálculo. En particular, la fase de decodificación, que genera los tokens uno a uno, está muy condicionada por el ancho de banda de la memoria.
Esta es la razón por la que los proveedores de hardware destacan la memoria de gran ancho de banda, los chiplets, las interconexiones de alta velocidad y las cachés de mayor tamaño. Aunque las cifras de rendimiento computacional sean elevadas, el rendimiento real de tokens no aumenta si los datos necesarios no se suministran a tiempo.
5. Codiseñar el hardware y el software de inferencia
La rentabilidad de tokens no está determinada únicamente por los semiconductores. Incluso con el mismo hardware, el rendimiento puede variar considerablemente según las siguientes técnicas.
- Cuantización: reduce la precisión de los pesos y de las operaciones para disminuir el uso de memoria y el volumen de cálculo.
- Procesamiento continuo por lotes: agrupa eficientemente solicitudes con distintas horas de llegada.
- Almacenamiento en caché de prefijos: reutiliza los cálculos de prompts del sistema y contextos repetidos.
- Decodificación especulativa: un modelo pequeño genera candidatos de tokens y un modelo grande los verifica.
- Separación de prefill y decode: asigna el procesamiento de entrada y la generación de salida a recursos distintos.
- Enrutamiento de modelos dispersos: activa solo algunos de los expertos necesarios en los modelos Mixture-of-Experts.
Los chips personalizados solo resultan eficaces cuando el compilador y el modelo están preparados conjuntamente. CUDA es una importante barrera defensiva para NVIDIA porque ya existe un ecosistema acumulado que incluye bibliotecas, herramientas de desarrollo, conocimientos de optimización y personal especializado.
Por qué la dependencia de NVIDIA no desaparece rápidamente
Las empresas que introducen chips propios o aceleradores AMD también pueden utilizar simultáneamente sistemas NVIDIA. Esto se asemeja más a una distribución de cargas de trabajo que a una contradicción estratégica.
Las fortalezas de NVIDIA son las siguientes.
- Compatibilidad con CUDA y una amplia gama de bibliotecas de IA
- Versatilidad para probar rápidamente modelos nuevos
- Madurez integral en servidores, redes y software de gestión
- Experiencia acumulada de desarrolladores y personal de operaciones
- Amplia disponibilidad entre proveedores de nube y fabricantes de servidores
En cambio, los ASIC propios tienden a obtener ventajas en cargas de trabajo a gran escala, constantes y repetitivas. Por tanto, es probable que el mercado evolucione hacia una estructura en la que las GPU de propósito general y los aceleradores especializados se repartan las funciones, en lugar de que un único tipo de chip sustituya a todos los demás.