AMD graba la IA directamente en el silicio: 70 veces más rápido que una GPU

IAChipAMDHardware

Fuentes:HN + web research · HN

El gigante de los semiconductores AMD ha adquirido una empresa dedicada a grabar modelos de inteligencia artificial directamente en obleas de silicio. La startup Taalas, fundada en Toronto en 2023, afirma que su chip ejecuta la IA 48 veces más rápido que las GPU de gama alta, generando 17.000 tokens por segundo con un consumo energético sustancialmente menor. El importe de la adquisición no se ha revelado y se prevé que la transacción se complete en el cuarto trimestre de este año. En un momento en que la industria de la IA se enfrenta a una guerra de precios provocada por el elevado coste operativo de la inferencia, esta adquisición de AMD representa una apuesta firme por una vía tecnológica completamente distinta.

Qué es un modelo: Una larga cadena de números, una receta

Para entender lo que significa «grabar la IA en el silicio», primero hay que comprender qué es un modelo de IA. Un modelo de lenguaje entrenado es esencialmente una inmensa secuencia de números —desde miles de millones hasta billones— conocidos en la industria como «pesos» (weights). Estos números determinan la forma en que la IA responde: al detectar «El tiempo hoy está», predice «agradable». A modo de analogía, un modelo equivale a una receta de cocina: gramos exactos de harina, azúcar y minutos de horneado; un conjunto de cifras que definen cada paso de la preparación.

¿Cómo ejecuta la IA una tarjeta gráfica (GPU)? Funciona como un menaje de cocina universal. La receta se coloca en la mesa, los ingredientes sobre la encimera, y la GPU lee las instrucciones mientras pesa los ingredientes y cocina simultáneamente. Su ventaja es la versatilidad: puede preparar cualquier plato imaginable. El inconveniente es la ineficiencia: para cada plato debe volver a leer la receta y pesar los ingredientes, consumiendo tiempo y energía.

Taalas ha cambiado de enfoque: graba la receta directamente en la base de la olla. La propia olla sabe cómo preparar ese plato específico, sin necesidad de leer instrucciones ni pesar ingredientes; basta con encender el fuego y el plato está listo. Esta «olla» está diseñada a la medida de un único plato: un modelo de IA concreto. En el instante en que el chip sale de la fábrica, los valores del modelo quedan grabados permanentemente en el silicio en forma de circuitos físicos. Este chip solo puede ejecutar ese modelo y nada más, pero al hacerlo, su velocidad es asombrosa.

Placa de demostración Taalas HC1 Figura: Placa de demostración HC1 de Taalas, donde el modelo está fijado en el chip en forma de circuitos integrados. Fuente: taalas.com

17.000 tokens por segundo: Un libro entero escrito en segundos

Taalas no ofrece meras promesas teóricas. En febrero de este año fabricó su primer chip de prueba, el HC1, utilizando el proceso de 6 nanómetros de TSMC. Grabado en su estructura se encuentra el modelo de código abierto Llama 3.1 8B de Meta, con 8.000 millones de parámetros. Las pruebas reales registraron una velocidad de generación de 17.000 tokens por segundo. Un token es la unidad básica de texto para la IA y equivale aproximadamente a entre media palabra y una palabra completa.

Para dimensionar esta velocidad con criterios cotidianos: los servicios actuales como ChatGPT generan texto para los usuarios a un ritmo de varias decenas de tokens por segundo, una velocidad que el ojo humano apenas logra seguir. Alcanzar 17.000 tokens por segundo equivale a decenas de miles de palabras por segundo, lo que permite generar un libro de 100.000 palabras en unos diez segundos. Las cifras comparativas oficiales indican que es 48 veces más rápido que las GPU de NVIDIA. Tomando como referencia la GPU NVIDIA H200 (~230 tokens/s frente a 17.000 tokens/s), la diferencia se aproxima a las 74 veces. Independientemente de la métrica empleada, la magnitud de la aceleración es aplastante.

Gráfico comparativo de rendimiento oficial de Taalas Figura: Comparativa oficial de Taalas sobre tokens por segundo por usuario para el modelo Llama 3.1 8B (NVIDIA H200 como referencia). Fuente: taalas.com

Desde la perspectiva de la ingeniería, estos datos representan escenarios ideales para un solo usuario y un solo modelo, por lo que el rendimiento real en un centro de datos sufrirá cierto descuento. Sin embargo, aun reduciendo las cifras a la mitad, resulta suficiente para redefinir la viabilidad económica de la IA.

Por qué esto es valioso: Cada respuesta de la IA quema dinero

La operación de la IA implica dos fases de gasto. El entrenamiento, que consiste en alimentar al modelo con datos, puede costar más de cien millones de dólares por sesión, pero solo se realiza una vez. La inferencia, en cambio, implica calcular una respuesta cada vez que un usuario realiza una consulta, lo que representa un gasto operativo continuo. Cada vez que usted pregunta a ChatGPT, las GPU del centro de datos funcionan a pleno rendimiento consumiendo electricidad.

El coste de inferencia es actualmente el principal cuello de botella para la adopción masiva de la IA. Durante los últimos dos años, las empresas tecnológicas han librado una guerra de precios reduciendo los costes de las API a expensas de sus márgenes. Taalas propone una solución de arquitectura: al grabar el modelo en el silicio, se elimina la necesidad de leer y transferir repetidamente cientos de gigabytes de pesos desde la memoria. Los propios circuitos son los datos. En una entrevista en febrero, Taalas afirmó que el coste de grabar un modelo en silicio es 100 veces menor que el de entrenar un modelo de vanguardia. Aunque se trata de una métrica propia pendiente de verificación independiente, el planteamiento es lógico: por elevado que sea el coste de fabricación de un chip a medida, nunca superará el coste de entrenar un modelo de cientos de miles de millones de parámetros.

Menaje universal vs. Olla a medida: El enfrentamiento de dos filosofías

En este punto se hace evidente el debate entre dos filosofías de diseño.

Las GPU representan la vía universal: pueden ejecutar cualquier modelo. Cuando el modelo evoluciona, basta con actualizar el software sin alterar el hardware. El peaje es la eficiencia: para poder calcular «cualquier cosa», el chip incorpora una enorme cantidad de lógica genérica que consume energía, genera calor y limita la velocidad.

Taalas representa la vía especializada: diseñada para un único modelo, su arquitectura se simplifica al máximo, resultando extremadamente rápida, eficiente y económica. La contrapartida es la rigidez: el día en que el chip sale de fábrica, el modelo queda congelado. Los cartuchos de videojuegos funcionan bajo la misma lógica: se insertan y ejecutan al instante sin tiempos de carga, pero si sale un nuevo juego, es necesario comprar un cartucho nuevo. Los juegos digitales se pueden actualizar en cualquier momento, pero requieren tiempo de espera y ancho de banda.

El ritmo de actualización de los modelos de IA es mensual. El modelo grabado en el chip HC1 de Taalas data de mediados de 2024, lo que bajo los estándares actuales resulta obsoleto. Si un modelo cambia, los circuitos físicos del chip no pueden adaptarse automáticamente. Las modificaciones menores pueden parchearse en tiempo real (a través de adaptadores LoRA, equivalentes a añadir notas adhesivas a una receta impresa); pero los cambios estructurales exigen fabricar un nuevo chip desde cero (re-tapeout). Según Taalas, cambiar de modelo solo requiere rediseñar dos capas metálicas, lo que resulta mucho más barato que un diseño completo, pero sigue exigiendo capacidad de producción en las fundiciones y tiempos de espera. ¿Qué modelo merece ser grabado en el silicio? Únicamente aquellos ampliamente verificados y destinados a dar servicio durante años. Una apuesta equivocada convierte armarios enteros de servidores en chatarra electrónica.

Por qué AMD hace esta apuesta

NVIDIA domina la mayor parte del mercado de chips de IA. AMD ha mantenido una persecución de años y ha logrado igualar el rendimiento del hardware, pero el ecosistema de software sigue siendo su asignatura pendiente: los desarrolladores de IA de todo el mundo están habituados a las herramientas CUDA de NVIDIA. Dado que competir frontalmente en el ecosistema de software es complejo, AMD ha decidido cambiar de terreno de juego apostando por el mercado emergente de los chips dedicados a modelos específicos.

La competencia no se ha quedado de brazos cruzados. El pasado mes de diciembre, NVIDIA firmó un acuerdo de licencia de 20.000 millones de dólares con la empresa de chips de inferencia Groq, persiguiendo exactamente el mismo objetivo: hacer que la inferencia de IA sea más rápida y económica. Ambos gigantes están invirtiendo en la misma dirección estratégica a través de diferentes planteamientos.

El fundador de Taalas, Ljubisa Bajic, fue director ejecutivo de Tenstorrent y exempleado de AMD, por lo que esta adquisición supone en cierta medida un regreso a casa. Su equipo se integrará en la división de IA de AMD. Según análisis de The Register, la intención de AMD pasa por combinar los chips de Taalas con sus propias GPU Instinct: las GPU se encargarán de procesar el contexto inicial de las consultas y los chips de Taalas asumirán la generación ultra rápida de respuestas, aprovechando lo mejor de cada arquitectura. Las declaraciones oficiales de AMD han sido cautas, limitándose a señalar que la compra busca «ofrecer la solución de cómputo adecuada para cada tipo de carga de trabajo de IA».

Demostración de producto en la web oficial de Taalas Figura: Captura de la demostración de producto en el sitio web de Taalas. Fuente: taalas.com

Qué significa esto para el usuario común

El coste operativo de la IA repercute directamente en el precio final de los servicios. Si grabar modelos en el silicio logra reducir los costes de inferencia en un orden de magnitud, la IA será sustancialmente más barata y rápida. Solo entonces podrá integrarse en teléfonos móviles, televisores, automóviles y electrodomésticos, lugares donde es imposible instalar armarios llenos de GPU.

En los foros de Hacker News, un usuario comentaba: Apple debería adquirir esta empresa y grabar modelos de IA en los chips de los iPhone para lograr asistentes que respondan al instante sin consumir batería. Es una deducción lógica, pero la realidad aún queda distante: la propia placa HC1 tiene unas dimensiones considerables y el modelo que integra pertenece a dos años atrás. Si su teléfono tuviera grabados los circuitos de un modelo obsoleto, ante la llegada de un modelo superior surgiría el dilema: ¿habría que cambiar de teléfono?

El debate entre estas dos arquitecturas sigue abierto. Las GPU universales apuestan por que «los modelos seguirán evolucionando constantemente», mientras que los chips especializados confían en que «determinados modelos perdurarán el tiempo suficiente para justificar su integración en hardware». Unos eligen la flexibilidad; otros, la eficiencia extrema. El vencedor lo decidirá la carrera entre la velocidad de evolución de los modelos y los costes de producción de chips. Tras el cierre de la operación en el cuarto trimestre, AMD aportará la primera respuesta con hechos y capital.

Enlaces de referencia:

  • The Register: AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon
  • Hacker News: Hilo de discusión sobre la adquisición de Taalas por AMD (item?id=49201970)
  • Nota de prensa oficial de AMD: AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market
  • CNBC: AMD buys Taalas, startup that hardwires AI models into its silicon
  • EE Times: AI Chip Startup Taalas Acquired By AMD
  • Sitio web oficial de Taalas: Página de producto del demostrador tecnológico HC1
  • Medium: A Look at Taalas’ HC1 Chip Reaching 16,000 Tokens per Second