Vencer a 4 millones con 8.000 dólares: la IA Ataraxos conquista el Stratego con 16 GPUs

Vencer a 4 millones con 8.000 dólares: la IA Ataraxos conquista el Stratego con 16 GPUs

IAAprendizaje por RefuerzoTeoría de Juegos

Fuentes:Nature y preprints de arXiv

El 30 de septiembre de 2026, la revista Nature publicó un artículo que dejó en una posición incómoda al dogma del escalado masivo de cómputo. Un sistema denominado Ataraxos, desarrollado conjuntamente por investigadores de la Universidad Carnegie Mellon, el MIT y otras instituciones, aplastó al cuatro veces campeón mundial Pim Niemeijer en el clásico juego de tablero Stratego con un balance de 15 victorias, 1 derrota y 4 empates. Para lograrlo, solo necesitó un modesto grupo de 16 GPUs y un presupuesto de entrenamiento estimado en apenas 8.000 dólares. Cuatro años antes, los laboratorios más punteros de la industria invirtieron 1.024 chips aceleradores especializados y millones de dólares para asaltar la misma fortaleza, sin conseguir dominar el dilema estratégico del farol.

16 GPUs derriban el monopolio de la fuerza bruta de cómputo

Este hito supone una profunda rectificación en la hoja de ruta de la IA de frontera. En sus partidas frente a Pim Niemeijer, Ataraxos impuso un dominio abrumador. Las condiciones eran transparentes: por cada partida ganada, el equipo de investigación pagaba 100 dólares al gran maestro, quien ha liderado el ranking mundial durante más de 600 semanas. Niemeijer sabía que la IA no se adaptaría dinámicamente entre partidas, lo que le permitía tomarse su tiempo para buscar puntos ciegos en el sistema. Sin embargo, a lo largo de 20 partidas de máxima exigencia, el campeón humano solo pudo arrancar un único triunfo.

El equipo investigador ofreció un análisis técnico sereno de los resultados: la solitaria derrota y los cuatro empates se debieron principalmente a la colocación aleatoria a ciegas obligatoria al inicio de Stratego, un factor de azar que la ley de los grandes números no puede neutralizar en una muestra de solo 20 juegos. Por otra parte, en una exhibición en vivo de 40 partidas durante el Campeonato Mundial de Stratego de 2025 frente a diversos rivales con aperturas poco ortodoxas, Ataraxos se impuso en 38 ocasiones. Derrotar al campeón del mundo fue impactante, pero lo que realmente sacudió las certezas de la industria fue la modesta factura técnica.

Tablero y piezas de Stratego Figura: El complejo tablero de Stratego con piezas de identidad oculta. Fuente: Getty Images (vía Ars Technica)

El consumo de recursos de Ataraxos fue asombrosamente austero: bastaron 16 GPUs funcionando durante una semana, más 4 GPUs adicionales durante cuatro días para entrenar su «modelo de creencias». Los autores estiman el coste total de cómputo en torno a los 8.000 dólares. Como referencia comparativa, DeepNash, el sistema presentado por DeepMind en 2022, requirió 1.024 procesadores dedicados durante dos o tres meses, lo que a precios de hardware de 2025 equivaldría a un gasto de entre 3 y 4,5 millones de dólares. Ataraxos utilizó aproximadamente una trigésima parte de las partidas de autojuego de DeepNash y redujo la muestra de entrenamiento al 1 %. Ambas generaciones distan tres órdenes de magnitud en infraestructura, y aun así el recién llegado impuso su ley utilizando tarjetas gráficas comerciales. La acumulación indiscriminada de potencia ha chocado de frente con la ley de rendimientos decrecientes; quemar capital para resolver problemas mediante fuerza bruta ha dejado de ser la estrategia indiscutible.

10 elevado a 33 configuraciones iniciales colapsan la búsqueda pura

Para comprender por qué un despliegue de millones de dólares encalló ante Stratego, es preciso examinar la naturaleza estructural del juego. A diferencia del ajedrez o el go, clasificados como juegos de información perfecta donde todas las piezas sobre el tablero son visibles para ambos contendientes, Stratego es un juego de información imperfecta envuelto en una densa niebla de guerra. Cada bando dispone de 40 piezas —desde el Mariscal hasta el Espía, pasando por bombas inmóviles y la Bandera que debe protegerse a ultranza—. Al comienzo, un jugador solo divisa la posición de las piezas rivales, ignorando por completo su rango real.

La identidad militar solo se desvela cuando dos fichas colisionan en la misma casilla. La pieza de menor rango queda eliminada y la vencedora sobrevive, pero revelando en el proceso su identidad clave ante todo el tablero. Esta mecánica desencadena una explosión combinatoria del espacio de estados. Aunque el Texas Hold’em también es un juego de información imperfecta, cada jugador maneja solo dos cartas ocultas, sumando apenas 1.326 combinaciones iniciales. En Stratego, por contra, el abanico de disposiciones iniciales de piezas supera la astronómica cifra de 10 elevado a 33.

A esto se añade la descomunal profundidad del árbol de decisión. Mientras que una partida de ajedrez suele decidirse en unos 40 movimientos, un choque disputado de Stratego puede rebasar con facilidad los 2.000 turnos. A lo largo de esta dilatada interacción emerge una variable ante la que el aprendizaje por refuerzo convencional suele tropezar: el farol. Hacer avanzar a un peón débil disfrazado de temible Mariscal constituye una maniobra táctica de enorme poder psicológico. Si se abusa del farol, el adversario detecta la impostura y devora la pieza; si se juega con absoluta honestidad, el rival descifra el despliegue bélico y se impone localmente. Hallar el equilibrio de Nash entre amenazas genuinas y simulaciones a lo largo de 2.000 turnos fue precisamente el escollo insalvable del modelo de DeepMind de 2022. Frente a semejante árbol de posibilidades, los algoritmos tradicionales agotaban cualquier cuota de cómputo intentando procesar faroles secuenciales encadenados.

Un modelo de creencias disipa la niebla de guerra

La respuesta de Ataraxos consistió en reestructurar de raíz el problema. Renunció a calcular a ciegas todo el tablero desde la incertidumbre total y sumó una segunda red neuronal especializada: el «modelo de creencias» (Belief Model). A lo largo de 163 millones de partidas de autojuego, la misión crítica de este modelo radicaba en inferir retrospectivamente la identidad de las piezas enemigas aún ocultas basándose en la secuencia de movimientos observados.

Mediante muestreo probabilístico, el modelo selecciona las configuraciones más verosímiles del ejército rival en cada momento. En lugar de explorar todas las combinaciones teóricamente posibles, reduce el problema a proyectar escenarios sobre un reducido conjunto de hipótesis plausibles. Gracias a este modelo de creencias, Ataraxos logró trasladar por primera vez a Stratego la potencia de la búsqueda en árbol de Monte Carlo (el método popularizado por AlphaGo que simula bifurcaciones futuras antes de ejecutar una jugada).

Predicción de valor y probabilidades de victoria Figura: Evolución de las probabilidades estimadas de victoria frente a Pim Niemeijer. Fuente: arXiv:2511.07312

Los sistemas precedentes, desbordados por la falta de información, eran incapaces de levantar árboles de búsqueda sólidos y dependían exclusivamente de intuiciones de valor libre de modelo. Ataraxos evidenció que en entornos de información incompleta, la deducción previa del estado oculto del rival —transformando la niebla en aproximaciones de alta probabilidad— es el paso previo indispensable para desatar la eficacia de los algoritmos de búsqueda. Este cambio de paradigma alteró incluso las doctrinas defensivas consagradas. En sus enfrentamientos contra Niemeijer, Ataraxos recurrió con frecuencia a una formación inusual: encajar la Bandera en la esquina más remota del tablero protegida únicamente por dos bombas. Descartada históricamente por los maestros humanos como una disposición rígida y propensa a catástrofes ante el menor descuido, el análisis algorítmico riguroso confirmó que constituía la fortaleza más inexpugnable del tablero.

Precisión mecánica despojada de psicología humana

Esta innovación en la arquitectura se reflejó directamente en un estilo de juego desconcertante para los rivales de carne y hueso. Ataraxos demostró una frialdad absoluta, inmune a las emociones y a la angustia propia del jugador humano en posiciones de desventaja. Al analizar las partidas, los investigadores observaron que cuando un humano ve caer su probabilidad de victoria en tiempo real al 2 %, casi siempre recurre a ofensivas suicidas o a faroles desesperados.

Ataraxos, colocado ante idéntica adversidad, rastreaba con precisión quirúrgica cualquier variante que ofreciera tan solo un 0,1 % de recuperación, recomponiendo la posición con paciencia infinita. Los investigadores señalaron cómo el sistema recurría al engaño con una naturalidad pasmosa para remontar. Para la máquina, amenazar con una pieza menor no provoca descargas de adrenalina ni dilemas éticos; constituye sencillamente la decisión matemática que maximiza la esperanza de ganancia dadas sus distribuciones de probabilidad.

Esa neutralidad analítica también rigió la gestión de sus propias vulnerabilidades. Si en algún flanco quedaba una brecha defensiva crítica, pero el modelo de creencias determinaba por los movimientos del contrario que este no la había detectado, Ataraxos no desperdiciaba recursos en taparla. Mientras que un espectador omnisciente con visión de ambas partes aguardaría un colapso inminente, la máquina permanecía imperturbable. Los jugadores humanos difícilmente consiguen esa templanza: saber que se custodia un secreto frágil acaba delatándose de forma involuntaria en el ritmo de los movimientos o en maniobras protectoras apresuradas. El sistema carecía de ese lastre: si calculaba que el adversario lo ignoraba, operaba asumiendo plenamente su ignorancia.

El mundo real nunca reparte las cartas boca arriba

La arquitectura validada en Ataraxos trasciende con creces el tablero de Stratego. El equipo ya ha trasladado idéntico esquema para vencer a tres campeones mundiales en Barrage Stratego, dominar el juego cooperativo de cartas Hanabi (cuya dinámica gira en torno a la deducción mutua de cartas ciegas) y derrotar a la IA líder en Dou Dizhu. Con presupuestos minúsculos, el sistema ha descifrado entornos de información imperfecta regidos por dinámicas radicalmente distintas.

No obstante, los juegos de mesa constituyen solo un banco de pruebas preliminar. Los investigadores trabajan ahora en facultar al modelo para razonar sus decisiones en lenguaje natural. La meta a largo plazo es trasladar esta metodología a escenarios reales como negociaciones corporativas, posicionamiento estratégico y toma de decisiones en mercados financieros.

La victoria en Stratego dirime una batalla fundamental sobre el rumbo de la IA. En problemas complejos con amplios horizontes e información velada, deducir la realidad oculta antes de ejecutar la búsqueda venció al escalado desmedido de hardware por tan solo 8.000 dólares. Cuando una máquina es capaz de fijar las cartas secretas de un campeón mundial entre 10 elevado a 33 variantes de niebla, las reglas del juego en la investigación avanzada cambian. El liderazgo ya no pertenece a quien acapare más tarjetas aceleradoras, sino a quien descifre con mayor agudeza la geometría interna del problema.

Enlaces de referencia:

  • Artículo en Nature: Scalable decision-making for games of imperfect information
  • Cobertura de Ars Technica
  • Debate en Hacker News (item?id=49933740)