Dos artículos al frente de HN el mismo día: El momento de la innovación original en la IA china

Dos artículos al frente de HN el mismo día: El momento de la innovación original en la IA china

kimimoonshot-aidelta-attentionlinear-attentionarquitectura de IAIA china

Fuentes:HN + web research · HN

El 28 de julio de 2026, Sebastian Raschka publicó una breve entrada en su blog titulada “Kimi K3 Architecture Notes”. No era un extenso artículo académico, sino simplemente anotaciones sobre un diagrama de arquitectura. Sin embargo, poco después de su publicación, ascendió rápidamente a la portada de Hacker News, superando los 270 votos a favor (upvotes).

Ese mismo día, el artículo publicado en octubre pasado por Moonshot AI, “Kimi Linear: An Expressive, Efficient Attention Architecture”, también apareció en la portada de HN, acumulando más de 260 upvotes. Que dos publicaciones del mismo laboratorio figuraran en lo más alto de la comunidad tecnológica occidental el mismo día no fue una casualidad.

Vista general de la arquitectura de Kimi K3 — Análisis desglosado capa por capa realizado por Sebastian Raschka Figura: El diagrama de la arquitectura de Kimi K3 analizado por Sebastian Raschka en su blog. Desde Attention Residuals hasta LatentMoE, cada componente refleja una filosofía de diseño propia. Fuente: Sebastian Raschka

Si a principios de 2025 DeepSeek hizo que Occidente tomara conciencia de la “presencia” de la IA china, el 28 de julio de 2026 fue el día en que dos artículos de Moonshot AI obligaron a la comunidad occidental a examinar con seriedad la “originalidad” de sus propuestas arquitectónicas.

”No están haciendo solo destilación”

Durante mucho tiempo, la cobertura de los medios tecnológicos occidentales sobre la “IA china” ha estado vinculada a un concepto central: destilación (distillation). En febrero de este año, Anthropic acusó públicamente a DeepSeek, Moonshot AI y MiniMax de utilizar más de 24.000 cuentas falsas y 16 millones de interacciones para destilar de forma sistemática el modelo Claude. El Departamento del Tesoro de EE. UU. llegó a amenazar a Moonshot con sanciones. En la narrativa predominante en Occidente, los laboratorios chinos eran presentados como “imitadores tecnológicos”, incapaces de innovar por sí mismos.

Sin embargo, esa narrativa se está desmoronando.

Uno de los comentarios más votados en HN fue escrito por el usuario constantlm:

“So, unlike what leaders of western labs would like you to believe (that Kimi is just the result of distillation attacks), they are introducing new and novel approaches.”

Esta sola frase recibió decenas de votos. La sección de comentarios se llenó de debates técnicos: investigadores analizando el significado de la arquitectura NoPE, comparando las diferencias entre Hyper-Connections de DeepSeek V4 y Attention Residuals de Kimi, o calculando el ahorro de FLOPs logrado por Kimi Delta Attention. Nadie volvió a mencionar la palabra “destilación”.

Kimi Delta Attention: La atención lineal supera por primera vez a la atención completa

Para comprender la trascendencia de este avance, es necesario repasar el contexto técnico: la atención lineal (linear attention) es una línea de investigación desarrollada durante años para resolver el principal cuello de botella de la arquitectura Transformer: la complejidad computacional $O(n^2)$ de los mecanismos de atención estándar. En términos sencillos, a mayor longitud del texto, el coste de cálculo crece de forma cuadrática. La atención lineal busca reducir esa complejidad a $O(n)$, aunque históricamente el precio a pagar ha sido un rendimiento inferior al de la atención completa (full attention).

La aportación fundamental del artículo Kimi Linear es haber demostrado, bajo una comparación equitativa, que la atención lineal puede superar a la atención completa en todas las dimensiones: textos cortos, textos largos e incluso en escenarios de aprendizaje por refuerzo (RL).

Diagrama de la arquitectura Kimi Delta Attention (KDA) — Introducción de un mecanismo de puertas de grano fino en la atención lineal Figura: Concepto central de Kimi Delta Attention — Control independiente de los “pesos de escritura” y “pesos de olvido” por canal para aprovechar de forma más eficiente el estado de memoria limitado. Fuente: Zhouyao Xie

El módulo clave que permite este avance es Kimi Delta Attention (KDA). Construido sobre la base de Gated DeltaNet, introduce un mecanismo de puertas de grano fino (fine-grained gating) que aprovecha de manera mucho más eficiente el estado de memoria limitado. Mientras que la atención lineal tradicional trata todos los canales por igual al escribir en la memoria, KDA controla de manera independiente los pesos de escritura y olvido para cada canal, decidiendo qué información conservar, actualizar o descartar.

Este control preciso capa por capa y canal por canal permitió que la atención lineal alcanzara por primera vez resultados comparables o superiores a los de la atención completa.

El artículo propone además una elegante optimización de ingeniería: el uso de una variante especializada de matrices Diagonal-Plus-Low-Rank (DPLR) para la aceleración en hardware. Sin sacrificar el rendimiento del modelo, la memoria ocupada por el KV cache se redujo hasta en un 75 %, y la velocidad de decodificación en textos largos de 1 millón de tokens se multiplicó por 6.

Hay aquí una conclusión clave de ingeniería: en los últimos años se han publicado innumerables artículos sobre atención lineal, pero casi ninguno llegó a implementarse en entornos de producción reales debido al dilema de “buena teoría, mala ejecución en hardware”. Matemáticamente, una complejidad de $O(n)$ resulta atractiva, pero en las GPU reales no lograba competir con los kernels de atención completa de cuDNN, altamente optimizados. KDA diseñó deliberadamente un algoritmo por bloques (chunkwise) adaptado al hardware, logrando que esta arquitectura fuera realmente desplegable en producción y no quedara confinada a la teoría académica.

Kimi K3: La filosofía arquitectónica tras 2,8 billones de parámetros

Si Kimi Linear representa el documento técnico del “motor”, Kimi K3 constituye el lanzamiento del “vehículo completo”.

Kimi K3 es un modelo MoE (Mixture-of-Experts) de 2,8 billones de parámetros presentado por Moonshot AI el 16 de julio. Activa 16 de sus 896 expertos por token, cuenta con comprensión multimodal nativa y admite un contexto de 1 millón de tokens. Actualmente es el modelo de pesos abiertos más grande del mundo.

Lo que motivó a Sebastian Raschka a escribir un análisis sobre su estructura fue una serie de decisiones arquitectónicas audaces en K3:

Attention Residuals: Un componente exclusivo de K3. Mientras que las conexiones residuales tradicionales simplemente suman la entrada y la salida para facilitar el flujo del gradiente, Attention Residuals utiliza puntuaciones de atención para ponderar cuánto debe contribuir cada capa al resultado final: una agregación ponderada en lugar de una simple suma. Según el informe técnico, esto mejoró de forma constante tanto la pérdida de validación como el rendimiento en tareas posteriores, añadiendo solo un ~4 % de coste de entrenamiento y un ~2 % de sobrecoste en inferencia.

NoPE (sin codificación de posición): K3 es la primera arquitectura de primera línea conocida que prescinde por completo de la codificación de posición en todas sus capas en un entorno de producción. Aunque la tendencia reciente utilizaba RoPE para capas locales y NoPE para capas globales, K3 eliminó la codificación de posición en la totalidad de sus capas.

LatentMoE: Aunque no es una idea exclusiva de Kimi (Nemotron 3 exploró un enfoque similar), K3 demostró la viabilidad de LatentMoE a una escala de 2,8 billones de parámetros. La idea central consiste en comprimir las grandes capas lineales de las redes de expertos en un espacio latente de baja dimensión antes de realizar el cálculo, reduciendo drásticamente el número de parámetros sin perder precisión.

Raschka resumió acertadamente en su blog: “La tendencia general con K3, al igual que con Nemotron 3 y DeepSeek V4, avanza hacia una mayor eficiencia en la inferencia. La idea central es reemplazar cada componente por una versión optimizada en eficiencia.”

Una misma comunidad, distintas perspectivas

La coincidencia de ambos artículos en la portada de HN generó una dinámica de discusión interesante.

El debate sobre Kimi Linear (114 comentarios) tuvo un marcado carácter académico: los investigadores discutieron si la atención lineal puede sustituir realmente a la atención completa, la validez de la hipótesis de la “Bitter Lesson” y la aplicabilidad de las leyes de escala (scaling laws).

En cambio, la discusión sobre las notas de Raschka respecto a K3 (34 comentarios), aunque más reducida, ofreció una mayor densidad informativa. Dado que la publicación analizaba el modelo desde la perspectiva de su arquitectura, los comentarios pasaron de inmediato a debatir si la IA china se limita a la destilación. El usuario thatsagasey describió a Raschka como un “gran investigador y autor sobre LLMs”, lo cual supone un respaldo explícito: cuando un investigador occidental del nivel de Sebastian Raschka analiza con rigor la arquitectura de un laboratorio chino, el discurso de la “sola destilación” pierde su sustento.

El punto de inflexión: de “seguidor” a “innovador original”

Observando la evolución en una perspectiva temporal más amplia, la trayectoria de aportaciones arquitectónicas originales por parte de los laboratorios chinos resulta evidente:

  • 2024: DeepSeek V2 presenta Multi-head Latent Attention (MLA), considerada por la industria como una de las aportaciones originales más relevantes en la optimización del KV cache. La mayoría de los modelos eficientes de contexto largo desarrollados posteriormente se basan en MLA.
  • Octubre de 2025: Moonshot AI publica Kimi Linear, demostrando por primera vez que la atención lineal puede superar a la atención completa en todas las métricas de evaluación.
  • Julio de 2026: Kimi K3 escala Kimi Linear de 48B a 2,8T, validando la capacidad de escalado de estas innovaciones en entornos de producción reales.

No se trata del éxito aislado de un único laboratorio. El enfoque MoE y MLA de DeepSeek, junto con Delta Attention y Attention Residuals de Moonshot, representan contribuciones originales e independientes desarrolladas en distintas direcciones arquitectónicas.

Desde una perspectiva objetiva, existen también opiniones matizadas entre los investigadores occidentales. Algunos señalan que, si bien Kimi Linear supone un avance claro, la afirmación de “haber superado por primera vez a la atención completa” requiere una replicación independiente adicional, y destacan que la investigación en Gated DeltaNet tiene sus orígenes en trabajos de laboratorios occidentales. El alcance de la “originalidad” sigue siendo materia de debate. Sin embargo, la propia existencia de este debate constituye un progreso: pasar de “solo saben destilar” a “cuál es el alcance de su contribución” representa ya un reconocimiento implícito de sus capacidades.

Señales industriales tras las dos publicaciones

El lanzamiento de Kimi K3 provocó reacciones que trascendieron el ámbito estrictamente técnico. Bloomberg informó de que la publicación de K3 coincidió con una racha de ventas en los valores tecnológicos del Nasdaq, y el Secretario del Tesoro de EE. UU., Bessent, llegó a sugerir posibles sanciones. Que la presentación del modelo de una startup de IA china influya en los mercados de capitales estadounidenses es una señal mucho más directa que cualquier puntuación en un benchmark.

Asimismo, resulta relevante el modelo de licencias por tramos de ingresos (revenue-tiered licensing) adoptado por Moonshot para K3: acceso gratuito a los pesos del modelo para PYMES e investigadores, y licencias comerciales de pago para grandes empresas. Es una de las primeras ocasiones en que una empresa de IA china muestra una metodología comercial madura en torno al software de código abierto, construyendo ventajas competitivas en la intersección entre tecnología y negocio.

Conclusión

Que dos artículos alcanzaran la portada de Hacker News el mismo día pudo haber sido una coincidencia para Moonshot AI. Sin embargo, para el conjunto de la industria de la IA en China, marca un punto de inflexión en la narrativa global.

Cuando Sebastian Raschka desglosa la arquitectura de K3 capa por capa y los ingenieros occidentales en HN debaten sobre los méritos de AttnRes y NoPE en lugar de hablar de “destilación”, la IA china ha cruzado el umbral que separa al seguidor de producto del innovador de arquitecturas. La destilación permite alcanzar a los competidores, pero superarlos exige innovación original. La originalidad no se construye de la noche a la mañana, pero cuando emerge, no pasa desapercibida.

El 28 de julio de 2026, esa señal quedó claramente demostrada.


Referencias:

  • Sebastian Raschka, “Kimi K3 Architecture Notes”, Jul 28, 2026
  • Kimi Team, “Kimi Linear: An Expressive, Efficient Attention Architecture”, Oct 2025 (arXiv)
  • Hacker News Discussion: Kimi K3 Architecture Notes (item?id=49085698)
  • Hacker News Discussion: Kimi Linear (item?id=49082022)
  • Moonshot AI, “Kimi K3 Tech Blog: Open Frontier Intelligence”
  • Moonshot AI, “Kimi K3 Quickstart”
  • Zhouyao Xie, “Behind Kimi K3: Understanding Kimi Delta Attention”, Jul 2026
  • GitHub: MoonshotAI/Kimi-K3
  • GitHub: MoonshotAI/Kimi-Linear
  • Pandaily, “Deconstructing the Kimi K3 Technical Report”, Jul 2026