¿Viene toda la disrupción en IA de Silicon Valley? Analizamos cómo la última hornada de modelos abiertos, con Qwen 3.8 Flash a la cabeza, está liderando una revolución silenciosa en optimización y arquitectura que marcará el estándar de la próxima generación de LLMs.

Existe la percepción generalizada de que la vanguardia y las ideas verdaderamente disruptivas en inteligencia artificial nacen exclusivamente en Silicon Valley, mientras que el resto del mundo (China en realidad) se limita a replicar o escalar lo que otros inventan. Sin embargo, los hechos de los últimos dos años nos muestran una realidad muy diferente.
A principios de 2025, el terremoto de DeepSeek (con V3 y R1) demostró al mundo que era posible alcanzar el rendimiento de los modelos más punteros de OpenAI o Google con una fracción ínfima de su coste computacional y de entrenamiento.
Pero ese no fue un hecho aislado. Lejos de limitarse a seguir la estela americana, los laboratorios chinos se han consolidado como el auténtico motor de la innovación en eficiencia arquitectónica. Dos buenos ejemplos: Moonshot AI (Kimi) revolucionó el escalado de contextos con sus mecanismos Kimi Delta Attention (KDA) y arquitecturas Stable LatentMoE. MiniMax rompió la barrera cuadrática del Transformer implementando mecanismos como Lightning Attention y MiniMax Sparse Attention.
El último gran hito de esta corriente lo firma Alibaba Cloud con el lanzamiento de Qwen 3.8 Flash (Qwen3.8-Flash-Next). Es mucho más que un modelo de pesos abiertos (open weight) extraordinariamente rápido, multimodal y económico. Es, ante todo, un banco de pruebas público para las soluciones de ingeniería sobre las que se está construyendo la futura generación Qwen4.
Eso sí: las innovaciones que incorpora este modelo no son una ocurrencia aislada de Alibaba, sino la punta de lanza de una convergencia técnica generalizada en la industria. La mayoría de estas técnicas nacen de investigaciones abiertas o experimentos pioneros de otros laboratorios, pero el gran mérito de Alibaba ha sido combinarlas, refinarlas y ser de los primeros en escalarlas con éxito en producción masiva.
A continuación, voy a dar un repaso a sus cuatro pilares fundamentales (en atención, conexiones residuales, embeddings y optimización), explicando no solo en qué consiste cada innovación, sino qué otros laboratorios las están utilizando y qué hace único al enfoque de Qwen.
¿Tienes alguna responsabilidad o de decisión técnica sobre el uso de IA Generativa en tu organización? Entonces no puedes perderte esta formación: Modelos Grandes de Lenguaje (LLMs): Fundamentos técnicos.
Innovación 1: Atención híbrida GDN + QSA
El mecanismo de atención global estándar de los Transformers tradicionales permite que cada token consulte a todos los anteriores, pero a cambio sufre un coste de cálculo cuadrático y un consumo voraz de memoria para almacenar la caché de claves y valores (KV Cache) cuando se manejan cientos de miles o un millón de tókenes.
Qwen resuelve este problema mediante una arquitectura híbrida que alterna dos tipos de capas:
- Gated DeltaNet (GDN): se aplica en tres de cada cuatro capas del modelo. Es un mecanismo recurrente que comprime de forma continua todo el historial conversacional en un estado interno de tamaño fijo. Esto elimina el crecimiento descontrolado de la memoria caché.
- Qwen Sparse Attention (QSA): se aplica en la cuarta capa restante para realizar atención global y recuperar detalles precisos a lo largo de todo el contexto.
A diferencia de otros esquemas de atención dispersa (como DSA de DeepSeek), que utilizan un indexador a nivel de token individual y acaban sufriendo un cuello de botella computacional enorme al procesar secuencias largas, QSA introduce una indexación comprimida por microbloques: agrupa la secuencia en bloques diminutos, estima la relevancia a nivel de bloque y solo aplica atención sobre las regiones críticas. Además, comprime la información de forma independiente en cada capa, evitando depender de la similitud entre capas consecutivas.

Dicho de forma sencilla e intuitiva: GDN se encarga de recordar eficientemente y QSA se encarga de recuperar con precisión.
En ventanas de 1 millón de tókenes, QSA acelera hasta 7,6 veces la fase de procesamiento inicial del prompt (prefill) y hasta 4,9 veces la generación de respuesta (decode).
Quién más lo está utilizando:
- Moonshot AI (Kimi): su familia Kimi K3 / Kimi Linear utiliza Kimi Delta Attention (KDA), una variante de compresión con compuertas por canal similar a GDN.
- AI21 Labs: pioneros en la arquitectura híbrida con la familia Jamba (combinando Mamba + Transformer).
- Google / DeepMind: con RecurrentGemma (arquitectura Griffin, que intercala recurrencia lineal y atención local).
- Allen Institute for AI (Ai2): con sus modelos experimentales OLMo Hybrid.
- Mistral AI: con Codestral Mamba (aunque en este caso apostando por Mamba2 puro sin Transformer).
Qué hace único a Qwen (QSA): mientras que otros modelos usan atención dispersa indexando token a token (como DSA en DeepSeek-V3.2/V4, que genera un gran coste de indexación) o atención lineal sin compresión de bloques (como MSA en MiniMax-M3), Qwen introduce la indexación comprimida por microbloques independientes por capa, lo que elimina el cuello de botella computacional en secuencias de 1M de tókenes.
2. Conexiones residuales con compuertas dinámicas (Gated Residual)
En los Transformers muy profundos, todas las capas leen y escriben secuencialmente en el mismo canal residual (Residual Stream, es el flujo de información que atraviesa las capas de un Transformer y al que cada componente añade sus modificaciones). Conforme el modelo gana capas, las señales aprendidas al principio tienden a diluirse y mezclarse en exceso, dando lugar además a picos inestables de activación (activation outliers).
La técnica Gated Residual (GR) ensancha el canal residual en 4 ramas paralelas y añade compuertas dinámicas (gates) que controlan la lectura y escritura elemento a elemento en función del contenido. Algunas ramas se encargan del flujo de información local entre capas contiguas, mientras que otras actúan como auténticas autopistas directas que transportan representaciones tempranas intactas hacia las capas más profundas de la red. Además, el estado residual admite almacenamiento en formato FP8 (usando 8 bits, que reduce memoria y acelera el procesamiento, con cierta pérdida de precisión), lo que reduce mucho el tráfico de datos en la memoria de la GPU.
Quién más lo está utilizando:
- ByteDance / Tsinghua University: publicaron originalmente el concepto de Hyper-Connections (HC) para multiplicar el ancho de banda de información residual.
- DeepSeek: implementó mHC (Manifold-Constrained Hyper-Connections), usando restricciones matemáticas (matrices doblemente estocásticas vía Sinkhorn-Knopp) para evitar que las señales exploten o se desestabilicen.
Qué hace único a Qwen: en lugar de algoritmos pesados de mezcla de matrices entre capas, Alibaba simplificó el diseño: divide el flujo en 4 ramas directas con compuertas dinámicas basadas en datos (GatedNorm), permitiendo además almacenar el estado residual en FP8 para ahorrar ancho de banda de memoria GPU.
3. Incrustaciones de N-gramas (N-gram embeddings)
Tradicionalmente, un modelo consulta su tabla de embeddings a partir de un único token aislado. Qwen presenta N-gram Embedding, una técnica que busca representaciones basadas en el contexto local formado por el token actual y varios tókenes precedentes.
Esto permite añadir 51.000 millones de parámetros adicionales que actúan como una memoria de frases hechas y patrones locales comunes, con un coste de cálculo por token prácticamente nulo. Como las posiciones de consulta se determinan de antemano de forma determinista, estos 51B de parámetros pueden alojarse en la memoria RAM del servidor (Host Memory) y cargarse en la GPU de manera asíncrona (prefetching) en paralelo con el cómputo del modelo, sin consumir VRAM de forma permanente.
Quién más lo está utilizando:
- DeepSeek: con Engram (enero de 2026), introdujo el concepto de "Conditional Memory", una memoria estática O(1)O(1) de n-gramas que se aloja en CPU/NVMe para liberar a las capas profundas de memorizar datos fácticos.
- Google: con los Per-Layer Embeddings (PLE) introducidos en las familias Gemma 3n y Gemma 4 (modelos E2B y E4B), donde se cargan subembeddings específicos desde almacenamiento Flash para permitir modelos ultracompactos en dispositivos cliente sin saturar la RAM/VRAM.
Qué hace único el enfoque de Qwen: ha integrado 51.000 millones de parámetros en una capa N-gram inicial que se precarga de forma asíncrona (prefetching) desde la RAM del servidor (Host Memory) en paralelo con el cálculo de la GPU, convirtiéndolo en un componente estándar de su arquitectura para modelos medianos y grandes.

4. Optimización con Muon y leyes de escalado
Para entrenar el modelo se utiliza principalmente Muon, un método de optimización creado para trabajar con matrices de dos dimensiones, presentes en componentes como la atención, GDN y los expertos de MoE. Este método reorganiza la información de esas matrices para reducir repeticiones y hacer que el entrenamiento sea más estable.
Otros elementos del modelo, como el sistema que decide qué expertos de MoE utilizar o las compuertas de bajo rango, se entrenan con AdamW, otro método que ajusta gradualmente los parámetros del modelo para mejorar sus predicciones.
También se ajustaron las llamadas leyes de escalado, que ayudan a determinar cómo configurar el entrenamiento cuando aumenta el tamaño del modelo. Gracias a ello, el modelo puede utilizar tasas de aprendizaje y tamaños de lote mayores sin que el entrenamiento se vuelva inestable.
Además, ya no es necesario aumentar progresivamente el tamaño del lote durante el entrenamiento, una técnica conocida como Batch Size Warmup. Esto permite ahorrar casi un 19 % de los pasos necesarios para que el modelo alcance un rendimiento estable.
Curiosidad técnica: los modelos MoE de Qwen utilizan una estrategia ultra-dispersa (ultra-sparse MoE). En lugar de activar muchos expertos medianos, cuentan con un catálogo amplio de expertos de los que solo activan una pequeña fracción por token, complementados por un experto compartido permanente. Esto permite aumentar la capacidad total del modelo sin incrementar el coste por token.
Quién más lo está utilizando:
Keller Jordan, un investigador independiente estadounidense, es el creador original de Muon a finales de 2024.
- Moonshot AI: lo utilizó para entrenar sus modelos de razonamiento como Kimi-K2-Thinking.
- Zhipu AI: lo ha adoptado en el entrenamiento de sus modelos GLM-4.5 y GLM-5.
- DeepSpeed (Microsoft) y PyTorch: lo han integrado en sus librerías estándar de optimización distribuida.
Qué aporta Qwen: Alibaba demostró que, al adaptar las leyes de escala para Muon, se puede eliminar por completo el Batch Size Warmup (que antes se consideraba indispensable en entrenamientos a gran escala), ahorrando casi un 19% de pasos de cómputo para lograr la misma convergencia.
Conclusiones
Más allá de los excelentes resultados que cosecha Qwen 3.8 Flash en pruebas de programación o en flujos agénticos de oficina, lo más importante de este lanzamiento es que nos deja tres tendencias claras del estado actual de los LLMs:
- La era del "brute force scaling" da paso a la ingeniería de precisión: durante años, la receta habitual para mejorar un LLM consistía simplemente en aumentar parámetros y sumar más GPUs. Diseños como el de Qwen 3.8 Flash demuestran que combinando recurrencia lineal (GDN), atención dispersa por microbloques (QSA) y compresión residual, un modelo que solo activa 6.000 millones de parámetros por token puede rendir a la par (o incluso por encima) de arquitecturas de cientos de miles de millones de parámetros entrenadas con presupuestos nueve veces superiores.
- El desacoplamiento de memoria y cómputo: técnicas como N-gram Embedding abren una vía sumamente prometedora: aumentar la capacidad expresiva y la memoria de patrones del modelo a gran escala (51B de parámetros adicionales) descargando el peso en la memoria RAM del sistema mediante precarga asíncrona, sin devorar la costosa y limitada VRAM de las GPUs.
- El cambio de polo en la investigación abierta: el ecosistema de pesos abiertos (open weight) con licencias comerciales permisivas como Apache 2.0 o MIT está siendo impulsado con paso firme por actores como Alibaba, DeepSeek o Moonshot AI. Su disposición a publicar informes técnicos detallados y abrir tempranamente las arquitecturas de próxima generación contrasta fuertemente con la opacidad creciente de los grandes laboratorios comerciales occidentales. ¿Cuánto durará esto? Pues lo que le funcione esta estrategia comercial a los chinos. Pero mientras tanto es una maravilla que debemos aprovechar.
El verdadero mérito técnico de Alibaba no está tanto haber inventado cada pieza que utiliza en sus modelos, sino en su habilidad a la hora de ensamblarlas y pulirlas. Qwen 3.8 Flash es una herramienta muy potente y barata para desarrolladores y empresas que buscan integrar capacidades de IA generativa de última generación a costes casi marginales. Pero además es, sobre todo, una lección de cómo la optimización algorítmica y la arquitectura de sistemas siguen teniendo la última palabra frente al músculo financiero.