DeepSeek mHC: Hyper-Connections restringidas a una variedad
Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
El deep learning moderno se apoya en la conexión residual. Las Hyper-Connections (HC) exploran otra dimensión arquitectónica: ampliar el estado residual en varios streams que interactúan entre sí. El artículo de DeepSeek sobre Manifold-Constrained Hyper-Connections (mHC) estudia cómo mantener estable ese routing al escalar el entrenamiento.
Esta publicación comienza con las conexiones residuales estándar y después introduce las Hyper-Connections y la inestabilidad que pueden provocar. La restricción de mHC y su coste de implementación se abordan al final.
Por qué funcionan las conexiones residuales
El problema de la profundidad
Añadir capas puede aumentar la capacidad, pero también dificulta la optimización y la propagación de señales. Dependiendo de la inicialización, la normalización y la arquitectura, las activaciones forward o los gradientes backward pueden reducirse, crecer o quedar mal condicionados a medida que aumenta la profundidad.
La solución residual
El artículo de ResNet introdujo una solución sencilla. En lugar de aprender un mapeo directo, se aprende el residual, es decir, la diferencia respecto a la identidad:
La propiedad clave es el atajo de identidad. Cuando la función residual devuelve cero, la capa se convierte en un pass-through. De aquí se derivan dos consecuencias:
- Un término de gradiente directo: la backpropagation incluye un camino a través del componente de identidad.
- Un mapeo de fallback sencillo: la rama residual puede mantenerse cerca de cero cuando una capa no necesita modificar demasiado el estado.
Esto no elimina todos los problemas de optimización, pero hizo viables redes considerablemente más profundas.
Cómo cambia la normalización de capas el camino residual
Los Transformers introdujeron una nueva variable: dónde colocar Layer Normalization (LN). La decisión parece menor, pero no lo es.
| Variante | Ubicación de LN | Ventaja | Limitación principal |
|---|---|---|---|
| Post-LN | Después del bloque residual | Mayor contribución de la profundidad | Puede ser más difícil de optimizar en redes profundas |
| Pre-LN | Antes del bloque residual | Camino residual más directo | Las representaciones de capas adyacentes pueden volverse cada vez más similares |
La arquitectura ResiDual combina caminos residuales Pre-LN y Post-LN. HC amplía el estado residual en lugar de aumentar la profundidad.
Las Hyper-Connections añaden streams residuales paralelos
Hyper-Connections (HC) amplía la anchura del residual stream en lugar de añadir profundidad.
Qué significa un stream
En un Transformer estándar, cada token tiene un estado de dimensión que atraviesa los bloques. Al principio de la red, HC replica veces ese embedding de entrada, donde es la «tasa de expansión», normalmente 4. El estado oculto de dimensión se convierte en una «matriz oculta hiper» .
En Hyper-Connections, un stream es una de esas instancias paralelas del estado.
Las copias comienzan siendo idénticas y después divergen a medida que los mapas aprendidos leen, escriben y mezclan los streams. El artículo las interpreta como varios patrones de conexión a lo largo de la profundidad; no exige que cada stream adopte un papel fijo y legible para una persona.
Mecanismos principales
En lugar de una única ruta residual, HC mantiene streams paralelos a través de toda la red. En cada bloque Transformer se ejecutan tres operaciones, cada una controlada por pequeños pesos aprendibles:
- Lectura (): agrega los streams en la entrada de dimensión que consume el bloque de attention o feed-forward.
- Escritura (): transforma la salida del bloque en actualizaciones para los streams.
- Mezcla (): aplica un mapa residual antes de añadir la actualización del bloque.
Estos mapas pueden ser parámetros estáticos más términos dependientes de la entrada. El mapa residual es la parte crítica para la estabilidad, porque se multiplica repetidamente a lo largo de la profundidad.
Qué resultados presenta el artículo de HC
El artículo de HC informa de una convergencia 1,8 veces más rápida para su configuración OLMoE-1B-7B DHC×4 respecto a su baseline, además de mejoras downstream con 500B tokens (Sección 1). Se trata de una configuración evaluada, no de un multiplicador general de velocidad para cuatro streams.
El problema del escalado
El artículo de mHC informa de inestabilidad al escalar HC sin restricciones hasta su configuración de 27B.
Por qué HC sin restricciones puede volverse inestable
Los mismos mapas sin restricciones que hacen flexible a HC también eliminan el camino de identidad garantizado que facilita el entrenamiento de las conexiones residuales.
El problema del mapa compuesto
En los residuales estándar:
Cuando , esto es la identidad: . La señal pasa sin cambios.
En Hyper-Connections, el camino residual incluye una multiplicación matricial:
A lo largo de L capas, la señal se convierte en:
El comportamiento depende de la matriz compuesta, no de que las entradas individuales estén por encima o por debajo de 1. Si los mapas sucesivos tienen ganancias de operador superiores a uno en una dirección alineada, las señales pueden crecer; las ganancias inferiores a uno pueden atenuarlas. Las entradas negativas también pueden introducir cancelaciones.
El artículo de mHC mide esa ganancia mediante Amax Gain Magnitude: la suma máxima de los valores absolutos por fila para la propagación forward y por columna para la propagación backward en un mapa residual compuesto. En su experimento de HC con 27B, el pico se aproxima a 3.000 y coincide con un comportamiento de entrenamiento inestable (Sección 5.4).
Por tanto, el objetivo de diseño es más concreto que imponer que cada mapa sea la identidad: permitir la mezcla entre streams y, al mismo tiempo, acotar la amplificación al componer los mapas.
La restricción de mHC
mHC mantiene el routing entre streams, pero restringe cada matriz de mezcla residual al politopo de Birkhoff, el conjunto de matrices doblemente estocásticas. Estas matrices tienen entradas no negativas, y la suma de cada fila y cada columna es uno. La restricción hace que cada stream de salida sea una combinación convexa de los streams de entrada y acota la norma espectral del mapa residual a uno.
Qué garantiza la doble estocasticidad
La doble estocasticidad proporciona tres propiedades a la vez:
| Restricción | Consecuencia |
|---|---|
| No negatividad | Cada salida es una combinación convexa, sin cancelación de signos |
| Suma de filas = 1 | Una señal constante entre streams permanece constante |
| Suma de columnas = 1 | Se conserva la media global entre streams |
Esto no equivale a una conservación literal de la energía euclídea. Un mapa doblemente estocástico puede suavizar las diferencias entre streams. Proporciona conservación de la media y un routing no expansivo bajo la cota de norma indicada.
La restricción tiene además tres consecuencias:
- Norma espectral ≤ 1: el mapa de routing residual no puede amplificar la norma euclídea.
- Cerradura frente a la multiplicación: el producto de matrices doblemente estocásticas sigue siendo doblemente estocástico, por lo que la restricción se conserva al componerlas a lo largo de la profundidad.
- Mezcla convexa: según el teorema de Birkhoff-von Neumann, el mapa pertenece a la envolvente convexa de las matrices de permutación.
Proyección de Sinkhorn-Knopp
Los logits residuales aprendibles no están restringidos. mHC primero los eleva mediante la exponencial para obtener una matriz positiva y después alterna la normalización por columnas y por filas. Con suficientes iteraciones, este proceso de Sinkhorn-Knopp se aproxima a una matriz doblemente estocástica; el artículo utiliza 20 iteraciones como una proyección diferenciable aproximada y práctica, no como una restricción exacta.
Para unos logits sin procesar , el procedimiento es:
S = exp(A)
repeat 20 times:
S = S / column_sum(S)
S = S / row_sum(S)
return S
Las operaciones son diferenciables, pero no son gratuitas. mHC utiliza un kernel forward fusionado y un kernel backward personalizado que vuelve a calcular en el chip los estados intermedios de normalización.
Detalles de la parametrización
- Mapa residual: la exponenciación seguida de la normalización de Sinkhorn produce el aproximadamente doblemente estocástico.
- Mapas de lectura y escritura: y . Ambos mapas siguen utilizando valores no negativos, lo que reduce la cancelación debida a coeficientes con signos mixtos (Sección 4.2).
Arquitectura completa de mHC
El flujo a través de cada bloque es el siguiente:
- Entrada: streams residuales paralelos entran en la capa.
- Lectura (): los streams se combinan en la entrada que consume la función de la capa. El artículo utiliza , lo que hace que los coeficientes sean no negativos.
- Cálculo: el bloque Transformer estándar (Attention o MLP) procesa el vector agregado único.
- Escritura (): la salida del bloque se transforma en actualizaciones para los streams mediante . Los coeficientes siguen siendo no negativos.
- Mezcla (): el mapa residual aproximadamente doblemente estocástico mezcla los streams entrantes antes de añadir la actualización.
- Salida: la matriz de streams actualizada pasa a la capa siguiente.
Solo el mapa de mezcla residual utiliza la proyección de Sinkhorn. Los mapas de lectura y escritura emplean parametrizaciones no negativas. Esta distinción es importante porque la garantía de composición del artículo se aplica a .
Infraestructura necesaria para el overhead comunicado
Cuatro streams aumentan el acceso a memoria del estado residual, el almacenamiento de activaciones y la comunicación de la pipeline. El resultado temporal del 6,7 % que presenta el artículo depende de la siguiente implementación diseñada conjuntamente.
Fusión de kernels
La implementación fusiona operaciones que comparten accesos a memoria, utiliza precisión mixta cuando es apropiado e implementa la mayoría de los kernels personalizados con TileLang. El bucle de Sinkhorn y su backward personalizado se ejecutan dentro de kernels dedicados para reducir el tráfico de memoria y el overhead de lanzamiento.
Recomputación selectiva
Almacenar todos los estados intermedios de Sinkhorn para la backpropagation dispararía el consumo de memoria. En su lugar, mHC:
- Libera las activaciones intermedias después del forward.
- Las vuelve a calcular sobre la marcha durante el backward.
Una planificación DualPipe ampliada solapa partes de la comunicación, la recomputación y el trabajo de las capas en los límites de la pipeline. El solapamiento conseguido es específico de este sistema de entrenamiento.
Resultado comunicado del sistema
En la configuración de escalado del artículo, la tasa de expansión añade un 6,7 % de tiempo de entrenamiento respecto a su baseline (Sección 4.3). Es un resultado del sistema, no el overhead de una implementación sencilla en un framework.
Qué establecen los experimentos
En la comparación con 27B, HC sin restricciones alcanza una ganancia Amax Gain compuesta cercana a 3.000. Con la proyección Sinkhorn aproximada de 20 pasos, la ganancia backward compuesta de mHC se desvía de uno, pero permanece acotada aproximadamente en 1,6 en el análisis comunicado (Sección 5.4).
Los autores también entrenan variantes MoE de 3B, 9B y 27B inspiradas en DeepSeek-V3 (Sección 5.3). En 27B, mHC supera al baseline residual estándar en los ocho benchmarks downstream comunicados y supera a HC en seis de ocho (Tabla 4). HC obtiene una puntuación ligeramente superior en GSM8K y MATH. Se trata de experimentos de pretraining internos del equipo que propone el método, por lo que la replicación independiente y las comparaciones con otras arquitecturas siguen abiertas.
Compromisos y preguntas abiertas
mHC no es una mejora drop-in para cualquier modelo. Quedan cuatro cuestiones:
- Overhead del sistema: el 6,7 % es el resultado del artículo con una implementación optimizada; otro runtime, topología de dispositivos o configuración del modelo puede tener un coste diferente.
- Complejidad de implementación: una implementación de referencia puede expresar el método, pero igualar el throughput comunicado requiere kernels personalizados, recomputación y cambios en la planificación.
- Sesgo de la mezcla: la doble estocasticidad conserva la media entre streams y evita la expansión mediante , pero puede suavizar las diferencias entre streams. La actualización del bloque sigue modificando la representación global.
- Alcance de la evidencia: la evidencia más sólida procede del pretraining de modelos de lenguaje sobre arquitecturas MoE inspiradas en DeepSeek-V3. Este artículo todavía no establece la generalización a otras familias de modelos.
Ideas clave
- Las conexiones residuales funcionan gracias al mapeo de identidad: permiten que las señales pasen sin cambios.
- Hyper-Connections escalan la anchura en lugar de la profundidad, y el artículo de HC comunica una convergencia más rápida para una configuración concreta de cuatro streams.
- HC sin restricciones puede perder la propiedad de conservación residual cuando los mapas residuales se componen a lo largo de la profundidad.
- mHC restringe la mezcla residual al politopo de Birkhoff, conserva la media entre streams y acota la amplificación.
- Sinkhorn-Knopp hace diferenciable la restricción, lo que permite el entrenamiento end-to-end.
- El overhead comunicado del 6,7 % es un logro de sistemas, no una propiedad exclusiva de la arquitectura.
mHC es una forma prometedora de estudiar una topología residual más ancha manteniendo bien condicionado el mapa residual repetido. Que merezca la pena para otro modelo depende de las mejoras de calidad independientes y del coste de reproducir su stack de sistemas.
Referencias
- mHC: Manifold-Constrained Hyper-Connections - Xie et al. (DeepSeek)
- Deep Residual Learning for Image Recognition - He et al. (ResNet)
- Hyper-Connections - Artículo original de HC
- TileLang - framework de optimización de kernels CUDA
- DualPipe - planificador de paralelismo de pipeline para DeepSeek-V3
- ResiDual - arquitectura con doble camino residual