AI workloads vs workloads tradicionales: el abismo en power, cooling y network

Durante dos décadas el dimensionamiento de un data center se hizo con reglas estables: racks de 5 a 10 kW, PUE (eficiencia del uso de energía) entre 1.4 y 1.8, switches con uplinks de 10G o 40G, y una arquitectura de red jerárquica que escalaba agregando spines (núcleo de red) o leaves (capas de acceso). Los workloads de inteligencia artificial — entrenamiento de modelos grandes, inferencia masiva, fine-tuning distribuido — rompieron las cuatro reglas al mismo tiempo.

La densidad por rack pasó de 10 kW a 60-100 kW en sitios de entrenamiento, el perfil de carga pasó de predecible a altamente variable con picos simultáneos, el tráfico east-west (entre servidores del mismo cluster) reemplazó al north-south como dominante, y la arquitectura de red jerárquica tradicional dejó de sostener la demanda.

Este artículo describe qué cambió en cada una de esas cuatro variables, por qué un data center diseñado para cargas tradicionales no puede hospedar cargas de IA sin reconstrucción parcial, y qué decisiones de diseño separan a un sitio preparado para IA de uno atrapado en un rediseño costoso.

Power: del kW al MW por rack

Un rack tradicional de cómputo general (web, bases de datos, correo) consume entre 5 y 10 kW con un perfil predecible: variaciones diurnas del 20-30% sobre la media, planificables con histórico mensual. Un rack de entrenamiento de modelos grandes consume entre 60 y 100 kW — una densidad 10x mayor — con un perfil de carga donde los picos coinciden con las fases de cómputo intensivo del entrenamiento y bajan durante las fases de sincronización. Según los análisis publicados por la International Energy Agency (IEA) en su Electricity 2024, el consumo eléctrico agregado del sector de data centers está creciendo a tasas superiores al promedio de la demanda eléctrica total, y la proporción atribuible a cargas de IA está aumentando dentro de ese total.

La consecuencia operativa es que un sitio preparado para IA necesita una acometida eléctrica dimensionada para megawatts por fila, no para kilowatts por rack — y eso cambia el tipo de transformador, el calibre de los cables, la capacidad de los UPS y la arquitectura de respaldo. NVIDIA documenta en las hojas técnicas de la familia DGX (sistemas de cómputo acelerado) que un rack DGX H100 típico consume en el orden de 40-50 kW, y un cluster multi-rack escala linealmente.

Enfriamiento: el perfil de carga que cambió todo

El sistema mecánico de un data center tradicional está dimensionado para una carga térmica continua con margen. El sistema mecánico de un sitio de IA tiene que disipar calor concentrado en volumen pequeño y absorber picos térmicos simultáneos cuando todos los nodos del cluster arrancan una fase de cómputo intensivo. Esto obliga a replantear tres decisiones del diseño mecánico:

  • Densidad de potencia por rack. 60-100 kW por rack implica que el sistema de extracción de aire debe mover volúmenes de aire 5-10x mayores que en un rack tradicional, o complementar con enfriamiento líquido directo al chip (DLC, Direct Liquid Cooling) o rear-door heat exchangers (intercambiadores de calor traseros).
  • Temperatura de operación. La concentración de calor reduce la capacidad del aire como medio de transporte térmico. ASHRAE amplió en sus guías técnicas recientes el rango aceptable de temperatura y humedad para equipo de TI moderno, pero para racks de IA ese rango es más estrecho: el equipo funciona, pero con menos margen térmico, lo que aumenta el riesgo de throttling (reducción automática de velocidad para evitar sobrecalentamiento) si el sistema mecánico falla.
  • Redundancia mecánica. El perfil de picos térmicos simultáneos reduce el efecto promedio de la redundancia N+1 (un componente de respaldo por cada componente principal). En un sitio de IA, el sistema mecánico suele requerir redundancia 2N (sistemas duplicados completos) en las etapas de extracción, no solo N+1.

Networking: dónde se rompe la arquitectura tradicional

La arquitectura de red jerárquica tradicional — spines de 40G o 100G, leaves con puertos 10G o 25G, uplinks al spine con bundles de 4 o 8 enlaces — fue diseñada para tráfico north-south donde la mayor parte de los datos entran y salen del data center.

El entrenamiento distribuido de modelos grandes invierte esa proporción: cada GPU de un cluster necesita comunicarse con todas las demás GPUs en cada paso de entrenamiento, generando tráfico east-west (entre servidores del mismo cluster) que puede llegar a 10x o más del tráfico norte-sur.

La consecuencia es que las arquitecturas jerárquicas saturadas en sus uplinks dejan de sostener el rendimiento, y la industria está migrando a fabrics (tejidos de red) con switches de alta densidad de puertos 400G o 800G, topologías Clos (redes con múltiples caminos paralelos) de tres niveles y conectividad directa entre GPUs vía NVLink (enlace propietario de NVIDIA) o InfiniBand (estándar de red de alto rendimiento). Un sitio diseñado para 10G/40G north-south no soporta 400G/800G east-west sin reconstruir la planta de switches y el cableado troncal.

Tabla comparativa: tradicional vs IA

| Variable | Workload tradicional | AI workload |

VariableWorkload tradicionalAI workload
Densidad por rack5-10 kW60-100 kW
Perfil de cargaPredecible, variación 20-30%Picos simultáneos, alta variabilidad
Tráfico dominanteNorth-south (entrada/salida)East-west (entre servidores)
Velocidad de enlace típica10G / 25G acceso, 40G / 100G uplink400G / 800G acceso, 800G+ uplink
Arquitectura de redJerárquica (spine-leaf clásico)Clos de 3 niveles + high-radix (muchos puertos)
Tipo de cómputoCPU generalGPU/TPU (unidades de procesamiento gráfico o tensorial) especializada
PUE objetivo1.4-1.81.1-1.3 (con free cooling híbrido)
Sistema mecánico típicoAire, redundancia N+1Aire + DLC híbrido, redundancia 2N

El veredicto: Adaptar la infraestructura o quedar en la obsolescencia

El abismo entre cargas tradicionales y cargas de IA no es una diferencia gradual — es un quiebre en cuatro dimensiones simultáneas (potencia, térmica, red, redundancia) que obliga a reconstruir el sitio si se quiere hospedar IA con margen de crecimiento. La buena noticia es que la industria publica regularmente hojas de ruta y arquitecturas de referencia (NVIDIA DGX, arquitecturas de hyperscaler, análisis de IEA) que sirven como punto de partida para tomar decisiones. La mala noticia es que esas decisiones se vuelven más costosas con cada año que el sitio se mantiene en su arquitectura original.


Fuentes

[1] IEA — Electricity 2024: https://www.iea.org/reports/electricity-2024

[2] Uptime Institute — Data Center Resources: https://uptimeinstitute.com/resources

[3] Uptime Institute — Blog: https://uptimeinstitute.com/blog

[4] ASHRAE Standard 90.1: https://www.ashrae.org/technical-resources/bookstore/standard-90-1

[5] Wikipedia — Hyperscale computing: https://en.wikipedia.org/wiki/Hyperscale_computing

[6] Wikipedia — Power usage effectiveness: https://en.wikipedia.org/wiki/Power_usage_effectiveness

[7] Wikipedia — Nvidia DGX: https://en.wikipedia.org/wiki/Nvidia_DGX

[8] NVIDIA — DGX Systems: https://www.nvidia.com/en-us/data-center/dgx-systems/

[9] NVIDIA — H100 Tensor Core GPU: https://www.nvidia.com/en-us/data-center/h100/

[10] Wikipedia — Data center: https://en.wikipedia.org/wiki/Data_center

También en Mundo digital

← Volver a categorías