GPU clusters para IA: lo que tu data center necesita antes de instalar el primer H100
Un clúster de GPUs para entrenamiento o inferencia de modelos grandes no se parece en nada a un clúster tradicional de cómputo general. La densidad por rack pasa de 8 a 12 kW a 60 a 100 kW, el consumo eléctrico es simultáneo en lugar de variable, y la red interna exige anchos de banda que la mayoría de los data centers no tienen dimensionados. Instalar el primer H100 sin haber resuelto antes estos tres frentes es la causa más común de proyectos que se retrasan seis meses y duplican CAPEX.
Este artículo describe qué cambia operativamente cuando un data center se orienta a cargas de inteligencia artificial, qué parámetros técnicos se ven afectados y qué decisiones de diseño conviene tomar antes de energizar el primer rack de GPUs. No es un manual de NVIDIA ni una guía de compra: es la lista de pendientes que tu equipo de infraestructura debe cerrar antes de la firma del contrato con el proveedor de cómputo acelerado.
Por qué un rack de IA no se parece a un rack tradicional
Un rack típico de IA aloja entre 4 y 8 nodos computacionales, cada uno con 8 GPUs H100 o equivalente, más CPU host, memoria del sistema, almacenamiento NVMe (Non-Volatile Memory Express, interfaz de alta velocidad para SSD) y red de alta velocidad dedicada. La consecuencia inmediata es que la densidad eléctrica del rack se multiplica entre 5 y 10 veces respecto a un rack tradicional de cómputo general.
El perfil de carga también cambia. En cómputo tradicional, los servidores tienen picos diurnos entre un 20% y un 30% sobre la media. En entrenamiento de modelos grandes, los picos son simultáneos y de corta duración pero exigen que el sistema eléctrico, el enfriamiento y la red estén dimensionados para soportarlos sin mitigación de velocidad (throttling). Lo que en cómputo tradicional es un margen operativo, en IA es una restricción dura: una caída de voltaje de 100 ms puede abortar un entrenamiento de 72 horas.
Lo que cambia en potencia y enfriamiento
El primer cambio visible es la acometida eléctrica. Un rack de IA con 8 nodos H100 a plena carga puede consumir de 80 a 100 kW, lo que exige circuitos trifásicos dedicados por rack, no las salidas monofásicas que suelen abundar en data centers tradicionales. La unidad de PDU (Power Distribution Unit) pasa de 16 a 32 A monofásicos a 60 a 100 A trifásicos por fase.
El segundo cambio es el enfriamiento. La densidad de 80 a 100 kW por rack supera por mucho la capacidad de los CRAC (Computer Room Air Conditioning, unidades de aire acondicionado de precisión) de perímetro, que típicamente manejan de 15 a 25 kW por rack en diseño conservador. La transición natural es a enfriamiento líquido — ya sea placa fría (cold plate) directo al chip o distribución de agua fría a la fila — pero existen opciones intermedias como intercambiadores de calor en puerta trasera (rear-door heat exchangers) o enfriamiento entre filas (in-row cooling) que pueden extender la vida útil de un data center tradicional antes de la migración completa a líquido.
Red y topología: lo que la IA exige
La red interna de un clúster de IA no es una red corporativa: es una red de interconexión entre GPUs que mueve cientos de GB/s entre nodos durante el entrenamiento distribuido. Esto se construye sobre tecnologías como InfiniBand NDR (Next Data Rate, 400 Gb/s por enlace) o Ethernet de 400G/800G con RoCE (RDMA over Converged Ethernet, protocolo que permite acceso directo a memoria remota sobre Ethernet), y exige switches de alta densidad con baja latencia y jerarquía non-blocking.
Un diseño típico para 8 racks de H100 puede incluir dos capas de switches: una capa leaf con 8 puertos de 400G por switch que conectan directamente a los nodos computacionales, y una capa spine que agrega las hojas. El número exacto de switches y puertos depende del algoritmo de entrenamiento paralelo que se vaya a correr, pero el dimensionamiento de fibra y transceptores para soportar 400G por enlace sigue las reglas discutidas en el artículo sobre DAC, AOC y fibra monomodo.
Cinco decisiones técnicas que tienes que tomar antes de instalar el primer H100
| Área de Infraestructura | Decisión Crítica a Documentar | Impacto Operativo si se Posterga |
|---|---|---|
| Capacidad eléctrica | Margen en el sistema eléctrico para añadir de 60 a 100 kW por rack sin disparar límites de acometida | Restricción a menor densidad por rack o ampliación de UPS con obra civil de 9 a 12 meses |
| Topología de enfriamiento | Decidir entre placa fría (cold plate), intercambiadores de calor en puerta trasera (rear-door heat exchangers) o enfriamiento entre filas (in-row cooling) antes del primer nodo | Mezcla de topologías en un mismo clúster que complica la operación |
| Red y topología | Definir InfiniBand vs Ethernet 400G/800G, número de switches por capa y plan de direccionamiento | Re-cableado costoso de zonas enteras del data center |
| Layout físico y flujo de aire | Zona dedicada con contención caliente para los racks de IA | Recirculación de aire y disparo de mitigación de velocidad (throttling) antes de la hora de operación |
| Plan de monitoreo y respuesta | Métricas por nodo (potencia, temperatura, telemetría de red, errores) con frecuencia y responsable asignado | Caídas sin diagnóstico y costos de reentrenamiento al descubrir las fallas tarde |
Riesgos comunes y cómo evitarlos
Cuatro riesgos concentran la mayoría de los proyectos que se retrasan o exceden presupuesto al instalar el primer clúster de IA:
- Subdimensionar la acometida eléctrica. Es el error más frecuente. La decisión se toma con la configuración inicial, pero el crecimiento del clúster a 12-18 meses exige potencia que no estaba contemplada, y ampliar una subestación es una obra civil que puede tomar 9-12 meses en México.
- Elegir la topología de red equivocada. InfiniBand NDR y Ethernet 800G tienen latencias similares para cargas de entrenamiento, pero el ecosistema de herramientas, el costo de los switches y la disponibilidad de personal capacitado difieren significativamente. La decisión debe alinearse con la estrategia de talento del equipo, no sólo con el rendimiento.
- Subestimar la carga de calor en sala. Un rack de 80 kW genera el equivalente térmico de un horno industrial pequeño. Si el sistema de enfriamiento no estaba dimensionado, el diferencial de temperatura entre la entrada y la salida de aire del rack supera los 15°C y dispara throttling antes de las dos horas de operación.
- Postergar el plan de monitoreo. La telemetría fina no es opcional: sin métricas por nodo, una falla de una GPU individual se manifiesta como una tarea (job) lenta, no como una alerta. Esto multiplica el tiempo de diagnóstico y dispara costos de reentrenamiento cuando la falla se descubre tarde.
Fuentes
[1] NVIDIA — DGX Systems (data center AI compute platform) — https://www.nvidia.com/en-us/data-center/dgx-systems/
[2] NVIDIA — Data Center products overview — https://www.nvidia.com/en-us/data-center/
[3] IEA — Data Centres and Data Transmission Networks — https://www.iea.org/energy-system/digitalisation/data-centres-and-data-transmission-networks
[4] Uptime Institute — Research and reports — https://uptimeinstitute.com/resources/research-and-reports/
[5] Wikipedia — GPU cluster (background reference) — https://en.wikipedia.org/wiki/GPU_cluster
