Por qué tu UPS no soporta GPUs: el problema de inercia que ningún proveedor te dice

UPS industrial alimentando rack de servidores GPU en data center

Si migraste un rack de cómputo tradicional a uno de IA, tu proveedor de UPS probablemente te dijo que el equipo soporta la carga. Y en parte es verdad: soporta la potencia nominal. Lo que no soporta son tres efectos físicos combinados que las hojas técnicas no documentan: la inercia rotacional del generador diesel, el rectifier response time bajo picos de GPU de 4 ms, y el dimensionamiento de bancos VRLA para descargas profundas repetidas.

Este artículo desgrana cada uno y propone tres criterios que SÍ sirven para validar un UPS antes de un deployment AI.

Por qué los racks GPU rompen un UPS comercial

Un servidor con CPU consume potencia estable: rizado entre 200 y 500 watts absorbido sin transitorios significativos. Un rack con 8 GPUs H100 consume entre 14 y 22 kW con picos de hasta 4 ms que duplican la potencia nominal durante entrenamiento distribuido. Esa carga crea tres problemas que el UPS tradicional resuelve mal.

  1. Rectifier IGBT: los módulos IGBT típicos de UPS comercial tienen response time de 2 a 6 ciclos (33 a 100 ms en México a 60 Hz). Entre el pico del GPU y la compensación han pasado 33 a 100 ms, periodo durante el cual la carga cae a baterías.
  2. Bus DC: los UPS comerciales de 100 a 500 kVA usan bus DC común entre módulos. Bajo step load no lineal, los módulos entran en ringing entre 50 y 80 Hz durante 2 a 8 ciclos, periodo durante el cual la regulación de voltage cae fuera de tolerancia AT-001 (5%). La consecuencia es brownout transitorio que los GPUs detectan y desactivan celdas de cómputo para autoprotegerse.

Por qué las baterías VRLA fallan en cargas GPU

Un banco VRLA de UPS 200 kVA almacena entre 30 y 90 kWh a autonomía plena (factor de potencia 0.8, profundidad de descarga 80%). Bajo cargas CPU, 8 a 12 minutos de autonomía es estándar. Bajo cargas GPU la autonomía cae entre 30 y 50% por dos razones:

  1. Los picos profundos duplican la corriente instantánea en ventanas de 100 ms, aplicando doble estrés sobre cada celda VRLA.
  2. El ciclo del training distribuye descargas profundas en series de 60 a 90 segundos con recuperación de 30 a 45 minutos, no el patrón plano del datasheet. Ese régimen degrada cada celda entre 1.5 y 2 veces más rápido de lo declarado.

En data centers AI de producción (operadores anónimos, ref. EIA 2024), un banco VRLA diseñado para 10 minutos de autonomía CPU entrega entre 3 y 6 minutos bajo H100 a 80% de profundidad. Para 1.5 MW por rack, es la diferencia entre transferencia limpia al diesel y falla prematura.

Por qué la inercia rotacional del generador diesel importa

Cuando ocurre falla de red, el UPS pasa a baterías en milisegundos y transfiere al diesel en 5 a 15 segundos. Pero los generadores tienen inercia rotacional finita: el gobernador tarda entre 200 y 800 ms en ajustar inyección de combustible. Durante ese intervalo la frecuencia cae entre 58.5 y 59.5 Hz (sistema 60 Hz). Los H100 con regulación estricta pueden disparar UVP (Under-Voltage Protection) y apagarse preventivamente.

Tres criterios para validar tu UPS en una hora

Para cada uno necesitas menos de una hora con tu proveedor o equipo de operaciones; umbrales son claros y los criterios sirven para priorizar reemplazos antes de pegar racks AI.

  1. Solicita a tu proveedor el datasheet del módulo de potencia (IGBT o SiC) y mide response time bajo step load. UPS apto para racks AI debe responder de 0% a 100% en menos de 4 ms. Si responde en más de 4 ms la caída es suficiente para que el GPU active protección interna.
  2. Mide la autonomía efectiva bajo carga GPU real. Si baja a menos de 60% del datasheet declarado, las VRLA están envejeciendo aceleradamente y deben reemplazarse antes del deployment. Alternativa: banco LiFePO4 (LFP) duplica ciclaje a 1.8 a 2.5 veces el costo de VRLA pero recupera 2 a 3 años de vida operativa.
  3. Solicita a tu proveedor de generadores diesel la ficha técnica con Time to Frequency Recovery (TFR). Para racks AI, TFR debe ser menor a 300 ms. Generadores Tier 4 Final de 2 MVA en adelante cumplen típicamente; los de 1 MVA o menos rara vez. Considera volante de inercia (kinetic flywheel) si TFR está entre 300 y 600 ms; el CAPEX se recupera en 18 meses al evitar fallas prematuras en racks AI.

Cuándo SÍ vale la pena reemplazar el UPS

Tres condiciones combinadas para amortizar el reemplazo de UPS en 2 a 3 años:

  1. Tienes más de 50 kVA de carga GPU planificada en los próximos 24 meses.
  2. Tu UPS actual es Tier 3 con respuesta mayor a 8 ms.
  3. Tus generadores diesel son de 1 MVA o menos.

Cuándo NO vale la pena reemplazar el UPS todavía

Tres casos donde te conviene esperar antes de reemplazar el UPS:

  1. Cargas planeadas menor a 50 kVA (racks con inferencia de modelos medianos, fine-tuning corto o cargas batch menores).
  2. Tienes generador diesel Tier 4 Final de 2 MVA o mayor, que probablemente cumple TFR.
  3. Prefieres usar racks con AMD MI300X, que tienen regulación interna de voltage más permisiva que los H100.

En esos tres casos, tu UPS existente con módulos IGBT puede servirte uno o dos años más mientras aterrizas la decisión de scale-up.

Fuentes

  1. Uptime Institute — Tier classification, requisitos eléctricos y físicos para data centers — https://uptimeinstitute.com/
  2. ANSI/TIA — estándares aplicables (TIA-942-B-2023) — https://www.tiaonline.org/
  3. Vertiv — Three-phase UPS solutions y datasheets técnicos — https://www.vertiv.com/
  4. Schneider Electric — catálogo de UPS trifásicos y arquitecturas de respaldo para data centers — https://www.se.com/us/en/product-category/three-phase-uninterruptible-power-supply.html
  5. NVIDIA H100 datasheet — perfiles de potencia PCIe, modo NVL y SXM5 — https://www.nvidia.com/en-us/data-center/h100/

¿Quieres dominar este tema?

Noxtel Academy →

¿Quieres dominar este tema?

Noxtel Academy →

También en UPS y Energía de Respaldo

← Volver a categorías