Los 7 errores que cometen los DC managers en su primer año
Hay errores que se repiten en cada generación de DC managers nuevos. No son errores de conocimiento, son de atención: cosas que parecen obvias en retrospectiva y se ignoran en la prisa del día a día.
Aquí va el catálogo de los siete que más cuesta caro ignorar.
1. Subestimar la carga futura del cooling
El DC se diseña para una carga de TI específica, pero la carga crece. Los primeros signos son CRACs trabajando al límite, delta-P alto en el agua helada y CRACs redundantes que ya no son redundantes.
Mitigación: diseño con margen del 25% sobre la carga esperada a 3 años, y monitoreo continuo del consumo por rack.
2. No documentar el cableado físico
El cableado de red y de potencia es el activo más dinámico del data center. Si no hay una base de datos actualizada, cualquier cambio se vuelve arqueología: abres el piso técnico y descubres cables no identificados.
Mitigación: CMDB o DCIM con el cableado documentado desde el día uno. Cada cambio se registra en el mismo momento en que se hace.
3. Comprar UPS sin probar las baterías
Las baterías de UPS tienen vida útil de 3-5 años. Si no se prueban periódicamente, descubres que están muertas el día que falla la acometida eléctrica.
Mitigación: prueba anual de autonomía con carga real, y reemplazo planificado según horas de servicio del fabricante.
4. No revisar accesos de manera periódica
Usuarios que dejaron la organización hace meses siguen con permisos activos sobre la sala de servidores o sobre los switches. La auditoría es operacional, no solo legal.
Mitigación: revisión trimestral de accesos. Automatiza el cruce con el sistema de RR.HH. para eliminar usuarios al momento de baja.
5. No probar el DRP (Plan de Recuperación ante Desastres)
Tienes un documento. Tienes los contactos en una hoja de cálculo. Nadie lo ha ejecutado nunca en condiciones reales. Cuando ocurre el incidente, el documento falla donde nadie había pensado.
Mitigación: simulacro anual con escenarios (falla de UPS, falla de proveedor de internet, ransomware, falla de chillers). Documentar qué falló y corregir.
6. Sobrecontratar la redundancia eléctrica
No toda la carga necesita Tier III. Definir niveles de redundancia por carga (tier por rack o por isla) reduce CAPEX y OPEX sin sacrificar disponibilidad real. La distribución uniforme de redundancia máxima es desperdicio.
Mitigación: clasificar cargas por criticidad. Tier III para producción, Tier II para desarrollo, Tier I para pruebas y backups offline.
7. Olvidar la operación cotidiana
El data center es física, no solo digital. Humedad, polvo, temperatura ambiente, plaga, ruido, vibración. Equipos que nadie toca por meses acumulan problemas hasta que un día fallan.
Mitigación: rondas físicas semanales con checklist. Bitácora actualizada. Cualquier anomalía se reporta antes de que escale.
Estos siete errores comparten un patrón: son fallas de proceso, no de tecnología. La tecnología es lo de menos. El hábito de revisar, documentar y probar es lo que separa un DC que sobrevive una década de uno que se reconstruye a los cinco años.
Fuentes
[1] TIA — ANSI/TIA-942-B (Telecommunications Infrastructure for Data Centers): https://www.tiaonline.org/
[2] Uptime Institute — Tier Standard (operational tier reference): https://uptimeinstitute.com/tier-classification/
[3] BICSI — Data Center Operations Best Practices (industry reference): https://www.bicsi.org/
[4] IFMA — Facility Management Body of Knowledge (operations reference): https://www.ifma.org/
[5] Wikipedia — Data Center Operations (background reference): https://en.wikipedia.org/wiki/Data_center
