Cómo auditar un data center existente antes de certificarlo Tier III/IV: 12 puntos críticos

Ilustración: Cómo auditar un data center existente antes de certificarlo Tier III/IV: 12 puntos críticos

Una auditoría previa a una certificación Tier III o Tier IV es el último filtro antes de comprometer CAPEX (gasto de capital) en adecuaciones que el certificador después rechazará. Hacerla bien evita dos errores opuestos: sub-dimensionar las adecuaciones (lo que lleva a fallar la auditoría y pagar doble) y sobre-dimensionarlas por miedo (lo que infla el presupuesto entre 20% y 40% sin valor operativo). El objetivo de la auditoría es mapear el gap exacto entre la operación actual y los requisitos del TIA-942-C para el Tier objetivo.

Este artículo describe los 12 puntos críticos que el auditor revisa en una pre-auditoría Tier III/IV, en qué orden de prioridad se evalúan, qué se considera subsanable y qué implica rehacer, y cómo estimar el costo de las adecuaciones antes de comprometerlas. La meta es que el lector termine con un checklist accionable, no con una promesa genérica de “cumplir con TIA”.

Los 12 puntos críticos en orden de severidad

No todos los puntos tienen el mismo peso en la certificación. El auditor ordena los hallazgos por severidad y por costo de remediación, y los 12 puntos siguientes cubren los que tipicamente deciden si el site aprueba o falla:

  • Concurrently maintainable (mantenibilidad concurrente): capacidad de realizar mantenimiento planeado en cualquier componente sin afectar la operación TI. Es el corazón de Tier III. Implica redundancia N+1 en sistemas eléctricos y mecánicos, con rutas de distribución dual desde la acometida hasta el rack. Si tu site tiene un solo UPS por sala, o un solo chiller sin redundancia, el finding es crítico y el costo de remediación es típicamente el más alto del proyecto.
  • Redundant capacity path (ruta de capacidad redundante): cada sistema crítico debe tener al menos dos rutas independientes de suministro (eléctrico y de enfriamiento). Un site con dos transformadores pero un solo bus de distribución falla este punto. El costo de remediación depende de la infraestructura eléctrica existente.
  • Concurrent maintainability of mechanical systems: chillers, bombas, torres de enfriamiento y CRAH/CRAC deben poder mantener cualquier unidad fuera de servicio sin afectar la operación. Similar al primer punto pero específico al sistema mecánico. Site con un solo chiller no subsana este punto con la compra de un segundo chiller si el piping no permite aislamiento.
  • Concurrent maintainability of electrical systems: idéntico al anterior pero para UPS, generadores, transferencias y distribución. Incluye la posibilidad de hacer bypass (operación temporal con energía directa de la red mientras el UPS está fuera) sin afectar la carga crítica.
  • Single points of failure (puntos únicos de falla): cualquier componente que, al fallar, provoque una interrupción del servicio TI. Identificarlos requiere walkthrough (recorrido físico) con diagramas unifilares actualizados y revisión de todos los sistemas, no solo los principales. El finding común es un solo ATS (Automatic Transfer Switch, interruptor de transferencia automática) entre la acometida y el generador.
  • Documentación operacional: el certificador pide procedimientos documentados para operación normal, mantenimiento planeado, respuesta a emergencias, y cambio de configuración. Site que opera sin runbooks (procedimientos operativos escritos) o con runbooks desactualizados falla este punto aunque la infraestructura física sea Tier III.
  • Capacitación del personal: evidencia de que el personal de operación está entrenado en los procedimientos. El certificador entrevista al personal en sitio y revida registros de capacitación. Site con personal que sabe operar pero no tiene evidencia documental falla este punto.
  • Sistema de monitoreo y BMS (Building Management System, sistema de gestión del edificio): presencia de un sistema centralizado que permita ver en tiempo real el estado de los sistemas eléctricos y mecánicos, con alarmas y tendencias. No requiere DCIM (Data Center Infrastructure Management, software especializado de gestión de infraestructura de data center) comercial: un BMS bien configurado cumple. Pero el site que opera con monitoreo manual o con herramientas dispersas falla.
  • Cumplimiento de TIA-942-C en tendido de cableado: separación entre cableado eléctrico y de datos, uso de canalizaciones apropiadas, etiquetado consistente. Es el punto más fácil de subsanar pero el más común de fallar por desidia.
  • Sistema de detección y supresión de incendios: detectores de humo en sala técnica y bajo piso técnico, sistema de supresión (gases limpios o agua nebulizada) dimensionado para la sala, pruebas documentadas. Site con extintores pero sin sistema de supresión automática falla este punto.
  • Seguridad física: control de acceso, CCTV, sistema de detección de intrusión, políticas de visita y registro. Cumple con regulación local y con las buenas prácticas documentadas en TIA-942-C.
  • Eficiencia energética documentada: evidencia de medición de PUE (Power Usage Effectiveness, eficiencia energética global), WUE (Water Usage Effectiveness, eficiencia en el uso del agua), y CUE (Carbon Usage Effectiveness, eficiencia de carbono). No es requisito de Tier III, pero el certificador lo observa como buena práctica y lo documenta en el reporte final.
  • Qué es subsanable y qué implica rehacer

    De los 12 puntos, nueve son subsanables con adecuaciones de costo manejable: documentación, capacitación, BMS, cableado, detección de incendios, seguridad física, eficiencia energética. Tres son estructurales y su remediación típicamente representa el 70% al 90% del costo total: redundancia eléctrica, redundancia mecánica y puntos únicos de falla. Site con un solo chiller o un solo UPS por sala, la decisión es binaria: o se invierte en la redundancia o se certifica como Tier II (que no requiere redundancia concurrente) y se abandona el objetivo Tier III.

    Antes de comprometer la inversión, vale la pena pedir una pre-auditoría formal con un consultor independiente (no el mismo que hará la certificación final, por conflicto de interés). El costo de la pre-auditoría es típicamente entre 15,000 y 40,000 USD; el costo de fallar la certificación formal es de 5 a 10 veces más, entre remediaciones de último momento y reprogramación del certificador.

    Cómo estimar el costo de las adecuaciones antes de comprometerlas

    Tres referencias ayudan a estimar el orden de magnitud. Primera, el documento TIA-942-C itself (Telecommunications Infrastructure for Data Centers, infraestructura de telecomunicaciones para data centers, el estándar que define los requisitos Tier) lista los requisitos detallados por nivel Tier; un walkthrough (recorrido físico de verificación) con esta lista como checklist da el 80% de los hallazgos. Segunda, las guías Uptime Institute (la organización que emite las certificaciones Tier) tienen plantillas de auto-evaluación que, aunque no son vinculantes, dan una referencia precisa. Tercera, un consultor con experiencia en al menos cinco certificaciones Tier III puede dar un estimado de costo con 30% de precisión sin haber pisado el site, basado en planos y descripción de la operación.

    Cuándo conviene NO certificar

    Tres escenarios justifican abandonar la certificación Tier III/IV.

  • Cuando la operación es menor a 200 kW y los requisitos de redundancia concurrente disparan el CAPEX entre 60% y 90% sin un retorno operativo que lo justifique.
  • Cuando el SLA (Service Level Agreement, acuerdo de nivel de servicio) con los clientes internos no exige Tier III (99.982% de disponibilidad); un SLA de 99.5% se cumple con Tier II y ahorros considerables.
  • Cuando el site se va a depreciar en menos de 5 años: la inversión en redundancia concurrente tiene retorno a 7-10 años; sites con horizonte más corto no la amortizan.

  • [1] TIA-942-C — Telecommunications Infrastructure for Data Centers — https://tiaonline.org/product/tia-942-c/

    [2] Uptime Institute — Data center industry resources — https://uptimeinstitute.com/

    [3] ASHRAE — Technical Resources (thermal management guidance) — https://www.ashrae.org/technical-resources

    [4] IEEE — Institute of Electrical and Electronics Engineers — https://www.ieee.org/

    También en Data Centers Facility

    ← Volver a categorías