Documentación del data center: qué manuales necesitas y por qué importan más que el hardware
La documentación de un data center es el insumo que sostiene la operación durante los próximos 10-15 años. Un equipo bien documentado sobrevive al cambio de personal, al incidente nocturno y a la auditoría. Un equipo mal documentado depende de la memoria de quien se vaya mañana.
Por qué la documentación importa más que el hardware
El hardware se compra y se reemplaza. La documentación, si no existe, no se puede reemplazar. Cuando llega un incidente a las 3 AM y el técnico nuevo no sabe dónde está la llave del cuarto eléctrico o qué breaker (interruptor) alimenta qué PDU, los minutos se convierten en horas y las horas en SLA (compromiso de nivel de servicio) incumplidos.
La documentación también es la base de la auditoría. ISO 27001, SOC 2 y PCI DSS piden evidencia documental de procedimientos, controles y responsabilidades. Sin esa evidencia, la certificación es inviable.
Manuales que un data center operativo debe tener
- Manual de operación del sitio (Site Operating Manual): procedimientos diarios de operación, rutinas de inspección, contactos de emergencia, esquema de escalamiento de incidentes.
- Diagramas unifilares eléctricos (Single Line Diagram): el esquema de la acometida (alimentación eléctrica principal), transformador, UPS, transferencia, generador, PDU y paneles. Debe estar actualizado con cada modificación y guardado en formato digital editable.
- Planos as-built (planos que reflejan lo realmente instalado): reflejan lo que está físicamente en el sitio, no lo que decía el proyecto original. Incluyen rutas de cableado eléctrico, de red, de tuberías de agua helada y de bandejas.
- Inventario de activos (Asset Register): cada equipo con número de serie (serial), modelo, fecha de instalación, garantía, ubicación exacta, peso, consumo y responsable. Base de cualquier decisión de reemplazo o mantenimiento.
- Runbook de incidentes: procedimientos paso a paso para las 20-30 contingencias más probables (falla de UPS, fuga de agua, sobrecalentamiento, pérdida de un carrier de red, falla de chillers, etc.).
- Manual de mantenimiento: planes preventivos por equipo, frecuencias, repuestos críticos y proveedores de servicio. Conectado al CMMS (Computerized Maintenance Management System, sistema computarizado de gestión de mantenimiento) si lo hay.
- Matriz de riesgos y controles: el documento vivo que alimenta ISO 27001 y SOC 2. Riesgos identificados, probabilidad, impacto, control asociado, responsable y fecha de revisión.
- Plan de recuperación ante desastres (DRP, Disaster Recovery Plan) y plan de continuidad de negocio (BCP, Business Continuity Plan): cómo restaurar el servicio tras un incidente mayor, con RTO (Recovery Time Objective, tiempo objetivo de recuperación) y RPO (Recovery Point Objective, punto objetivo de recuperación) definidos.
- Capacitación y certificaciones del personal: registro de quién está certificado en qué (ATD, CDCP, CDFOM, etc., las certificaciones más reconocidas de la industria) y cuándo vence cada una.
- Bitácora de cambios (Change Log): toda modificación al entorno debe quedar registrada con fecha, autor, motivo y validación. Es la línea de tiempo que conecta un incidente con su causa raíz.
Qué formato y dónde guardar la documentación
El formato importa. Un PDF en la laptop del técnico anterior no es documentación operativa: es un archivo perdido. La documentación útil cumple tres reglas.
- Está donde se necesita: en el DCIM, en el CMMS, en el sistema de tickets, en el wiki interno. Nunca solo en una laptop.
- Está versionada: cada cambio queda registrado con autor, fecha y motivo.
- Es legible bajo presión: escrita para que un técnico a las 3 AM la entienda sin tener que llamar a tres personas.
Errores comunes que se pagan caros
- Documentar al final del proyecto. La documentación debe recolectarse durante la construcción, no después. Lo que no se documenta en obra se pierde.
- No actualizar tras una intervención. Cada cambio de breaker, cada reubicación de PDU, cada reemplazo o intercambio (swap) de UPS debe reflejarse en los planos.
- Confiar en la memoria del equipo. La persona que sabe todo hoy se va mañana. Si su conocimiento no está en un documento, se fue con ella.
- Tener documentación sin proceso de revisión. Un documento desactualizado es peor que uno inexistente, porque da falsa confianza.
Cómo empezar si tu DC está poco documentado
No intentes documentarlo todo de golpe. Empieza por los tres documentos que más impactan operación: diagrama unifilar, runbook de los 5 incidentes más probables e inventario de activos. Esas tres piezas ya cambian el riesgo operativo del sitio.
A partir de ahí, avanza por valor: primero lo que usas en incidentes, después lo que necesitas para auditorías, finalmente lo que solo se consulta en proyectos puntuales. La documentación crece con el uso, no con el archivo.
La documentación bien hecha es la diferencia entre un data center que escala y uno que vive apagando incendios. No es glamorosa, no se ve, pero cuando hace falta, no hay con qué pagarle.
Fuentes
[1] TIA — Standards Overview — https://tiaonline.org/standards/
[2] Uptime Institute — Tier Standard: Topology and Operational Sustainability — https://uptimeinstitute.com/tiers
[3] BICSI — Standards Program — https://www.bicsi.org/standards/bicsi-standards/about-the-program
[4] IBM — Data Center Documentation Best Practices — https://www.ibm.com/topics/data-center-management
[5] Wikipedia — Data center — https://en.wikipedia.org/wiki/Data_center
