ESEN

Alta disponibilidad: qué significa y cuánto cuesta de verdad

· 8 min de lectura · por el equipo técnico de SISArgentina

La alta disponibilidad no es un producto que se contrata: es una arquitectura donde ningún componente puede tirar el servicio solo. Cada nivel adicional de disponibilidad cuesta aproximadamente el doble que el anterior, porque hay que duplicar componentes y agregar el mecanismo que decide cuándo cambiar. La pregunta correcta no es cuánta querés sino cuánto te cuesta una hora caído.

Qué significa cada nivel

DisponibilidadCorte máximo por mesPor añoQué hace falta
99 %7 h 18 min3,65 díasUn servidor con respaldos
99,9 %43 min8,8 hServidor con recuperación rápida
99,95 %21 min4,4 hComponentes redundantes
99,99 %4 min52 minTodo duplicado, cambio automático
99,999 %26 s5 minVarios sitios, sin intervención humana

El salto de 99,9 a 99,99 no es un 0,09 por ciento más: es pasar de 43 minutos a 4, y eso ya no lo resuelve una persona respondiendo una alerta.

Los componentes que hay que duplicar

  1. Energía: dos alimentaciones por equipo, en circuitos distintos.
  2. Red: dos placas, a dos conmutadores distintos.
  3. Almacenamiento: discos en espejo y, si el nivel lo pide, almacenamiento replicado.
  4. Servidor: al menos dos, con el mecanismo que decide cuál atiende.
  5. Base de datos: réplica con promoción automática o manual, según el nivel.
  6. Enlace a internet: dos proveedores distintos, con anuncio propio de rutas.

La cuenta que define el nivel

Calculá cuánto factura tu operación por hora y multiplicalo por las horas de corte que permite cada nivel. Después compará ese número con lo que cuesta subir un escalón.

Para muchas empresas, el resultado muestra que 99,9 por ciento es el punto razonable: el costo de subir a 99,99 supera lo que se pierde en esos 39 minutos anuales de diferencia.

Lo que se olvida al diseñar redundancia

  • El mecanismo de cambio también puede fallar, y a veces provoca cortes que no habría habido.
  • Dos servidores en el mismo rack comparten la misma alimentación del rack.
  • Una réplica que nadie probó promocionar no es una réplica: es una copia.
  • El DNS con TTL alto anula el cambio: los clientes siguen yendo al servidor caído.
  • La disponibilidad de tu proveedor de pagos o de tu API externa también cuenta en la cadena.

Preguntas frecuentes

¿El SLA garantiza que no me voy a caer?

No. Garantiza una compensación si se supera el corte comprometido. Suele ser un crédito sobre el abono, que casi nunca cubre lo que costó estar caído.

¿Sirve tener dos servidores en el mismo datacenter?

Cubre la falla de un equipo, que es la más frecuente. No cubre un corte del datacenter entero: para eso hacen falta dos sitios.

¿Por dónde empezar con presupuesto acotado?

Por los respaldos probados y el monitoreo con alertas. Bajan el tiempo de recuperación muchísimo más por peso invertido que cualquier duplicación de hardware.

Seguí leyendo