Alta disponibilidad en Proxmox: escalar sin confundir más nodos con más resiliencia

Proxmox VE en el CPD de Tecnidom

Escalar un clúster no consiste simplemente en añadir servidores. Más nodos crean nuevas posibilidades, pero también nuevas dependencias y más elementos que operar.

En un entorno Proxmox, la alta disponibilidad debe diseñarse alrededor del servicio que queremos proteger, no alrededor del número de equipos disponibles.

Quorum antes que HA

Un clúster necesita tomar decisiones de forma consistente incluso cuando pierde comunicación con parte de sus nodos. Ahí entra el quorum.

La arquitectura debe evitar situaciones en las que dos partes del clúster crean simultáneamente que tienen autoridad para operar el mismo recurso.

Qué aporta un clúster multinodo

  • Migración de cargas entre nodos.
  • Mantenimiento con menor impacto.
  • Capacidad de reiniciar determinadas VMs en otro nodo.
  • Distribución de CPU y memoria.
  • Mayor flexibilidad para crecimiento.

El almacenamiento sigue siendo crítico

La VM puede arrancar en otro nodo solo si los datos necesarios siguen disponibles. Por eso HA y almacenamiento deben diseñarse conjuntamente.

También hay que evaluar latencia, red de almacenamiento y comportamiento ante particiones.

Red y energía

Un clúster redundante conectado a un único switch o a una única alimentación sigue teniendo puntos únicos de fallo.

La alta disponibilidad real obliga a mirar más allá del hipervisor: comunicaciones, energía, almacenamiento, DNS, firewall y servicios externos.

HA no sustituye los backups

Si eliminamos una VM o corrompemos datos, la replicación puede propagar el problema perfectamente. La alta disponibilidad reduce determinados tiempos de caída; la copia de seguridad permite volver atrás.

Dimensionar según impacto

No todos los servicios necesitan el mismo nivel de redundancia. En Tecnidom priorizamos qué cargas justifican HA y cuáles pueden recuperarse mediante procedimientos de restauración dentro de un tiempo aceptable.

La arquitectura profesional no maximiza componentes. Equilibra coste, complejidad y tiempo de recuperación.

Qué puede y qué no puede resolver HA

Problema¿HA ayuda?Qué más hace falta
Fallo de un nodoSíCapacidad libre y almacenamiento accesible
Corrupción de datosNoBackups y puntos de restauración
Fallo de un switchSolo si hay redundanciaDiseño de red sin punto único
Corte eléctricoSolo parcialmenteSAI, alimentación y apagado ordenado
Error humanoNo necesariamenteProcedimientos, permisos y copias

Capacidad N+1 y mantenimiento real

Si perder un nodo deja al resto sin CPU o RAM suficiente para absorber las cargas críticas, el clúster existe pero la alta disponibilidad es teórica.

El dimensionamiento debe contemplar qué servicios deben sobrevivir a una pérdida y cuánto margen queda durante mantenimientos planificados.

Fencing y recuperación controlada

La alta disponibilidad necesita evitar que una VM pueda arrancar simultáneamente en dos sitios con acceso al mismo almacenamiento. Los mecanismos de fencing y quorum existen precisamente para impedir decisiones ambiguas.

No es una función que convenga activar sin entender antes almacenamiento, red y comportamiento ante particiones.

Preguntas frecuentes

¿Tres nodos son siempre mejores que dos?

No por sí solos. Ayudan a quorum y distribución, pero la resiliencia depende del diseño completo y de los puntos únicos de fallo que sigan existiendo.

¿HA elimina la necesidad de PBS?

No. HA mantiene servicios ante ciertos fallos de infraestructura. Proxmox Backup Server permite recuperar estados anteriores cuando el problema está en los datos o en la propia VM.

¿Todas las VMs deben estar en HA?

No. Conviene priorizar servicios cuyo tiempo de parada justifica la complejidad y los recursos necesarios.

Alta disponibilidad con un objetivo de negocio

Antes de activar HA preguntamos cuánto tiempo puede estar parado cada servicio y cuánto cuesta esa parada. Esa respuesta define la arquitectura mucho mejor que el número de nodos. Si necesitas revisar resiliencia y virtualización, puedes hacerlo dentro de nuestras soluciones de infraestructura IT.

Antonio Domenech Pico
Sobre el autor

Antonio Domenech Pico

Antonio Domenech Pico es administrador de sistemas y fundador de Tecnidom. Cuenta con más de 30 años de experiencia en informática, trabajando con infraestructura, servidores, redes, monitorización, automatización y ciberseguridad para empresas.

Tecnidom

¿Necesitas ayuda con la tecnología de tu empresa?

Podemos revisar contigo qué está ocurriendo, qué riesgos existen y por dónde tiene sentido empezar.