Configuración de alta disponibilidad con Proxmox: una guía completa para clústeres de producción
En este artículo, aprenderá los pasos para configurar la alta disponibilidad (HA) con Proxmox y cómo crear un clúster de producción estable.

Configuración de alta disponibilidad con Proxmox: una guía completa para clústeres de producción

Esta guía completa te ayudará a crear un clúster de producción estable configurando la alta disponibilidad (HA) con Proxmox. Desde los pasos iniciales de instalación hasta las configuraciones de seguridad y operativas, todo se explica en detalle.
0 acciones
0
0
0
0

 

¿Cómo proporcionar disponibilidad confiable (HA) con Proxmox para clústeres de producción?

Lanzamiento Alta disponibilidad con Proxmox Su objetivo es reducir el tiempo de inactividad del servicio y garantizar la disponibilidad de máquinas virtuales y contenedores ante fallos de hardware o software. Dirigida a administradores de servidores, profesionales de DevOps, proveedores de servicios en la nube y equipos técnicos, esta guía abarca los fundamentos, los requisitos previos, la configuración práctica y consejos de seguridad. Incluye ejemplos y comandos reales de Linux, y trata temas como el almacenamiento compartido (Ceph/NFS/iSCSI), redes, el aislamiento de red (STONITH) y diversas soluciones prácticas.

 

Requisitos y arquitectura general para Proxmox HA

Para tener alta disponibilidad estable en Proxmox necesitas lo siguiente:

  • Al menos 3 nodos físicos Para garantizar el quórum en modo normal. En el caso de dos nodos, debe Dispositivo Q O bien, recurrir a un mediador externo.
  • Una capa Almacenamiento compartido Para máquinas virtuales: Ceph RBD Es la mejor opción para alta disponibilidad y migración en vivo. NFS, iSCSI O DRBD También existen otras opciones.
  • Una red de gestión separada para el tráfico del clúster y corosync Con bajo ancho de banda y baja latencia.
  • Mecanismo Valla/STONITH Para evitar el síndrome del cerebro dividido.
  • Programación y supervisión de copias de seguridad.

Arquitectura propuesta:

  • Red de administración (red de clúster): 2 x 10 Gb o 1 Gb + LACP, direccionamiento privado (por ejemplo, 10.10.0.0/24).
  • Red de almacenamiento (Ceph): Interfaces separadas con MTU 9000 (jumbo).
  • Red de servicio: pública/VLAN para acceso de clientes y servicios.
  • Al menos 3 nodos Proxmox con Ceph MON y OSD o un nivel de almacenamiento NFS con UPS y NAS HA.

 

¿Por qué recomendamos Ceph?

Las principales razones para proponer Ceph:

  • RBD Como sistema de almacenamiento en bloques distribuido, permite la migración en vivo sin necesidad de mover los archivos del disco.
  • Ausencia punto único de falloEscalabilidad vertical y horizontal.
  • Integración nativa con Proxmox a través de pveceph.

 

Pasos prácticos: desde la instalación hasta la activación de HA.

En este ejemplo, configuraremos un clúster de 3 nodos con Ceph y HA para máquinas virtuales. Los pasos principales son los siguientes:

1) Instalar la base de Proxmox en cada nodo.

Instálelo en cualquier servidor Proxmox VE (compatible con las versiones 6/7/8). Tras la instalación, configure las direcciones de administrador y SSH y actualice el sistema:

sudo apt update && sudo apt dist-upgrade -y

2) Crear un clúster (en el primer nodo)

Cree el clúster en el primer nodo y verifique el estado:

sudo pvecm create my-cluster
pvecm status

3) Agregar nodos al clúster

Ejecute el siguiente comando en cada nodo secundario y luego verifique el estado del clúster:

sudo pvecm add <IP-نود-اول>
pvecm nodes
pvecm status

4) Red CoreSync y MTU

Asegúrese de que bindnetaddr esté activado. /etc/pve/corosync.conf Tienes una red configurada correctamente y de baja latencia. Para Ceph, usa MTU 9000 Úselo y habilítelo en la tarjeta de red y en el conmutador.

5) Instalación y configuración de Ceph (ejemplo sencillo)

Comandos básicos para instalar y configurar Ceph en cada nodo:

pveceph install
pveceph init --mon-ip <IP-نود>
pveceph createosd /dev/sdb
ceph -s

6) Active HA Manager y agregue la máquina virtual a HA.

En la interfaz web: Centro de datos → HA → Agregar → seleccione el recurso (por ejemplo, vm:100 o ct:101) y especifique la política (reiniciar, migrar).

También puedes agregar el recurso desde la CLI con pvesh:

pvesh create /cluster/ha/resources -resource vm:100 -state started -max_restart 3
ha-manager status
pvesh get /cluster/ha/status

7) Pruebas de conmutación por error

Para simular un corte de energía en un nodo y comprobar si las máquinas virtuales se inician en otros nodos:

ssh root@node1 "shutdown -h now"
ha-manager status
qm list

 

Configuración de red recomendada

Recomendaciones para el diseño de redes:

  • Dos redes físicas separadas para gestión y almacenamiento. VLAN para el aislamiento del tráfico.
  • Enlace (LACP) para redundancia y mayor ancho de banda. Configuración de ejemplo:
auto bond0
iface bond0 inet manual
    bond-slaves eth0 eth1
    bond-mode 802.3ad
    bond-miimon 100

Para Ceph, se recomienda configurar la MTU en 9000 y que el conmutador de red admita tramas jumbo.

 

Esgrima (STONITH) y prevención del síndrome de cerebro dividido

El uso de cercas es necesario para aislar un nodo defectuoso. Proxmox admite agentes de cercado.

apt install fence-agents

Ejemplo de comando IPMI para cercado:

fence_ipmilan -a <IP> -l <USER> -p <PASS> -o poweroff

En entornos de nube o centro de datos, puede utilizar IPMI/BMC o cercado basado en red (por ejemplo, valla virtual) utilizado. En caso de dos nodos, asegúrese de crear un QDevice con el comando Configuración del dispositivo qdevice pvecm O bien, tener un tercer testigo.

 

Consejos para todo tipo de aplicaciones (trading, juegos, IA/GPU, renderizado)

VPS para trading: Elegir una ubicación cercana a las bolsas de valores (por ejemplo, Londres, Frankfurt, Nueva York), utilizar servidores de baja latencia y con protección anti-DDoS, y alta disponibilidad con una política de reinicio rápido.

VPS para juegos: Un ping bajo y un ancho de banda alto son importantes. La alta disponibilidad (HA) es útil para servidores de liga/continuos; pero para partidas competitivas, es común replicar y crear instantáneas antes del partido.

Nube GPU (IA y renderizado): La alta disponibilidad (HA) presenta dificultades para las GPU, ya que la conmutación por error a otro nodo requiere compatibilidad con vGPU o reconexión. Recomendación: Utilice la gestión a nivel de trabajo (por ejemplo, Kubernetes + programación de GPU) para reprogramar las tareas en caso de fallo de un nodo.

El proveedor de servicios ofrece unidades de procesamiento gráfico (GPU), servidores anti-DDoS y VPS para trading y juegos que se pueden integrar con Ceph y redes de baja latencia.

 

Seguridad, copias de seguridad y monitorización

  • Autenticación: Habilite la autenticación de dos factores (2FA) para la interfaz web, gestione las claves SSH y restrinja el acceso.
  • Cortafuegos: Utilice el firewall de Proxmox y reglas estrictas para los protocolos (SSH, corosync, ceph).
  • Respaldo: Defina el RTO y el RPO, así como las instantáneas y las copias de seguridad periódicas en otra ubicación (por ejemplo, almacenamiento fuera del clúster o compatible con S3).
vzdump --compress lzo 100 --storage backup-storage 101

Escucha: Se recomienda utilizar Prometheus + Grafana o Zabbix para monitorizar el estado de los nodos, Corosync, Ceph y las máquinas virtuales.

 

Lista de verificación de preproducción

  • Realizar pruebas de conmutación por error en un entorno de prueba antes de pasar a producción.
  • Verifique el rendimiento de la migración en vivo con pruebas de E/S y RBD de Ceph.
  • Configure y pruebe el sistema de aislamiento (desconecte el nodo y compruebe si está caído o desconectado).
  • Especifique las políticas de HA: reiniciar vs migrar, max_restart, timeout.
  • Programa de copia de seguridad y archivo de registros.

 

Recomendaciones para la comparación y selección de ubicaciones

Recomendaciones generales para elegir una ubicación en función de la aplicación:

  • Europa (Fráncfort, Londres): Adecuado para sitios web y operaciones comerciales europeas; baja latencia a los mercados financieros europeos.
  • Estados Unidos (Ashburn, NY): Adecuado para operar con los mercados estadounidenses, redes de distribución de contenido (CDN) y distribución de contenido.
  • Asia (Tokio, Singapur): Adecuado para juegos y servicios destinados a usuarios asiáticos y aplicaciones que requieren procesamiento en regiones asiáticas.

 

Resumen ejecutivo y configuración más recomendada

  • Al menos 3 nodos Proxmox Con redes separadas para el clúster y el almacenamiento.
  • Ceph RBD Como almacenamiento compartido para alta disponibilidad y migración en vivo.
  • Sistemas de vallado o agentes de vallado basados en IPMI y sus pruebas periódicas.
  • Red con agregación de enlaces, MTU 9000 para Ceph y VLAN para aislamiento.
  • Implementar sistemas de monitoreo y copias de seguridad regulares.

 

Contacta con el equipo técnico y de soporte.

Si desea crear un clúster de alta disponibilidad (HA) de Proxmox para producción o necesita asesoramiento para elegir una ubicación (entre más de 85 ubicaciones globales), un servidor gráfico (GPU), un servidor anti-DDoS, un VPS para comercio o juegos, o asesoramiento sobre almacenamiento (Ceph/NFS/iSCSI), nuestro equipo técnico está listo para diseñar, implementar y probar la alta disponibilidad (HA) para usted.

 

Preguntas frecuentes

También te puede gustar