- ¿Cómo proporcionar disponibilidad confiable (HA) con Proxmox para clústeres de producción?
- Requisitos y arquitectura general para Proxmox HA
- ¿Por qué recomendamos Ceph?
- Pasos prácticos: desde la instalación hasta la activación de HA.
- Configuración de red recomendada
- Esgrima (STONITH) y prevención del síndrome de cerebro dividido
- Consejos para todo tipo de aplicaciones (trading, juegos, IA/GPU, renderizado)
- Seguridad, copias de seguridad y monitorización
- Lista de verificación de preproducción
- Recomendaciones para la comparación y selección de ubicaciones
- Resumen ejecutivo y configuración más recomendada
- Contacta con el equipo técnico y de soporte.
¿Cómo proporcionar disponibilidad confiable (HA) con Proxmox para clústeres de producción?
Lanzamiento Alta disponibilidad con Proxmox Su objetivo es reducir el tiempo de inactividad del servicio y garantizar la disponibilidad de máquinas virtuales y contenedores ante fallos de hardware o software. Dirigida a administradores de servidores, profesionales de DevOps, proveedores de servicios en la nube y equipos técnicos, esta guía abarca los fundamentos, los requisitos previos, la configuración práctica y consejos de seguridad. Incluye ejemplos y comandos reales de Linux, y trata temas como el almacenamiento compartido (Ceph/NFS/iSCSI), redes, el aislamiento de red (STONITH) y diversas soluciones prácticas.
Requisitos y arquitectura general para Proxmox HA
Para tener alta disponibilidad estable en Proxmox necesitas lo siguiente:
- Al menos 3 nodos físicos Para garantizar el quórum en modo normal. En el caso de dos nodos, debe Dispositivo Q O bien, recurrir a un mediador externo.
- Una capa Almacenamiento compartido Para máquinas virtuales: Ceph RBD Es la mejor opción para alta disponibilidad y migración en vivo. NFS, iSCSI O DRBD También existen otras opciones.
- Una red de gestión separada para el tráfico del clúster y corosync Con bajo ancho de banda y baja latencia.
- Mecanismo Valla/STONITH Para evitar el síndrome del cerebro dividido.
- Programación y supervisión de copias de seguridad.
Arquitectura propuesta:
- Red de administración (red de clúster): 2 x 10 Gb o 1 Gb + LACP, direccionamiento privado (por ejemplo, 10.10.0.0/24).
- Red de almacenamiento (Ceph): Interfaces separadas con MTU 9000 (jumbo).
- Red de servicio: pública/VLAN para acceso de clientes y servicios.
- Al menos 3 nodos Proxmox con Ceph MON y OSD o un nivel de almacenamiento NFS con UPS y NAS HA.
¿Por qué recomendamos Ceph?
Las principales razones para proponer Ceph:
- RBD Como sistema de almacenamiento en bloques distribuido, permite la migración en vivo sin necesidad de mover los archivos del disco.
- Ausencia punto único de falloEscalabilidad vertical y horizontal.
- Integración nativa con Proxmox a través de pveceph.
Pasos prácticos: desde la instalación hasta la activación de HA.
En este ejemplo, configuraremos un clúster de 3 nodos con Ceph y HA para máquinas virtuales. Los pasos principales son los siguientes:
1) Instalar la base de Proxmox en cada nodo.
Instálelo en cualquier servidor Proxmox VE (compatible con las versiones 6/7/8). Tras la instalación, configure las direcciones de administrador y SSH y actualice el sistema:
sudo apt update && sudo apt dist-upgrade -y2) Crear un clúster (en el primer nodo)
Cree el clúster en el primer nodo y verifique el estado:
sudo pvecm create my-cluster
pvecm status3) Agregar nodos al clúster
Ejecute el siguiente comando en cada nodo secundario y luego verifique el estado del clúster:
sudo pvecm add <IP-نود-اول>
pvecm nodes
pvecm status4) Red CoreSync y MTU
Asegúrese de que bindnetaddr esté activado. /etc/pve/corosync.conf Tienes una red configurada correctamente y de baja latencia. Para Ceph, usa MTU 9000 Úselo y habilítelo en la tarjeta de red y en el conmutador.
5) Instalación y configuración de Ceph (ejemplo sencillo)
Comandos básicos para instalar y configurar Ceph en cada nodo:
pveceph install
pveceph init --mon-ip <IP-نود>
pveceph createosd /dev/sdb
ceph -s6) Active HA Manager y agregue la máquina virtual a HA.
En la interfaz web: Centro de datos → HA → Agregar → seleccione el recurso (por ejemplo, vm:100 o ct:101) y especifique la política (reiniciar, migrar).
También puedes agregar el recurso desde la CLI con pvesh:
pvesh create /cluster/ha/resources -resource vm:100 -state started -max_restart 3
ha-manager status
pvesh get /cluster/ha/status7) Pruebas de conmutación por error
Para simular un corte de energía en un nodo y comprobar si las máquinas virtuales se inician en otros nodos:
ssh root@node1 "shutdown -h now"
ha-manager status
qm list
Configuración de red recomendada
Recomendaciones para el diseño de redes:
- Dos redes físicas separadas para gestión y almacenamiento. VLAN para el aislamiento del tráfico.
- Enlace (LACP) para redundancia y mayor ancho de banda. Configuración de ejemplo:
auto bond0
iface bond0 inet manual
bond-slaves eth0 eth1
bond-mode 802.3ad
bond-miimon 100Para Ceph, se recomienda configurar la MTU en 9000 y que el conmutador de red admita tramas jumbo.
Esgrima (STONITH) y prevención del síndrome de cerebro dividido
El uso de cercas es necesario para aislar un nodo defectuoso. Proxmox admite agentes de cercado.
apt install fence-agentsEjemplo de comando IPMI para cercado:
fence_ipmilan -a <IP> -l <USER> -p <PASS> -o poweroffEn entornos de nube o centro de datos, puede utilizar IPMI/BMC o cercado basado en red (por ejemplo, valla virtual) utilizado. En caso de dos nodos, asegúrese de crear un QDevice con el comando Configuración del dispositivo qdevice pvecm O bien, tener un tercer testigo.
Consejos para todo tipo de aplicaciones (trading, juegos, IA/GPU, renderizado)
VPS para trading: Elegir una ubicación cercana a las bolsas de valores (por ejemplo, Londres, Frankfurt, Nueva York), utilizar servidores de baja latencia y con protección anti-DDoS, y alta disponibilidad con una política de reinicio rápido.
VPS para juegos: Un ping bajo y un ancho de banda alto son importantes. La alta disponibilidad (HA) es útil para servidores de liga/continuos; pero para partidas competitivas, es común replicar y crear instantáneas antes del partido.
Nube GPU (IA y renderizado): La alta disponibilidad (HA) presenta dificultades para las GPU, ya que la conmutación por error a otro nodo requiere compatibilidad con vGPU o reconexión. Recomendación: Utilice la gestión a nivel de trabajo (por ejemplo, Kubernetes + programación de GPU) para reprogramar las tareas en caso de fallo de un nodo.
El proveedor de servicios ofrece unidades de procesamiento gráfico (GPU), servidores anti-DDoS y VPS para trading y juegos que se pueden integrar con Ceph y redes de baja latencia.
Seguridad, copias de seguridad y monitorización
- Autenticación: Habilite la autenticación de dos factores (2FA) para la interfaz web, gestione las claves SSH y restrinja el acceso.
- Cortafuegos: Utilice el firewall de Proxmox y reglas estrictas para los protocolos (SSH, corosync, ceph).
- Respaldo: Defina el RTO y el RPO, así como las instantáneas y las copias de seguridad periódicas en otra ubicación (por ejemplo, almacenamiento fuera del clúster o compatible con S3).
vzdump --compress lzo 100 --storage backup-storage 101Escucha: Se recomienda utilizar Prometheus + Grafana o Zabbix para monitorizar el estado de los nodos, Corosync, Ceph y las máquinas virtuales.
Lista de verificación de preproducción
- Realizar pruebas de conmutación por error en un entorno de prueba antes de pasar a producción.
- Verifique el rendimiento de la migración en vivo con pruebas de E/S y RBD de Ceph.
- Configure y pruebe el sistema de aislamiento (desconecte el nodo y compruebe si está caído o desconectado).
- Especifique las políticas de HA: reiniciar vs migrar, max_restart, timeout.
- Programa de copia de seguridad y archivo de registros.
Recomendaciones para la comparación y selección de ubicaciones
Recomendaciones generales para elegir una ubicación en función de la aplicación:
- Europa (Fráncfort, Londres): Adecuado para sitios web y operaciones comerciales europeas; baja latencia a los mercados financieros europeos.
- Estados Unidos (Ashburn, NY): Adecuado para operar con los mercados estadounidenses, redes de distribución de contenido (CDN) y distribución de contenido.
- Asia (Tokio, Singapur): Adecuado para juegos y servicios destinados a usuarios asiáticos y aplicaciones que requieren procesamiento en regiones asiáticas.
Resumen ejecutivo y configuración más recomendada
- Al menos 3 nodos Proxmox Con redes separadas para el clúster y el almacenamiento.
- Ceph RBD Como almacenamiento compartido para alta disponibilidad y migración en vivo.
- Sistemas de vallado o agentes de vallado basados en IPMI y sus pruebas periódicas.
- Red con agregación de enlaces, MTU 9000 para Ceph y VLAN para aislamiento.
- Implementar sistemas de monitoreo y copias de seguridad regulares.
Contacta con el equipo técnico y de soporte.
Si desea crear un clúster de alta disponibilidad (HA) de Proxmox para producción o necesita asesoramiento para elegir una ubicación (entre más de 85 ubicaciones globales), un servidor gráfico (GPU), un servidor anti-DDoS, un VPS para comercio o juegos, o asesoramiento sobre almacenamiento (Ceph/NFS/iSCSI), nuestro equipo técnico está listo para diseñar, implementar y probar la alta disponibilidad (HA) para usted.









