- Как обеспечить надежную доступность (HA) Proxmox для производственных кластеров?
- Требования и общая архитектура для Proxmox HA
- Почему мы рекомендуем Ceph?
- Практические этапы: от установки до активации системы умного дома.
- Рекомендуемые сетевые настройки
- Фехтование (STONITH) и предотвращение расщепления мозга
- Советы для всех типов приложений (торговля, игры, ИИ/GPU, рендеринг)
- Безопасность, резервное копирование и мониторинг
- Контрольный список для подготовки к производству
- Рекомендации по сравнению и выбору местоположения.
- Краткое изложение и рекомендуемая конфигурация
- Обратитесь в техническую службу поддержки.
Как обеспечить надежную доступность (HA) Proxmox для производственных кластеров?
Запуск HA с Proxmox Цель руководства — сократить время простоя сервисов и обеспечить доступность виртуальных машин и контейнеров в случае аппаратных или программных сбоев. Предназначенное для администраторов серверов, специалистов DevOps, поставщиков облачных услуг и технических команд, это руководство охватывает основы, предварительные условия, практическую настройку и советы по безопасности. Приводятся примеры и команды из реальной жизни в Linux, а также рассматриваются такие темы, как совместное использование хранилища (Ceph/NFS/iSCSI), сети, защита от сбоев (STONITH) и различные практические решения.
Требования и общая архитектура для Proxmox HA
Для стабильной работы Home Assistant на Proxmox вам потребуется следующее:
- По меньшей мере 3 физических узла Для обеспечения кворума в обычном режиме. В случае двух узлов необходимо... QDevice Или же привлечь посредника из числа третьих лиц.
- Один слой Общее хранилище Для виртуальных машин: Цеф RBD Это лучший вариант для HA и миграции в реальном времени. NFS, iSCSI Или DRBD Есть и другие варианты.
- Отдельная сеть управления для кластерного трафика и коросинхронизация С низкой пропускной способностью и задержкой.
- Механизм Фехтование/СТОНИТ Чтобы избежать расщепления мозга.
- Планирование и мониторинг резервного копирования.
Предлагаемая архитектура:
- Сеть управления (кластерная сеть): 2x10 Гбит/с или 1 Гбит/с + LACP, частная адресация (например, 10.10.0.0/24).
- Сеть хранения данных (Ceph): Отдельные интерфейсы с MTU 9000 (jumbo).
- Сервисная сеть: общедоступная/VLAN для доступа клиентов и предоставления услуг.
- Необходимо как минимум 3 узла Proxmox с Ceph MON и OSD или уровень хранения NFS с ИБП и NAS HA.
Почему мы рекомендуем Ceph?
Основные причины предложения Ceph:
- РБД Будучи распределенным блочным хранилищем, оно позволяет осуществлять миграцию в режиме реального времени без необходимости перемещения файлов на диске.
- Отсутствие единая точка отказаВертикальная и горизонтальная масштабируемость.
- Встроенная интеграция с Proxmox через пвецеф.
Практические этапы: от установки до активации системы умного дома.
В этом примере мы настроим кластер из 3 узлов с Ceph и высокой доступностью для виртуальных машин. Основные шаги следующие:
1) Установите Proxmox Base на каждом узле.
Установите на любой сервер Proxmox VE (совместимый с версиями 6/7/8). После установки настройте административный и SSH-адреса и обновите систему:
sudo apt update && sudo apt dist-upgrade -y2) Создайте кластер (на первом узле).
Создайте кластер на первом узле и проверьте его состояние:
sudo pvecm create my-cluster
pvecm status3) Добавление узлов в кластер
Выполните следующую команду на каждом вторичном узле, а затем проверьте состояние кластера:
sudo pvecm add <IP-نود-اول>
pvecm nodes
pvecm status4) Сеть CoreSync и MTU
Убедитесь, что bindnetaddr включен. /etc/pve/corosync.conf У вас правильно настроена сеть с низкой задержкой. Для Ceph используйте MTU 9000 Используйте и активируйте его на сетевой карте и коммутаторе.
5) Установка и настройка Ceph (простой пример)
Основные команды для установки и настройки Ceph на каждом узле:
pveceph install
pveceph init --mon-ip <IP-نود>
pveceph createosd /dev/sdb
ceph -s6) Активируйте HA Manager и добавьте виртуальную машину в HA.
В веб-интерфейсе: Центр обработки данных → Высокая доступность → Добавить → выберите ресурс (например, vm:100 или ct:101) и укажите политику (перезапуск, миграция).
Также вы можете добавить ресурс из командной строки с помощью команды pvesh:
pvesh create /cluster/ha/resources -resource vm:100 -state started -max_restart 3
ha-manager status
pvesh get /cluster/ha/status7) Тестирование отказоустойчивости
Чтобы смоделировать отключение электропитания узла и проверить, запускаются ли виртуальные машины на других узлах:
ssh root@node1 "shutdown -h now"
ha-manager status
qm list
Рекомендуемые сетевые настройки
Рекомендации по проектированию сети:
- Две отдельные физические сети для управление и хранилище. VLAN для изоляции трафика.
- Объединение каналов связи (LACP) для обеспечения резервирования и увеличения пропускной способности. Пример конфигурации:
auto bond0
iface bond0 inet manual
bond-slaves eth0 eth1
bond-mode 802.3ad
bond-miimon 100Для Ceph рекомендуется установить MTU равным 9000 и убедиться, что сетевой коммутатор поддерживает Jumbo Frames.
Фехтование (STONITH) и предотвращение расщепления мозга
Для изоляции неисправного узла необходима блокировка сети. Proxmox поддерживает агенты блокировки.
apt install fence-agentsПример команды IPMI для ограждения:
fence_ipmilan -a <IP> -l <USER> -p <PASS> -o poweroffВ облачных средах или центрах обработки данных можно использовать IPMI/BMC или сетевое ограждение (например, fence_virt) используется. В случае двух узлов обязательно создайте QDevice с помощью команды. настройка pvecm qdevice Или же привлечь третьего свидетеля.
Советы для всех типов приложений (торговля, игры, ИИ/GPU, рендеринг)
VPS для торговли: Выбор местоположения вблизи фондовых бирж (например, Лондон, Франкфурт, Нью-Йорк), использование серверов с низкой задержкой и защитой от DDoS-атак, а также высокая доступность с политикой быстрого перезапуска.
Игровой VPS: Низкий пинг и высокая пропускная способность важны. Высокая доступность полезна для лиг/серверов с постоянным подключением; но для соревновательных матчей обычно используется репликация и создание снимков состояния перед матчем.
Облачные вычисления на графических процессорах (ИИ и рендеринг): Обеспечение высокой доступности (HA) для графических процессоров представляет собой сложную задачу, поскольку переключение графического процессора на другой узел требует поддержки виртуальных графических процессоров (vGPU) или повторного подключения. Рекомендация: используйте управление на уровне заданий (например, Kubernetes + планирование на графических процессорах) для перепланирования заданий в случае отказа узла.
Провайдер услуг предлагает графический процессор (GPU), сервер с защитой от DDoS-атак и VPS для торговли и игр, которые могут быть интегрированы с Ceph и сетевыми технологиями с низкой задержкой.
Безопасность, резервное копирование и мониторинг
- Аутентификация: Включите двухфакторную аутентификацию для веб-интерфейса, управляйте SSH-ключами и ограничивайте доступ.
- Межсетевой экран: Используйте брандмауэр Proxmox и строгие правила для защиты (SSH, Corosync, Ceph).
- Резервная копия: Определите RTO и RPO, создайте моментальные снимки и выполните регулярное резервное копирование в другое место (например, вне кластера или в хранилище, совместимое с S3).
vzdump --compress lzo 100 --storage backup-storage 101Мониторинг: Для мониторинга состояния узлов, Corosync, Ceph и виртуальных машин рекомендуется использовать Prometheus + Grafana или Zabbix.
Контрольный список для подготовки к производству
- Проведение тестирования отказоустойчивости в тестовой среде перед переходом к производственной эксплуатации.
- Проверьте производительность миграции в реальном времени с помощью тестирования Ceph RBD и операций ввода-вывода.
- Настройте и протестируйте систему ограждения (отключите узел и проверьте, не отключен ли он).
- Укажите политики высокой доступности: restart или migrate, max_restart, timeout.
- Программа для резервного копирования и архивирования журналов.
Рекомендации по сравнению и выбору местоположения.
Общие рекомендации по выбору местоположения в зависимости от приложения:
- Европа (Франкфурт, Лондон): Подходит для европейских веб-сайтов и торговых площадок; низкая задержка при доступе к европейским финансовым рынкам.
- Америка (Эшберн, штат Нью-Йорк): Подходит для торговли на американских рынках, CDN и распространения контента.
- Азия (Токио, Сингапур): Подходит для игр и сервисов, предназначенных для пользователей из Азии, а также для приложений, требующих обработки в азиатских регионах.
Краткое изложение и рекомендуемая конфигурация
- По меньшей мере 3 узла Proxmox С раздельными сетями для кластера и хранилища.
- Цеф RBD В качестве общего хранилища для обеспечения высокой доступности и миграции в реальном времени.
- Ограждение на основе IPMI или защитное средство для ограждения и его регулярное тестирование.
- Сеть с агрегацией каналов, MTU 9000 для Ceph и VLAN для изоляции.
- Внедрите регулярный мониторинг и резервное копирование.
Обратитесь в техническую службу поддержки.
Если вы хотите создать производственный кластер Proxmox HA или вам нужна консультация по выбору местоположения (из более чем 85 локаций по всему миру), графического сервера (GPU), сервера защиты от DDoS-атак, VPS для торговли или игр, или рекомендации по хранению данных (Ceph/NFS/iSCSI) — наша техническая команда готова разработать, внедрить и протестировать HA-систему для вас.









