VK Private Cloud logo
Помощь
Обновлена 21 августа 2026 г. в 11:12

Перезагрузка узлов Ceph

  1. Перед перезагрузкой узлов Ceph проверьте правило udev. При необходимости приведите DISK_NAME_PREFIX в соответствие с именованием дисков в системе (пример: KERNEL=="sd[b-z]"):

    $ ssh <УЗЕЛ>$ cat /etc/udev/rules.d/65-disk-owner.rulesKERNEL=="vd[b-z]*", OWNER="ceph"

    Здесь <УЗЕЛ> — узел Ceph. Пример: csn003.

  2. Исправьте, если диски имеют другое название:

    $ cat <<EOF | sudo tee /etc/udev/rules.d/65-disk-owner.rulesKERNEL=="<ПРЕФИКС>[b-z]*", OWNER="ceph"EOF

    Здесь <ПРЕФИКС> — префикс имени диска.

  3. Зайдите на произвольный узел Ceph и проверьте текущий статус кластера:

    $ ssh <УЗЕЛ>

    Здесь <УЗЕЛ> — узел Ceph. Пример: csn003.

  4. Если проблем в кластере нет, выполните команды:

    $ ceph -s$ ceph health
  5. Выставьте флаги noout и norebalance для временного отключения ребалансировки:

    $ sudo ceph osd set noout$ sudo ceph osd set norebalance
  6. Перезагрузите узел Ceph:

    $ sudo reboot

    Во время перезагрузки узла обратите внимание на статус кластера, секции health и service:osd, а именно:

    1. Если в секции health значение slow ops поменялось на osd, качество сервиса может ухудшиться.

    2. Если в секции data:pg появились следующие статусы pg: down, laggy, wait, inconsistent, incomplete, могут появиться проблемы при доступе к данным.

    3. После перезагрузки узла подождите, пока все pg примут состояние active+clean, прежде чем переходить к перезагрузке следующего узла.

    4. По окончании в секции warning не должно быть информации, что OSD или Mon находятся в статусе down.

    5. Проверьте информацию о выставленных флагах noout, norebalance:

      $ ceph -s$ ceph -s -w
  7. Перейдите на узел, который перезагрузился, и проверьте, что нет ошибок:

    gitUNIT LOAD ACTIVE SUB DESCRIPTION0 loaded units listed.uname -r6.1.170-1.el7.3.x86_64
  8. Проверьте следующий Ceph-узел.

  9. После окончания перезагрузки всего кластера Ceph верните флаги noout и norebalance в прежнее состояние:

    $ sudo ceph osd unset noout$ sudo ceph osd unset norebalance
  10. Проверьте статус Health_OK:

    $ ceph -s
Была ли статья полезна?