Перезагрузка узлов Ceph
-
Перед перезагрузкой узлов Ceph проверьте правило udev. При необходимости приведите
DISK_NAME_PREFIXв соответствие с именованием дисков в системе (пример:KERNEL=="sd[b-z]"):$ ssh <УЗЕЛ>$ cat /etc/udev/rules.d/65-disk-owner.rulesKERNEL=="vd[b-z]*", OWNER="ceph"Здесь
<УЗЕЛ>— узел Ceph. Пример:csn003. -
Исправьте, если диски имеют другое название:
$ cat <<EOF | sudo tee /etc/udev/rules.d/65-disk-owner.rulesKERNEL=="<ПРЕФИКС>[b-z]*", OWNER="ceph"EOFЗдесь
<ПРЕФИКС>— префикс имени диска. -
Зайдите на произвольный узел Ceph и проверьте текущий статус кластера:
$ ssh <УЗЕЛ>Здесь
<УЗЕЛ>— узел Ceph. Пример:csn003. -
Если проблем в кластере нет, выполните команды:
$ ceph -s$ ceph health -
Выставьте флаги
nooutиnorebalanceдля временного отключения ребалансировки:$ sudo ceph osd set noout$ sudo ceph osd set norebalance -
Перезагрузите узел Ceph:
$ sudo rebootВо время перезагрузки узла обратите внимание на статус кластера, секции
healthиservice:osd, а именно:-
Если в секции
healthзначениеslow opsпоменялось наosd, качество сервиса может ухудшиться. -
Если в секции
data:pgпоявились следующие статусыpg:down,laggy,wait,inconsistent,incomplete, могут появиться проблемы при доступе к данным. -
После перезагрузки узла подождите, пока все
pgпримут состояниеactive+clean, прежде чем переходить к перезагрузке следующего узла. -
По окончании в секции
warningне должно быть информации, что OSD или Mon находятся в статусеdown. -
Проверьте информацию о выставленных флагах
noout,norebalance:$ ceph -s$ ceph -s -w
-
-
Перейдите на узел, который перезагрузился, и проверьте, что нет ошибок:
gitUNIT LOAD ACTIVE SUB DESCRIPTION0 loaded units listed.uname -r6.1.170-1.el7.3.x86_64 -
Проверьте следующий Ceph-узел.
-
После окончания перезагрузки всего кластера Ceph верните флаги
nooutиnorebalanceв прежнее состояние:$ sudo ceph osd unset noout$ sudo ceph osd unset norebalance -
Проверьте статус
Health_OK:$ ceph -s