Замена накопителей и перестроение RAID-массивов
Студент отработает сценарий горячей замены (Hot-swap) вышедшего из строя диска и процесс безопасного восстановления данных (Rebuild).
Жизненный цикл отказа диска и S.M.A.R.T.
В промышленной эксплуатации жесткие диски и SSD не выходят из строя внезапно (за исключением коротких замыканий). В 90% случаев отказу предшествует деградация. В каждый накопитель встроена система самодиагностики S.M.A.R.T. (Self-Monitoring, Analysis and Reporting Technology). Она отслеживает десятки параметров: количество переназначенных секторов (Reallocated Sector Count), ошибки позиционирования головки, износ ячеек памяти (Wear Leveling Count) и температуру.
Аппаратные RAID-контроллеры и системы мониторинга (Zabbix) непрерывно считывают S.M.A.R.T. Когда параметры превышают критические пороги, контроллер выдает статус PFA (Predictive Failure Analysis — предсказание отказа). Диск еще работает, но контроллер сигнализирует администратору: "Этот диск скоро умрет, замените его". Если игнорировать PFA, диск в итоге получит статус Failed или Dead, и массив перейдет в состояние Degraded (Деградирован), потеряв отказоустойчивость. Проактивная замена по статусу PFA — признак профессионального администратора.
Процедура Hot-Swap (Горячая замена)
Серверное оборудование поддерживает технологию Hot-Swap — возможность извлекать и вставлять диски без выключения питания сервера и остановки операционной системы. Это достигается за счет специальной конструкции разъемов (контакты питания длиннее информационных контактов, поэтому сначала подается земля, затем питание, затем данные).
Алгоритм действий (Direct Instruction):
1. Идентификация. Никогда не выдергивайте диск наугад! В утилите управления (iLO, iDRAC, MegaCLI) включите функцию Locator LED. На корзине сбойного диска начнет мигать синий или янтарный светодиод.
2. Подготовка. Если диск находится в статусе PFA (еще работает), его нужно принудительно перевести в статус Offline через интерфейс контроллера. Выдергивание работающего диска может повредить кэш.
3. Защита от статики (ESD). Наденьте антистатический браслет. Статический разряд от свитера может убить новый диск еще до установки.
4. Извлечение и установка. Нажмите кнопку на салазках (caddy), потяните ручку, подождите 5 секунд (чтобы шпиндель HDD остановился), затем аккуратно извлеките диск. Вставьте новый диск до щелчка.
Процесс Rebuild (Перестроение массива)
Как только новый диск вставлен, RAID-контроллер обнаруживает его и автоматически (при правильной настройке) запускает процесс Rebuild. Если это RAID 1, контроллер просто копирует данные с выжившего диска на новый. Если это RAID 5, контроллер читает данные и четность со всех оставшихся дисков, применяет операцию XOR и записывает восстановленные биты на новый диск.
Управление приоритетом (Rebuild Rate): Процесс перестроения создает колоссальную нагрузку на дисковую подсистему. В контроллерах есть настройка Rebuild Rate (от 0% до 100%). Если установить 100%, контроллер бросит все ресурсы процессора на восстановление массива. Массив восстановится быстро, но сервер перестанет отвечать на запросы пользователей (СУБД зависнет). Если установить 10%, пользователи не заметят падения скорости, но Rebuild может занять неделю, в течение которой массив уязвим к отказу второго диска. Стандартная рекомендация для сбалансированных систем — 30-40%.
Технология Hot Spare (Горячий резерв)
Что делать, если диск вышел из строя в пятницу вечером, а системный администратор уехал на дачу? К утру понедельника из-за возросшей нагрузки может сломаться второй диск, и данные будут потеряны. Для предотвращения таких ситуаций используется концепция Hot Spare (Диск горячего резерва).
Hot Spare — это физический диск, вставленный в сервер, который находится в спящем режиме и не принадлежит ни одному логическому тому. Как только контроллер фиксирует отказ рабочего диска (Failed), он мгновенно, без участия человека, берет диск Hot Spare, включает его и автоматически начинает процесс Rebuild на него.
Различают Dedicated Hot Spare (закреплен за конкретным массивом, например, только для массива базы данных) и Global Hot Spare (доступен для любого массива на данном контроллере). Использование Hot Spare — обязательный стандарт (Best Practice) для критичных серверов в удаленных ЦОД (Data Centers).
Восстановление программного RAID (mdadm)
В системах Linux, использующих программный RAID через утилиту mdadm, процесс замены диска требует ручного ввода команд в терминале (CLI). Представим ситуацию: в массиве RAID 1 (зеркало) /dev/md0, состоящем из дисков sda и sdb, вышел из строя диск sdb.
Пошаговый процесс восстановления:
1. Помечаем диск как сбойный (если система еще этого не сделала):mdadm --manage /dev/md0 --fail /dev/sdb
2. Физически и логически удаляем диск из массива:mdadm --manage /dev/md0 --remove /dev/sdb
3. Идем в серверную, вытаскиваем сбойный sdb, вставляем новый диск. ОС определяет его (возможно, с тем же именем sdb).
4. Копируем таблицу разделов с живого диска sda на новый sdb (используя утилиту sfdisk):sfdisk -d /dev/sda | sfdisk /dev/sdb
5. Добавляем новый диск в массив:mdadm --manage /dev/md0 --add /dev/sdb
6. Проверяем статус синхронизации:cat /proc/mdstat. Вы увидите прогресс-бар перестроения (Recovery).
Флеш-карточки
Что такое S.M.A.R.T.?
Нажмите, чтобы увидеть ответ
Система самодиагностики накопителей. Отслеживает здоровье диска (битые сектора, износ, температуру) и предупреждает о скором выходе из строя.
Нажмите, чтобы вернуться
Что такое Hot Spare?
Нажмите, чтобы увидеть ответ
Диск горячего резерва. Находится в спящем режиме. Автоматически подменяет собой вышедший из строя диск, запуская процесс Rebuild без участия администратора.
Нажмите, чтобы вернуться
Что делает настройка Rebuild Rate?
Нажмите, чтобы увидеть ответ
Регулирует приоритет процесса перестроения массива. Баланс между скоростью восстановления массива и производительностью сервера для пользователей.
Нажмите, чтобы вернуться
Задание
Сценарная задача (Инцидент-менеджмент): В Zabbix пришел алерт: 'RAID 5 Array on Server-DB-01 is DEGRADED'. Вы подключились к консоли iLO сервера и видите, что Диск 2 имеет статус Failed. Опишите ваши действия от идентификации до успешного закрытия инцидента.
- Через iLO включить Locator LED на Диске 2, чтобы подсветить его в стойке.
- Надеть антистатический браслет (ESD) перед работой с оборудованием.
- Извлечь неисправный Диск 2 (Hot-swap) и вставить новый диск аналогичного или большего объема.
- Убедиться через консоль, что начался процесс Rebuild, проверить статус /proc/mdstat или логи контроллера.
- Дождаться статуса 'Optimal' и закрыть тикет.