Уроки курса
1 Введение в аппаратное обеспечение IT-инфраструктуры
90 мин
2 Архитектура серверов: x86 и ARM
90 мин
3 Центральные процессоры (CPU) в серверных решениях
90 мин
4 Серверная оперативная память и технология ECC
90 мин
5 Удаленное управление оборудованием: IPMI и BMC
90 мин
6 Дисковая подсистема: HDD, SSD и NVMe
90 мин
7 Основы RAID-массивов и аппаратные контроллеры
90 мин
8 Уровни RAID: 1, 5 и 10
90 мин
9 Выбор дисков и конфигурации RAID для различных задач
90 мин
10 Замена накопителей и перестроение RAID-массивов
90 мин
11 Основы сетевой топологии и модель OSI
90 мин
12 Структурированная кабельная система (СКС) и медная витая пара
90 мин
13 Оптоволоконные линии связи и трансиверы
90 мин
14 Коммутаторы (L2) и работа с MAC-адресами
90 мин
15 Маршрутизаторы (L3) и межсетевое взаимодействие
90 мин
16 Аппаратные файрволы и защита периметра сети
90 мин
17 Введение в аппаратную виртуализацию (Bare-metal)
90 мин
18 Гипервизор VMware ESXi: базовая настройка
90 мин
19 Гипервизор Proxmox VE: особенности эксплуатации
90 мин
20 Гипервизор KVM: распределение ресурсов
90 мин
21 Системы электропитания и ИБП топологии On-line
90 мин
22 Резервное электропитание и дизель-генераторные установки
90 мин
23 Охлаждение серверной: холодные и горячие коридоры
90 мин
24 Правила работы в ЦОД и антистатическая защита (ESD)
90 мин
25 Мониторинг аппаратной инфраструктуры в Zabbix
90 мин
26 Визуализация метрик оборудования в Grafana
90 мин
27 Стратегии резервного копирования и правило 3-2-1
90 мин
28 Основы ITIL: Управление инцидентами (Incident Management)
90 мин
29 Основы ITIL: Управление проблемами (Problem Management)
90 мин
30 Диагностика неисправностей: комплексный сценарий
90 мин

Замена накопителей и перестроение RAID-массивов

Студент отработает сценарий горячей замены (Hot-swap) вышедшего из строя диска и процесс безопасного восстановления данных (Rebuild).

Прогресс урока: 0%

Жизненный цикл отказа диска и S.M.A.R.T.

В промышленной эксплуатации жесткие диски и SSD не выходят из строя внезапно (за исключением коротких замыканий). В 90% случаев отказу предшествует деградация. В каждый накопитель встроена система самодиагностики S.M.A.R.T. (Self-Monitoring, Analysis and Reporting Technology). Она отслеживает десятки параметров: количество переназначенных секторов (Reallocated Sector Count), ошибки позиционирования головки, износ ячеек памяти (Wear Leveling Count) и температуру.
Аппаратные RAID-контроллеры и системы мониторинга (Zabbix) непрерывно считывают S.M.A.R.T. Когда параметры превышают критические пороги, контроллер выдает статус PFA (Predictive Failure Analysis — предсказание отказа). Диск еще работает, но контроллер сигнализирует администратору: "Этот диск скоро умрет, замените его". Если игнорировать PFA, диск в итоге получит статус Failed или Dead, и массив перейдет в состояние Degraded (Деградирован), потеряв отказоустойчивость. Проактивная замена по статусу PFA — признак профессионального администратора.

Процедура Hot-Swap (Горячая замена)

Серверное оборудование поддерживает технологию Hot-Swap — возможность извлекать и вставлять диски без выключения питания сервера и остановки операционной системы. Это достигается за счет специальной конструкции разъемов (контакты питания длиннее информационных контактов, поэтому сначала подается земля, затем питание, затем данные).
Алгоритм действий (Direct Instruction):
1. Идентификация. Никогда не выдергивайте диск наугад! В утилите управления (iLO, iDRAC, MegaCLI) включите функцию Locator LED. На корзине сбойного диска начнет мигать синий или янтарный светодиод.
2. Подготовка. Если диск находится в статусе PFA (еще работает), его нужно принудительно перевести в статус Offline через интерфейс контроллера. Выдергивание работающего диска может повредить кэш.
3. Защита от статики (ESD). Наденьте антистатический браслет. Статический разряд от свитера может убить новый диск еще до установки.
4. Извлечение и установка. Нажмите кнопку на салазках (caddy), потяните ручку, подождите 5 секунд (чтобы шпиндель HDD остановился), затем аккуратно извлеките диск. Вставьте новый диск до щелчка.

Процесс Rebuild (Перестроение массива)

Как только новый диск вставлен, RAID-контроллер обнаруживает его и автоматически (при правильной настройке) запускает процесс Rebuild. Если это RAID 1, контроллер просто копирует данные с выжившего диска на новый. Если это RAID 5, контроллер читает данные и четность со всех оставшихся дисков, применяет операцию XOR и записывает восстановленные биты на новый диск.
Управление приоритетом (Rebuild Rate): Процесс перестроения создает колоссальную нагрузку на дисковую подсистему. В контроллерах есть настройка Rebuild Rate (от 0% до 100%). Если установить 100%, контроллер бросит все ресурсы процессора на восстановление массива. Массив восстановится быстро, но сервер перестанет отвечать на запросы пользователей (СУБД зависнет). Если установить 10%, пользователи не заметят падения скорости, но Rebuild может занять неделю, в течение которой массив уязвим к отказу второго диска. Стандартная рекомендация для сбалансированных систем — 30-40%.

Технология Hot Spare (Горячий резерв)

Что делать, если диск вышел из строя в пятницу вечером, а системный администратор уехал на дачу? К утру понедельника из-за возросшей нагрузки может сломаться второй диск, и данные будут потеряны. Для предотвращения таких ситуаций используется концепция Hot Spare (Диск горячего резерва).
Hot Spare — это физический диск, вставленный в сервер, который находится в спящем режиме и не принадлежит ни одному логическому тому. Как только контроллер фиксирует отказ рабочего диска (Failed), он мгновенно, без участия человека, берет диск Hot Spare, включает его и автоматически начинает процесс Rebuild на него.
Различают Dedicated Hot Spare (закреплен за конкретным массивом, например, только для массива базы данных) и Global Hot Spare (доступен для любого массива на данном контроллере). Использование Hot Spare — обязательный стандарт (Best Practice) для критичных серверов в удаленных ЦОД (Data Centers).

Восстановление программного RAID (mdadm)

В системах Linux, использующих программный RAID через утилиту mdadm, процесс замены диска требует ручного ввода команд в терминале (CLI). Представим ситуацию: в массиве RAID 1 (зеркало) /dev/md0, состоящем из дисков sda и sdb, вышел из строя диск sdb.
Пошаговый процесс восстановления:
1. Помечаем диск как сбойный (если система еще этого не сделала):
mdadm --manage /dev/md0 --fail /dev/sdb
2. Физически и логически удаляем диск из массива:
mdadm --manage /dev/md0 --remove /dev/sdb
3. Идем в серверную, вытаскиваем сбойный sdb, вставляем новый диск. ОС определяет его (возможно, с тем же именем sdb).
4. Копируем таблицу разделов с живого диска sda на новый sdb (используя утилиту sfdisk):
sfdisk -d /dev/sda | sfdisk /dev/sdb
5. Добавляем новый диск в массив:
mdadm --manage /dev/md0 --add /dev/sdb
6. Проверяем статус синхронизации:
cat /proc/mdstat. Вы увидите прогресс-бар перестроения (Recovery).

Задание

Сценарная задача (Инцидент-менеджмент): В Zabbix пришел алерт: 'RAID 5 Array on Server-DB-01 is DEGRADED'. Вы подключились к консоли iLO сервера и видите, что Диск 2 имеет статус Failed. Опишите ваши действия от идентификации до успешного закрытия инцидента.

  • Через iLO включить Locator LED на Диске 2, чтобы подсветить его в стойке.
  • Надеть антистатический браслет (ESD) перед работой с оборудованием.
  • Извлечь неисправный Диск 2 (Hot-swap) и вставить новый диск аналогичного или большего объема.
  • Убедиться через консоль, что начался процесс Rebuild, проверить статус /proc/mdstat или логи контроллера.
  • Дождаться статуса 'Optimal' и закрыть тикет.
10 баллов

Какую команду (вместе с ключами) нужно ввести в утилите mdadm, чтобы добавить новый исправный диск /dev/sdc в деградированный массив /dev/md0?