Мониторинг микроклимата ЦОД нужен не только для отображения текущей температуры в серверном зале. Полноценная система должна контролировать температуру и влажность в разных точках, состояние охлаждения, наличие воды под оборудованием, открытие дверей, питание датчиков и скорость изменения параметров. Чем раньше обнаружено отклонение, тем больше времени остаётся на переключение резервного кондиционера, устранение протечки или снижение нагрузки на стойки.
Один датчик на стене не показывает реальную картину. В дата-центре возникают локальные горячие зоны, рециркуляция нагретого воздуха, неравномерная подача холода и различия между верхом и низом стойки. Поэтому система наблюдения строится как сеть датчиков, контроллеров, шлюзов и программного обеспечения с журналом событий и автоматическими уведомлениями.
Какие параметры необходимо контролировать
Базовый набор включает температуру воздуха, относительную влажность и наличие протечек. На более крупных объектах дополнительно контролируют перепад давления между холодным и горячим коридорами, расход воздуха, температуру воды и хладагента, состояние вентиляторов, фильтров, насосов, клапанов и резервных кондиционеров.
- температура на входе воздуха в серверные стойки;
- температура в горячих коридорах и под потолком;
- относительная влажность и точка росы;
- наличие воды под фальшполом и около трубопроводов;
- работа прецизионных кондиционеров, чиллеров и насосов;
- аварии вентиляторов, компрессоров и увлажнителей;
- открытие дверей, шкафов и технических помещений;
- состояние питания, ИБП и каналов связи датчиков.
Датчики температуры серверной
Датчики температуры серверной устанавливают не там, где удобнее проложить кабель, а в точках, отражающих условия на входе серверного оборудования. Основной ориентир — фронтальная сторона стоек, куда поступает холодный воздух. Для высокой стойки одного измерения недостаточно: температура у верхних серверов может быть заметно выше, чем у нижних.
Практичная схема предусматривает измерения в нижней, средней и верхней части нескольких характерных стоек. Дополнительные датчики размещают в горячем коридоре, под фальшполом, около выходов кондиционеров и в потенциальных зонах рециркуляции. Количество точек зависит от площади, плотности IT-нагрузки и организации воздушных потоков.
Контроль влажности ЦОД
Контроль влажности ЦОД защищает оборудование от двух противоположных рисков. Слишком сухой воздух увеличивает вероятность накопления статического электричества, а чрезмерная влажность повышает риск конденсации и коррозии. Для оценки условий полезно анализировать не только относительную влажность, но и точку росы.
Относительная влажность меняется вместе с температурой. После резкого охлаждения воздуха она может увеличиться даже без дополнительного поступления влаги. Точка росы помогает понять, насколько близки поверхности труб, теплообменников или корпусов оборудования к условиям образования конденсата.
Система обнаружения протечек
Система обнаружения протечек должна выявлять воду до того, как она достигнет кабелей, серверных стоек или электрических щитов. Источниками риска являются трубопроводы холодной воды и гликоля, дренаж кондиционеров, увлажнители, теплообменники, насосные группы и соседние помещения.
Для локального контроля используют точечные датчики. Для протяжённых зон эффективнее чувствительный кабель, уложенный вдоль труб, под кондиционерами, вокруг насосных групп и по периметру потенциально опасных участков под фальшполом. Контроллер должен определять не только факт тревоги, но по возможности и участок срабатывания.
Кабель нельзя укладывать там, где он будет постоянно намокать от обычного конденсата или мешать обслуживанию. После монтажа систему испытывают реальной водой на каждом контролируемом участке, а не ограничиваются проверкой кнопки на панели.
Мониторинг охлаждения серверной
Мониторинг охлаждения серверной должен показывать состояние всей цепочки отвода тепла. Недостаточно знать, что внутренний блок включён. Важно контролировать температуру подачи и возврата воздуха, режим компрессора, скорость вентиляторов, загрязнение фильтров, положение клапанов и наличие аварий.
В водяной системе дополнительно отслеживают температуру подачи и обратки, перепад давления, работу насосов, расход теплоносителя и состояние чиллера или сухого охладителя. Если система имеет резервирование N+1, мониторинг должен подтверждать готовность резервного агрегата и фиксировать его автоматическое включение.
Полезно сравнивать температурную разницу до и после охлаждающего оборудования с текущей IT-нагрузкой. Снижение разницы при той же нагрузке может указывать на недостаточный расход воздуха, загрязнение теплообменника, нехватку хладагента или неправильное положение клапана.
DCIM-мониторинг и BMS
DCIM-мониторинг объединяет данные инженерной инфраструктуры и IT-оборудования. В одной системе можно видеть температуру стоек, загрузку электрических линий, состояние охлаждения, доступную мощность и историю аварий. Это помогает связывать рост тепловой нагрузки с конкретными стойками и заранее оценивать последствия установки новых серверов.
BMS обычно управляет инженерными системами здания: чиллерами, насосами, вентиляцией, клапанами и сигнализацией. DCIM глубже работает со стойками, питанием и размещением IT-оборудования. На практике системы интегрируют через BACnet, Modbus, SNMP, API или дискретные сигналы, чтобы избежать разрозненных интерфейсов.
Пороговые значения и уровни тревог
Для каждого параметра задают несколько уровней: предупреждение, критическая тревога и авария. Один жёсткий предел неудобен, потому что персонал получает сигнал слишком поздно. Предупреждение должно оставлять время на проверку, а критический уровень — запускать заранее определённый сценарий реагирования.
Порог задают с учётом места установки датчика, типа серверов и нормального режима объекта. Также применяют задержку и гистерезис, чтобы кратковременное колебание не создавало десятки одинаковых сообщений. Отдельно контролируют слишком быстрое изменение температуры, потерю связи и неисправность самого датчика.
Монтаж и ввод в эксплуатацию
Перед монтажом составляют план размещения всех датчиков и присваивают понятные обозначения. После установки проверяют показания рядом расположенных приборов, моделируют нагрев, увлажнение и протечку, отключают связь и питание. Каждая тревога должна появиться в журнале и дойти до нужного получателя.
Исполнитель передаёт схему точек, список адресов, диапазоны измерений, пороги, инструкции по калибровке и сценарии реагирования. Без этой документации дальнейшее обслуживание превращается в поиск неизвестных датчиков под фальшполом и в шкафах.
Типичные ошибки
- один датчик температуры на весь серверный зал;
- измерение только около кондиционера, а не на входе стоек;
- отсутствие контроля верхней части высоких стоек;
- сигнализация протечки только под одним внутренним блоком;
- одинаковые пороги для всех зон без учёта условий;
- слишком частые уведомления без задержки и гистерезиса;
- отсутствие резервного питания контроллеров;
- нет проверки потери связи с датчиком;
- тревоги не содержат точного местоположения;
- датчики влажности не проходят периодическую проверку.
Итог
Мониторинг микроклимата ЦОД должен обнаруживать локальный перегрев, отклонение влажности, утечки и неисправности охлаждения до того, как они повлияют на серверы. Для этого нужны правильно размещённые датчики, контроль всей инженерной цепочки, журнал данных, резервная связь и понятные сценарии оповещения. Инженеры NIKLAND проектируют системы охлаждения дата-центров и серверных с учётом резервирования, диспетчеризации, датчиков температуры, влажности и протечек.