Уровни (Tier) дата-центров

Уровни дата-центров — это стандартизированная система классификации, разработанная Uptime Institute для описания отказоустойчивости центра обработки данных (ЦОД) и подходов к резервированию инфраструктуры.

Система была введена в 1990-х годах и стала глобальным эталоном для сравнения объектов. Каждый уровень основывается на предыдущем — добавляя резервирование, повышая доступность и, соответственно, увеличивая капитальные и операционные затраты.

Всего существует четыре уровня:

  • Tier I — базовая инфраструктура, без резервирования
  • Tier II — резервирование отдельных компонент, ограниченная отказоустойчивость
  • Tier III — возможность обслуживания без остановки, двойные пути распределения
  • Tier IV — полная отказоустойчивость, каждая система продублирована

Классификация распространяется на весь объект целиком — электроснабжение, охлаждение, физическую структуру, пути распределения и операционное обслуживание. При этом, операционное обслуживание сертифицируется отдельно.

Владелец ЦОДа не может самостоятельно присвоить своему объекту определённый уровень: официальный статус требует проверки со стороны Uptime Institute. В наших реалиях это означает, что заявление о соответствии ЦОДа уровню, например, Tier III, означает не более, чем неподтвержденное независимым аудитом намерение проектировщика/строителя ЦОД.

Плановая доступность (uptime) для каждого из уровней

Поиск в Интернете уровня доступности для каждого из уровней легко даст вам показатели от 99.671% для Tier I до 99.995% для Tier IV. Так вот — это все неправда. Эти значения в какой-то момент возникли в отчете Uptime Institute за 2001 год, и с тех пор надежно осели на многочисленных сайтах.

Официальная позиция Uptime Institute — уровень ЦОДа не гарантирует каких-либо показателей доступности. Это связано с рядом факторов — от уровня эксплуатационных процессов до скорости починки компонентов инженерной инфраструктуры.

Tier I: базовая инфраструктура

Объект уровня Tier I имеет единственный, нерезервированный путь для электроснабжения и охлаждения. Резервирование критически важных систем отсутствует. Любое техническое обслуживание — плановое или внеплановое — требует полной или частичной остановки работы.

Что входит в состав: выделенное пространство для ИТ-оборудования, источник бесперебойного питания (ИБП) для кратковременных отключений, ДГУ (дизель-генераторная установка) для длительных отключений, а также базовое охлаждение без резервирования.

Оптимально подходит для: сред разработки и тестирования, офисов стартапов, внутренней лабораторной инфраструктуры, резервного хранения данных — то есть для любых задач, где простой допустим.

Риски: плановое техническое обслуживание неизбежно приводит к простою. Отказ одного компонента — одного модуля ИБП или одного блока системы кондиционирования — выводит весь объект из строя. Для производственных нагрузок это существенный бизнес-риск.

Tier II: резервирование отдельных компонент

Модель резервирования: N+1 для критически важных компонентов, единственный путь распределения.

Tier II добавляет резервные компоненты электроснабжения и охлаждения, однако по-прежнему использует единственный путь распределения. Резервные компоненты (дополнительные модули ИБП, дополнительные блоки системы кондиционирования) способны компенсировать единичный отказ, однако вывод самого пути распределения на техническое обслуживание по-прежнему требует остановки работы.

Что добавляется по сравнению с Tier I: модули ИБП по схеме N+1, блоки охлаждения по схеме N+1, резервное электропитание для критически важного оборудования и мощность генератора, рассчитанная на резервную нагрузку.

Оптимально подходит для: компаний среднего бизнеса, выросших за рамки Tier I; арендаторов в коммерческих дата-центрах с умеренными требованиями к SLA по доступности; организаций, которым необходима повышенная надёжность без бюджета уровня Tier III.

Tier III — возможность обслуживания без остановки

Модель резервирования: N+1 с несколькими независимыми путями распределения, один из которых активен в каждый момент времени.

Tier III — наиболее распространённый коммерческий стандарт дата-центров в мире. Ключевая особенность — возможность обслуживания без остановки работы: каждый компонент ЦОДа можно обслуживать, ремонтировать или заменять, не прерывая работу ИТ-нагрузки.

Это достигается за счёт нескольких независимых путей распределения электроснабжения и охлаждения, из которых в каждый момент времени активен только один. Когда один путь выводится на обслуживание, нагрузка переключается на другой. Работа продолжается без перебоев.

Что добавляется по сравнению с Tier II: несколько независимых путей распределения электроснабжения, несколько независимых путей распределения охлаждения, перекрёстно подключённые системы ИБП с поддержкой переключения между путями, а также физически разделённые маршруты распределения для предотвращения отказов по общей причине.

Оптимально подходит для: крупных предприятий, SaaS-провайдеров, финансовых организаций, учреждений здравоохранения, облачных провайдеров — любых объектов, где незапланированный простой влечёт существенные финансовые или регуляторные последствия.

Оптимальный баланс: Tier III обеспечивает наилучшее соотношение стоимости и надёжности среди всех уровней. Плановое обслуживание не влияет на работу объекта. Внеплановые отказы отдельных компонентов можно устранять без простоя.

Tier IV — полная отказоустойчивость

Модель резервирования: 2N или 2N+1, все пути распределения одновременно активны, полная отказоустойчивость.

Tier IV — высший уровень классификации. Каждый компонент продублирован. Оба пути распределения активны одновременно. Внеплановый отказ любого отдельного компонента или любого пути распределения не прерывает работу. Объект автоматически продолжает работу на полной нагрузке за счёт оставшихся систем.

Что добавляется по сравнению с Tier III: резервирование 2N для всех критически важных систем, одновременная активность всех путей распределения, автоматическое переключение при отказе без ручного вмешательства, физическая изоляция секций для предотвращения каскадного распространения отказа на резервную систему, а также непрерывное обнаружение неисправностей и мониторинг.

Оптимально подходит для: гиперскейлеров, кластеров обучения ИИ, финансовых бирж, оборонной и государственной инфраструктуры — любых объектов, где даже несколько минут простоя в год означают катастрофические финансовые, репутационные или связанные с безопасностью последствия.

Реалии строительства: Tier IV — наиболее сложный и дорогостоящий класс объектов в проектировании и строительстве. Физическая изоляция секций требует разделения дублирующих систем таким образом, чтобы пожар, затопление или физическое воздействие, затронувшее одну из них, не могло достичь другой. Это увеличивает затраты на строительные конструкции, повышает требования к занимаемой площади и существенно увеличивает время пусконаладочных работ.

Важный нюанс: многие организации переоценивают свою потребность в Tier IV. Если стоимость простоя не исчисляется миллионами долларов в час и не влечёт прямых последствий для безопасности, возможности Tier III по обслуживанию без остановки работы, как правило, вполне достаточно. Многие провайдеры достигают надёжности, эквивалентной Tier IV, развёртывая несколько объектов уровня Tier III в разных зонах доступности — вместо того чтобы инвестировать в строительство единственного объекта Tier IV.