Meta обесточила дата-центры — результата по живому трафику пока нет

В инженерном разборе Meta от 3 июня 2026 года описано контролируемое обесточивание крупных рабочих регионов дата-центров. Проверку регионов с активным пользовательским трафиком компания тогда обозначила как следующий этап, а не как уже завершённую часть программы.
Более поздняя публикация о завершении этого этапа пока не появилась. Поэтому доступный результат следует трактовать точно: Meta испытала восстановление производственной инфраструктуры с системами хранения, ИИ-нагрузками и хранилищами данных, но не доказала бесперебойность Facebook, Instagram, WhatsApp и других приложений при полном отключении региона.
Что именно отключала Meta
Регион в инфраструктуре Meta — это не отдельный серверный зал, а несколько расположенных рядом зданий дата-центров с общей сетевой и энергетической связностью. Сценарий Instantaneous PowerLoss Storm предусматривает внесение отказа в систему электроснабжения, после которого весь такой регион немедленно обесточивается.
Предварительно переносить вычисления с площадки инженеры не стали: подготовленная разгрузка не воспроизвела бы аварию без предупреждения. После отключения регион изолировали от глобальных планировщиков и контроллеров, чтобы сбой не распространился на остальную инфраструктуру.
Масштаб испытаний увеличивали постепенно. Сначала отдельные зависимости проверяли при запуске новых площадок и в теневых регионах, воспроизводящих рабочую среду. Затем очередь дошла до небольших производственных регионов с ограниченной зоной возможного ущерба, а после — до крупных площадок с критическими системами хранения, ИИ-вычислениями и хранилищами данных.
Самая сложная часть начинается после подачи питания
Вернуть электричество недостаточно: миллионы сервисов должны одновременно запуститься, обнаружить зависимости и восстановить взаимодействие. Неконтролируемый массовый старт способен вызвать новый отказ даже при исправном оборудовании.
Контейнерными нагрузками управляет оркестратор Twine. Его планировщики, распределители ресурсов и другие компоненты управляющего контура нужны для запуска остальных сервисов, но сами зависят от работающей вычислительной среды. При восстановлении полностью выключенного региона возникает замкнутый круг: Twine должен запустить службы, без которых не может заработать сам.
Эту проблему назвали «уроборосом». Критические цепочки запуска стали проверять тестами Belljar в конвейерах непрерывной интеграции и развёртывания, а для непредвиденных циклических зависимостей подготовили отдельный комплект восстановления Twine. Он первоначально поднимает управляющие компоненты, после чего штатный оркестратор может вернуть остальные нагрузки.
Почему аварийный сигнал мешал восстановлению
Вторая найденная проблема получила название «бумеранг». Региональные события недоступности координировали остановку и восстановление сервисов, но тот же сигнал выключал службы управляющего контура, необходимые для обработки последствий аварии.
Из-за этого часть нагрузок могла остаться без управления: оркестратор уже остановился, хотя зависимые сервисы ещё требовали корректного завершения работы или перезапуска. Вместо постоянно меняющегося перечня исключений управляющим компонентам разрешили игнорировать сигналы остановки, связанные с потерей питания.
Оба дефекта объясняют ценность испытания целого региона. Отдельная стойка или программный компонент может успешно проходить локальные проверки, тогда как одновременная остановка множества систем выявляет скрытые связи между ними.
Какие последствия испытания считаются допустимыми
Цель программы — не устранить любую кратковременную ошибку любой ценой. К неприемлемым результатам отнесены потеря данных в системах хранения и базах данных, необратимое повреждение механического или электрического оборудования и продолжительное распространение сбоя за пределы одного региона.
Временные ошибки сервисов, отказ ограниченного числа стоек и ограниченная по времени неактуальность сведений о маршрутизации могут оставаться в допустимых пределах. Такая граница нужна, поскольку чрезмерное резервирование повышает стоимость инфраструктуры, замедляет её развитие и само способно создавать ложные срабатывания.
Это не означает, что пользовательский простой заранее признан нормой. Описание испытания не раскрывает его точную продолжительность, число ошибок, время полного возврата нагрузок или влияние на доступность отдельных приложений. Без этих показателей нельзя оценить качество пользовательского опыта во время регионального отключения.
Почему региональный блэкаут представляет бизнес-угрозу
Потеря электроснабжения для Meta — не только техническая неисправность. В поданном в SEC годовом отчёте Meta за 2025 год она перечислена среди событий, способных вызвать перерывы, задержки и отказы, а также помешать своевременному восстановлению инфраструктуры и пользовательских данных.
Приложения и рекламная система компании используют общую глобальную инфраструктуру, поэтому региональная авария способна выйти за границы отдельного серверного зала. Практическая ценность Instantaneous PowerLoss Storm состоит в выявлении каскадных зависимостей до реального происшествия и в отработке автономного запуска площадки.
Однако такое испытание не защищает от всех классов отказов. Потеря электроснабжения, разрыв магистральной сети, ошибочная конфигурация и программный сбой требуют разных механизмов устойчивости. Успешное восстановление хранилищ или ИИ-нагрузок нельзя автоматически приравнивать к доступности всех пользовательских сервисов.
Устойчивость дата-центра не равна устойчивости энергосети
Последующий инцидент в Северной Вирджинии показал другую сторону проблемы. В репортаже Reuters от 22 июля 2026 года со ссылкой на операционные данные PJM указано, что после отключения линии электропередачи автоматика дата-центров перевела объекты на резервное питание, а из сети внезапно исчезло более 3 ГВт нагрузки — около 3% тогдашнего спроса.
Этот эпизод не был испытанием Meta, и открытые сведения не связывают его с площадками компании. Он показывает более широкое ограничение: защитная автоматика может сохранить работу серверов, одновременно создав резкое изменение нагрузки для внешней энергосистемы.
Программа Meta проверяет прежде всего восстановление собственной вычислительной инфраструктуры. Она не оценивает реакцию окружающей энергосети на массовое переключение дата-центров и пока не даёт оснований говорить о доказанной бесперебойности приложений при полном отключении региона с активным пользовательским трафиком.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.