Ad
События

Третий дата-центр «Яндекса» пострадал за четыре дня

Маша Даровская
By Маша Даровская , IT-редактор и автор
Третий дата-центр «Яндекса» пострадал за четыре дня
Обложка © Anonhaven

Дата-центр «Яндекса» во Владимире полностью остановил работу после атаки беспилотников в ночь на 11 октября. Повреждение вывело из строя зону доступности Yandex Cloud ru-central1-a, а пользователи по всей России столкнулись со сбоями «Яндекс Go», «Яндекс Пэй», «Яндекс Еды», «Музыки», «Кинопоиска», умного дома и других сервисов.

Проблемы появились и у сторонних компаний. «Додо Пицца» прямо связала недоступность сайта и приложения с аварией у облачного провайдера. Не работал сайт аэропорта Пулково, хотя сам аэропорт продолжил обслуживать рейсы. Мониторинговые сервисы одновременно фиксировали жалобы на «Дом.ру», «Магнит», «Вкусно — и точка», Flowwow, «Юрент» и другие проекты, но для большинства из них прямую связь с Yandex Cloud компании публично не подтверждали.

Это третий серьезный инцидент на площадках «Яндекса» за четыре дня. 8 октября полностью остановился дата-центр в Сасово Рязанской области, 9 октября несколько модулей были выведены из строя в Калуге, а 11 октября остановился Владимир.

Для Yandex Cloud новый отказ особенно болезненный: после Сасово зона ru-central1-b так и не вернулась в работу, а теперь одновременно недоступна и ru-central1-a. Компания официально перевела облачную платформу в аварийный режим и рекомендует клиентам использовать внешние площадки для восстановления критичных систем.

Первые сообщения на статус-странице Yandex Cloud появились в 4:11 мск. Компания зафиксировала перебои с электропитанием в ru-central1-a и начала разбираться в причинах.

В 6:08 мск Yandex Cloud сообщил уже о физическом повреждении инфраструктуры владимирского дата-центра в результате атаки БПЛА. Работу площадки полностью остановили. Пострадавших нет, профильные службы работают на месте, а команда оценивает ущерб и возможные варианты восстановления.

«Яндекс» отдельно подтвердил РБК, что часть его пользовательских сервисов стала недоступна.

Власти Владимирской области сообщали об атаке на инфраструктуру в пригороде Владимира и возникшем пожаре. Инцидент также затронул энергоснабжение: две подстанции временно отключились от сети.

Yandex Cloud работает без двух зон

Уже к 6:11 мск Yandex Cloud сообщил, что одновременно недоступны ru-central1-a и ru-central1-b.

В формулировках самой компании ситуация выглядит серьезно: оставшуюся конфигурацию ресурсов Yandex Cloud считает неустойчивой, а режим работы платформы — аварийным. Клиентам рекомендуют задействовать альтернативные планы восстановления, включая внешние площадки.

ru-central1-b остается недоступной после пожара в дата-центре Сасово 8 октября. Еще 10 октября Yandex Cloud перешел на ручное управление квотами вычислительных ресурсов и дисков, стараясь сохранить запас мощностей для клиентов, которым необходимо восстанавливать критичные системы.

После потери Владимира этот запас понадобился уже самой платформе.

Что работает внутри Yandex Cloud

К 7:13 мск вычислительные ресурсы Compute Cloud оставались доступны в ru-central1-d и ru-central1-e.

Большинство отказоустойчивых кластеров управляемых баз данных переключилось на работающие площадки, но часть баз могла оставаться недоступной или перейти в режим только для чтения.

Object Storage работал на чтение, при записи могли возникать ошибки. Региональные Kubernetes-кластеры с управляющими компонентами в d и e продолжили работать штатно. Кластеры, управляющая часть которых зависела от одной из недоступных зон, могли не работать.

IAM оставался доступным, а Monium был недоступен.

К 8:55 мск команда продолжала стабилизацию ключевых сервисов и сохраняла основную рекомендацию: для восстановления ресурсов использовать альтернативные площадки.

То есть Yandex Cloud целиком не «лег». Но потеря сразу двух зон заметно сократила запас отказоустойчивости и нарушила работу части региональных сервисов.

«Яндекс Go», платежи и умный дом начали сыпаться утром

Массовые пользовательские жалобы появились почти одновременно с остановкой ЦОД.

На 6:20 мск Detector404 фиксировал около 1,6 тыс. сообщений за час о проблемах с «Яндекс Go», около 1,4 тыс. — с сервисами «Яндекса» в целом и почти 900 — с «Яндекс Пэй».

Также пользователи жаловались на «Яндекс Про», «Дом с Алисой», «Яндекс Музыку» и «Кинопоиск».

Позже проблемы наблюдались у «Яндекс Еды», «Телемоста» и «Яндекс Электричек». У последнего не загружалось расписание. «Яндекс Пэй» сообщил, что инженеры восстанавливают сервис, а средства пользователей находятся в безопасности.

«Яндекс Маркет» временно закрыл сортировочные центры для отгрузок. Склады и пункты выдачи при этом продолжили работать, а опоздания по заказам 11 октября компания решила не учитывать в индексе качества продавцов.

Сбой заметили далеко за пределами «Яндекса»

Утром 11 октября проблемы возникли у десятков российских интернет-сервисов.

«Додо Пицца» подтвердила, что сайт и мобильное приложение оказались недоступны из-за масштабной аварии у облачного провайдера.

Сайт аэропорта Пулково временно перестал работать. При этом аэропорт продолжил штатно регистрировать пассажиров и обслуживать рейсы; для просмотра статуса рейсов пользователям предложили альтернативное онлайн-табло.

Мониторинги одновременно фиксировали сбои у «Дом.ру», «Вкусно — и точка», «Магнита», Flowwow, «Юрента», DDX Fitness и других сервисов. Для большинства из них доказанной связи с аварией именно в Yandex Cloud пока нет: совпадение времени сбоя само по себе этого не подтверждает.

Поэтому корректнее говорить о масштабном сбое российских онлайн-сервисов после аварии Yandex Cloud, а не записывать каждую недоступную площадку в прямые клиенты поврежденного дата-центра.

Проблемы дошли до Казахстана, Киргизии и Белоруссии

Сбой оказался международным. Yandex Qazaqstan подтвердил технические сложности в Казахстане. Пользователи, водители и курьеры столкнулись с ошибками и временной недоступностью сервисов Yandex Go. Компания сообщила, что занимается восстановлением, но сроки на тот момент назвать не могла.

В Киргизии пользователи сообщали о проблемах с «Яндекс Едой» и заказом такси. Похожие жалобы поступали из Белоруссии и с российского Дальнего Востока.

Причина такого эффекта понятна: приложения в разных странах могут использовать общие компоненты авторизации, платежей, маршрутизации, баз данных и внутренние API. Физически поврежденный дата-центр в одном регионе способен нарушить работу сервиса за тысячи километров.

Это уже третий ЦОД за четыре дня

Серия началась в ночь на 8 октября в Сасово Рязанской области.

После атаки БПЛА там произошел пожар, затронувший инфраструктуру Yandex Cloud. Работа дата-центра была полностью остановлена, а ru-central1-b стала недоступной. К 10 октября зона так и не восстановилась.

9 октября повреждения получил ЦОД в Калуге. «Яндекс» сообщил, что несколько его модулей полностью выведены из строя. Полной остановки калужской площадки компания не объявляла.

11 октября полностью остановился Владимир и вместе с ним — ru-central1-a.

Получается три поврежденных физических площадки за четыре дня, две из которых полностью остановлены.

Почему одна зона переживается легче двух

Облачная инфраструктура изначально строится с расчетом на отказ отдельных серверов, стоек и целых дата-центров.

Если приложение распределено между несколькими зонами, потеря одной площадки позволяет перенести нагрузку на остальные.

Именно это Yandex Cloud сделал после Сасово: сервисы в других зонах продолжили работать, а нагрузку начали переносить. Но одновременно сократился запас свободных ресурсов, а создание новых виртуальных машин, баз и кластеров пришлось ограничивать.

После потери ru-central1-a ситуация изменилась. Теперь значительная часть системы должна удерживаться на ru-central1-d и ru-central1-e.

У отказоустойчивого кластера с репликами в разных зонах шанс продолжить работу остается. Если сервис был привязан только к a или b, автоматическое переключение может быть просто некуда делать.

«Яндекс» уже отправляет клиентов к конкурентам

Еще после аварии в Сасово Yandex Cloud договорился с Selectel, K2 Cloud и VK Cloud об ускоренном размещении и резервировании клиентской инфраструктуры.

Провайдеры выделили дополнительные команды и упростили подключение для клиентов, которым требуется срочно перенести ресурсы.

После потери еще одной зоны эта схема превращается из дополнительной страховки в полноценный вариант аварийного восстановления.

Multi-cloud в такой ситуации нужен не ради красивой архитектурной диаграммы. Если критическое приложение должно работать даже при потере нескольких площадок одного поставщика, хотя бы часть инфраструктуры, резервных копий и конфигурации должна быть доступна за пределами этого поставщика.

Резервная копия не заменяет работающий резерв

У таких аварий есть еще одна неприятная особенность. Наличие бэкапа не означает, что сервис быстро вернется в сеть. Резервная копия сохраняет данные. Для запуска приложения нужны еще вычислительные ресурсы, сеть, балансировщики, сертификаты, секреты, базы данных, контейнерные образы и рабочая конфигурация.

Если свободных мощностей в оставшихся дата-центрах мало, восстановление большого количества клиентов одновременно становится отдельной проблемой.

Поэтому после Сасово Yandex Cloud и перешел на ручное распределение части квот: критичные проекты конкурируют за ограниченный запас вычислительных ресурсов.

Восстановление сервиса не означает восстановление ЦОД

В течение дня отдельные приложения могут возвращаться в работу задолго до ремонта физической площадки.

Для этого нагрузку переключают на другие дата-центры, запускают новые экземпляры сервисов и восстанавливают данные из реплик.

Сам владимирский ЦОД при этом остается полностью остановленным. Последнее опубликованное сообщение Yandex Cloud говорит о продолжающейся стабилизации платформы и восстановлении ключевых компонентов.

Поэтому сообщение «такси снова работает» не означает, что серверы во Владимире включили обратно.

Скорее всего, это означает, что сервису удалось найти другой путь до необходимых вычислительных ресурсов.

Вопросы и ответы

Что произошло с дата-центром «Яндекса» во Владимире?

После атаки БПЛА инфраструктура ЦОД получила повреждения. Работу площадки полностью остановили, пострадавших нет.

Когда начался сбой?

Первое сообщение Yandex Cloud о проблемах с электропитанием появилось в 4:11 мск 11 октября. В 6:08 компания сообщила о повреждении дата-центра после атаки.

Какая зона Yandex Cloud отключилась?

ru-central1-a. Одновременно после предыдущего инцидента остается недоступной ru-central1-b.

Yandex Cloud полностью перестал работать?

Нет. Compute Cloud продолжил работу в ru-central1-d и ru-central1-e, доступны Console, API и IAM. Но платформа официально работает в аварийном режиме.

Что произошло с базами данных?

Большинство отказоустойчивых кластеров Managed Databases переключились на рабочие площадки. Часть могла остаться недоступной или перейти в режим только для чтения.

Что с Object Storage?

Утром 11 октября чтение из Object Storage работало, при записи могли возникать ошибки.

Какие сервисы «Яндекса» пострадали?

Жалобы фиксировались на «Яндекс Go», «Яндекс Пэй», «Яндекс Еду», «Музыку», «Кинопоиск», «Дом с Алисой», «Телемост», «Яндекс Про» и другие сервисы.

Падали ли сторонние сайты из-за Yandex Cloud?

Для «Додо Пиццы» связь с аварией облачного провайдера подтверждена самой компанией. У ряда других сервисов сбои совпали по времени, но прямую причину они не подтверждали.

Сбой затронул другие страны?

Да. Yandex Qazaqstan подтвердил проблемы в Казахстане. Жалобы на сервисы «Яндекса» поступали также из Киргизии и Белоруссии.

Это третий поврежденный ЦОД «Яндекса»?

Да. 8 октября полностью остановился Сасово, 9 октября несколько модулей вышли из строя в Калуге, 11 октября полностью остановился Владимир.

Когда восстановят Владимир?

Точных сроков пока нет. Yandex Cloud продолжает оценивать ущерб и восстанавливать ключевые сервисы.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.