Проблемы у компании начались 7 сентября. CloudSigma сначала сообщила о нарушении сетевого соединения в двух швейцарских кластерах. Связь удалось вернуть довольно быстро, но вслед за этим выяснилось, что последствия оказались серьезнее обычного сетевого сбоя.
Представители CloudSigma объяснила, что внутри облачной сети произошла неожиданная одновременная перезагрузка устройств. В результате от сети оказались отрезаны все storage nodes — серверы, на которых работает система хранения данных.
Большинство виртуальных дисков специалисты смогли вернуть в рабочее состояние. Однако часть из них продолжала отображаться как недоступная. В первую очередь инженеры восстанавливали операции с хранилищем и проверяли работу сетевой инфраструктуры.
В Женеве сервисы и виртуальные машины полностью заработали примерно через 40 минут после первого сообщения о сбое. В Цюрихе восстановление заняло больше времени: нормальную работу всей облачной инфраструктуры компания подтвердила примерно через полтора часа.
На этом работы не закончились. В тот же вечер CloudSigma провела экстренное обслуживание сети сразу в обоих дата-центрах. Компания объяснила его необходимостью стабилизировать платформу и не допустить повторения ситуации. Во время этих работ клиентов предупреждали о возможных кратковременных проблемах с хранилищем и потерях сетевых пакетов.
Что именно заставило сетевые устройства перезагрузиться одновременно, в первоначальных сообщениях CloudSigma не раскрыла. Компания пообещала разослать затронутым клиентам подробный разбор причин инцидента.
Примечательно, что сегодня проблемы вернулись. CloudSigma вновь сообщила о сетевом сбое, затронувшем облака Цюриха и Женевы. Примерно через час специалисты заявили, что ситуацию удалось взять под контроль и за работой инфраструктуры продолжают наблюдать. Связала ли компания новый инцидент со сбоем предыдущего дня, не сообщается.