Облачный сбой Railway: компания обвинила Google Cloud в блокировке аккаунта без предупреждения
Платформа для развертывания приложений Railway столкнулась с масштабным сбоем, который привел к недоступности сервисов для миллионов пользователей. Инцидент был вызван внезапной блокировкой аккаунта компании со стороны Google Cloud, которая произошла без предварительного уведомления.
Хронология и последствия инцидента
Проблема была обнаружена 19 мая 2026 года в 22:20 по всемирному координированному времени. Восстановление нормальной работы заняло около восьми часов и завершилось к 06:14 следующего дня. В течение этого времени пользователи Railway, общее число которых превышает три миллиона, столкнулись с невозможностью доступа к панели управления, ошибками авторизации и сбоями в работе API и баз данных.
Причиной столь широкого охвата проблемы стала техническая зависимость: контрольная панель сети Railway размещена на мощностях Google Cloud. Из-за этого блокировка основного аккаунта привела к остановке рабочих нагрузок не только в инфраструктуре Google, но и в других облачных средах. Действующие приложения продолжали работать около 15 минут, после чего кэши начали истекать, что спровоцировало массовые ошибки доступа.
Причины блокировки и позиция сторон
Согласно отчету, Google Cloud проводила автоматизированную проверку, направленную на выявление подозрительной активности, в частности, скрытого майнинга криптовалют. В ходе этой процедуры под ограничения попало множество учетных записей. Хотя аккаунт Railway был разблокирован спустя девять минут после начала сбоя, на установление связи с поддержкой облачного провайдера у компании ушел почти час.
Несмотря на претензии к действиям Google, руководство Railway признало ответственность за произошедшее. Основным фактором, усугубившим ситуацию, стало отсутствие отказоустойчивой архитектуры для критически важного компонента — API управления сетью, который был жестко привязан к одному облачному провайдеру.
Изменения в стратегии инфраструктуры
По итогам инцидента компания Railway объявила о внедрении ряда технических изменений:
- Устранение критической зависимости сетевого уровня от единственного облачного провайдера.
- Создание альтернативных путей взаимодействия между различными облачными платформами для предотвращения подобных сбоев.
- Усиление политики обеспечения доступности сервисов, так как пользователи ожидают стабильной работы платформы независимо от действий сторонних провайдеров.
Компания подчеркнула, что обеспечение стабильности является ее исключительной обязанностью перед клиентами, и в будущем планирует исключить подобные сценарии за счет диверсификации инфраструктуры.
