Yandex Cloud ru-central1-a 供电故障
TechFoco 精选
10月11日,Yandex Cloud ru-central1-a 可用区发生新供电故障,导致部分数据库只读或不可用、S3写入异常;控制台与IAM仍可用,d/e区计算资源正常,但K8s控制面状态不一致,基础设施持续...
10月11日,Yandex Cloud ru-central1-a 可用区因供电故障引发服务降级。该故障非全局中断,但影响呈现明显可用区边界——ru-central1-d 和 ru-central1-e 区计算资源保持正常,而 ru-central1-a 内部多项服务状态异常。
截至北京时间12:13,控制台与 IAM 服务可用,表明身份认证与管理平面基础功能未失守。但部分数据库进入只读模式或完全不可用,S3 读取能力保留,写入操作仍可能失败,反映出存储层在电力异常下的读写韧性不对称。
区域 Kubernetes 控制面与单区控制面状态不一致,说明控制组件未实现强同步或故障域隔离不足。这一现象提示:当底层基础设施波动时,控制面状态可能滞后或分裂,需独立监控各控制面健康度。
运维响应需按可用区逐项核查,不可依赖历史恢复节奏判断当前状态。基础设施仍不稳定,跨平台恢复方案应预验证数据库只读切换、S3 写入降级回退等关键路径,而非默认其他云平台资源即时可用。
当前披露未说明供电故障持续时间、受影响数据库类型、S3 写入失败的具体范围,以及‘单区控制面’与‘区域控制面’的架构定义。这些未知项限制了根因复盘与长期加固设计。