华为云全球性故障:疑似IAM升级故障
北京时间 7 月 26 日凌晨 2:49,华为云官方检测到 " 国际账号异常 ",并于 3:34 前后在国际站官网发布通知;第三方监控平台 StatusGator 自 3:32 起收到大量用户报障,24 小时内累计超过 450 条,覆盖阿根廷、土耳其、巴西、埃及、泰国、墨西哥、智利等多个国际站市场,截至上午 8:15 事件仍在持续,异常持续时间超过四小时。
这是一次全球性跨区域事故,事故表现同时涉及登录失败、管理操作失败、资源异常冻结和服务器不可达。第三方检测在北京时间 03:32 触发,报障至少持续到现在,而官方状态页未公开确认。
事故与凌晨进行的 IAM 统一身份认证服务升级在时间上高度重合,极可能是一次计划维护异常扩大或由此触发的共享控制面级联故障。华为云于 7 月 17 日发布的公告,公告宣布计划于此时段(2026/07/26 02:00-04:00)升级统一身份认证服务(IAM),但故障根因并未得到华为云确认。
根因推断
StatusGator 将最早异常描述为 " 登录问题和错误消息 ",常见问题分类包括:
•无法登录;•控制台或应用无法加载;• API 或操作返回错误;•服务管理操作失败。
这与当天 IAM 维护公告所描述的预期影响高度一致:IAM 用户管理、授权、账号设置,以及开通、创建、修改、删除资源等管理面操作可能失败。
多名报告者使用的不是普通的 " 卡住 " 或 " 挂掉 ",而是华为云语境中很具体的 Frozen/冻结:
• " 所有资源被冻结 ";• " 所有服务器被冻结 ";• " 服务器被冻结 "。
另一部分报告并未提及控制台,而是直接报告:
server not responding; service down; connectivity issue; servers down。
如果只是 IAM 登录或控制台异常,理论上已经运行的数据面 ECS、数据库和公网服务不应普遍失去数据面连接。因此,这批报告暗示事故可能已经从单纯的认证管理面扩散到更多服务。
基于现有证据,有较高置信度推断此次故障由 IAM 升级异常,今儿引发国际站共享控制面级联故障
支持证据很强:
•官方确实在同一时段升级 IAM;•异常检测发生在维护窗口内部;•最初症状就是登录、身份认证和错误消息;•受影响国家分散,不像单个机房断电;•故障持续超过维护窗口,符合升级失败、回滚失败、状态同步异常或缓存污染等模式。
但具体原因请以华为云后续公告为准。
时间线
从第三方首次检测的 03:32 到最后一条可见报障的 08:22,异常信号至少延续了 4 小时 52 分钟。
大型云厂商关键服务故障导致全球故障并不乏先例。例如阿里云 2023 年全球史诗级大故障正是由于 IAM / OSS 循环依赖导致。
References
[ 1 ] 华为云统一身份认证服务 ( IAM ) 计划于 2026 年 7 月 26 日 02:00-04:00(北京时间)升级通知 : https://www.huaweicloud.com/notice/20260717153237724.html
[ 2 ] 2026 年 7 月 26 日(北京时间)华为云帐户异常通知 : https://www.huaweicloud.com/intl/en-us/notice/20260726033454857.html
[ 3 ] Statusgator - Huawei Cloud Status: https://statusgator.com/services/huawei
[ 4 ] : https://x.com/hibtc37/status/2081147436194730283
[ 5 ] : https://www.huaweicloud.com/intl/en-us/notice/20260726033454857.html
专栏:云计算泥石流
云故障
云资源
下云记
