AWS大规模中断引发IT韧性拷问
周一,亚马逊云服务(AWS)发生大规模中断,影响数千客户及多项数字服务。尽管公司采取缓解措施,但服务仍处于降级状态。分析师指出,此次事件再次提醒CIO们,多云与本地混合架构及独立于主云提供商的恢复计划至关重要。

周一上午,亚马逊云服务(AWS)发生大规模中断,影响数千家客户,并引发多项数字服务连锁故障。尽管初期恢复措施部分缓解了美国东部(US-East-1)区域数百项AWS服务的运行困难,但问题并未完全解决,亚马逊当天晚些时候仍在定位并修复根本原因。
根据该公司状态页面上的更新,这家提供云服务的亚马逊子公司将问题归因于一个负责监控其网络负载均衡器健康状况的内部子系统。
“我们已采取额外缓解措施,以帮助恢复负责监控网络负载均衡器健康状况的底层内部子系统,目前正看到AWS服务的连接性和API恢复,”该公司在美东时间周一中午左右表示,但仍将服务状态列为“已降级”。
云中断可能波及数字服务,同时扰乱多个应用,并阻碍业务连续性计划。当受影响的是在市场份额上领先同行的AWS时,影响可能进一步加剧。
据高德纳(Gartner)估计,去年亚马逊云服务吸引了所有基础设施即服务(IaaS)支出的37.7%,而微软的市场份额为23.9%。谷歌去年仅控制了9%的支出。
Info-Tech Research Group数字基础设施实践负责人John Annand表示,云中断为首席信息官(CIO)敲响警钟,帮助他们评估自身IT资产的韧性。
“试图将任何风险降至零,成本会呈指数级上升,”Annand说,“你希望风险越低,花费就越高。”
IT压力测试
Annand指出,供应商选择只是CIO韧性拼图的一部分。但从架构角度看,依赖重叠供应商的云系统可能过于复杂。
“这在纸面上看起来不错,人们在会议上谈论它,但实际并不这么做,”Annand说,“你必须权衡云平台的有效性和易用性,然后尝试在你知道可能发生中断的时候做好规划。”
Omdia IT运营首席分析师Roy Illsley表示,对于CIO而言,此类中断的关键启示是制定双源策略。
“这一事件表明,即使是像AWS这样的公司也可能受到影响,除非你有应急计划,否则就会陷入困境,”他在给CIO Dive的电子邮件中说。
Illsley认为,多云提供了额外的韧性层,但在云之间迁移工作负载颇具挑战。理想情况下,CIO应考虑将多云与本地环境相结合,但他也提醒,这一策略成本更高、实施更复杂。
“没有银弹,”Illsley说,“但CIO必须进行尽职调查,并考虑制定独立于主云提供商的稳健恢复计划。”
IT中断可能给企业带来巨大损失。根据New Relic上月发布的数据,技术问题导致的运营停机每小时给企业造成的中位成本为200万美元。该公司发现,云服务故障是IT停机的主要原因之一。
去年,一次有缺陷的CrowdStrike更新推送到Windows设备,引发大规模中断,全球IT系统受到波及。2024年7月的事件导致财富500强公司估计超过50亿美元的直接财务损失,其中医疗保健行业遭受的财务冲击最大。
分析师和专家此前告诉CIO Dive,计划外的IT故障可能为重新评估业务连续性计划提供机会。
“问题不在于服务是否会宕机,”Annand说,“而在于何时宕机。作为CIO,你的职责是与高管团队共同管理这一风险,并制定计划。”
编辑总监Nicole Laskowski对本文有贡献。
披露:Informa持有Informa TechTarget的控股权,后者是CIO Dive的出版商,也是Omdia的母公司。Informa对CIO Dive的报道没有影响力。