-
日期: 2023-12-11 | 来源: 每日人物 | 有0人参与评论 | 字体: 小 中 大
11月12日,原本是一个平常的周末。一年一度的双11刚刚结束,有人期待着快递,有人还在比价,看自己有没有省钱,还有的人忙着退货,或者把替换下来的东西挂上闲鱼。对于阿里云的工程师们,这个周末也是愉快的,最忙的一段时间已经过去,接下来服务器负载将慢慢回落,他们也能松一口气。
这口气刚松一半,12日晚间,淘宝崩了。同一时刻,阿里云盘、闲鱼、钉钉、饿了么等产品接连崩溃,无法登陆、查看、结算等问题一并涌现,从17:44故障发生到21:11所有服务完全恢复,时长累计近三个半小时。
阿里系产品的大规模崩溃,很快就上了热搜,问题指向了阿里的“技术底座”——阿里云。与此同时,众多使用阿里云服务的企业和个人,也受到了影响。这是阿里云时隔一年后,又一场“史诗级故障”。
那几天,高层寻找故障源头并定责、技术人员排查漏洞、公关部门对外发布处理结果。这边还忙乱着,11月27日,异常再次出现。当日09:16 起,阿里云监控发现北京、上海、杭州、深圳、青岛、香港以及美东、美西地域的数据库产品的控制台和OpenAPI访问出现异常,持续时间约2小时。
短短一个月里,阿里云出现了两次大规模故障,这在整个云计算行业中都是罕见的。实际上,近日阿里云还有另外两次小规模局部故障,一次在11月28日,12月5日也有一次异常,持续时间都很短,很快就被解决。对云计算公司而言,安全性与可靠性是最重要的,也是阿里云始终在追求的,但频发的故障也显示出,阿里云内部可能存在着一些问题。
委屈与不幸
一个月接连两次故障后,阿里云的一位技术人员满腹委屈:“还能怎么重视安全和稳定性呢?”
在阿里云的发展史上,每一次故障都是大新闻。除去2018年6月和2019年3月的两次,最近的一次大故障出现在2022年12月,当时,阿里云的下游客户——一些公司和政府部门网站陷入瘫痪,数小时无法提供服务。最后发现,阿里云香港机房出现故障导致宕机,这成了科技圈里最大的热点,“是阿里云运营十多年来持续时间最长的一次大规模故障”。
面对故障,阿里云高度重视。内部传说“高层震怒”,香港宕机事件后,阿里云总裁张建锋(行癫)卸任,时任阿里集团一号位逍遥子张勇亲自挂帅。公司还额外成立了一个“稳定性团队”,在每个产品部门里设置专人负责。当月,稳定性团队拉上所有产品团队开了一个全体动员大会,内部叫做“kick off meeting”,简称“KO”,参与过那次大会的老员工王子木说,阵仗浩大,“热烈倡议我们打一场战役,集中力量把稳定性做好,做到哪些指标和级别,用多长时间,能想到的东西全都列好”。
到今年年初,关于安全和稳定的举措再迈上了一个台阶。阿里云CTO周靖人对安全和稳定尤其重视,每个员工也要在自己的OKR里加上“维护某某项目的安全与稳定性”。随后设置了“安全分”,发现有安全方面的问题就扣分,分数关系到具体员工的绩效,而绩效关系着年终奖和晋升,在3.25和3.75相差巨大的阿里,这几乎是最高力度的惩罚。
把这些举措加在一起,“公司已经没什么能做的了,几乎是120%的重视程度”。在王子木看来,一个把安全和稳定挂在嘴边、严格执行的公司,怎么会接连出问题?他只能把故障总结为运气,“阿里云多少是少了点运气”。
与香港宕机事件导致的局部故障不同,11月12日的故障,是一个底层全局性服务组件出现问题,导致全球范围内所有可用区和所有服务器同时发生故障,影响范围巨大。除了阿里系产品,还有众多使用阿里云业务的客户,尤其是那些没有规模化的运维技术团队,完全依赖阿里云各类托管服务的中小企业和个人开发者。
于是,在那个晚上,除了阿里系产品无法使用,还有闪送小哥上传不了接单凭据,原神玩家收不到短信验证码,一些停车场不抬杆,一些超市结不了账,甚至有的大学生因为刷不了卡,用不了学校的公共洗衣机。万幸的是,故障发生在周日,不然还会导致使用金融云和政务云的相关部门瘫痪,造成更大的损失。
- 新闻来源于其它媒体,内容不代表本站立场!
-
原文链接
原文链接:
目前还没有人发表评论, 大家都在期待您的高见