就在王卓陪着女友在佘山挥杆之际,远在贵州的蒋玉宁正紧张盯着眼前的大屏幕。
“灾备切换演练”
随着一道清冷的指令发出。
大屏幕立即开始模拟起主GPU可用区完全故障,验证灾备GPU集群的任务切换流程。
所有人都在死死的盯着屏幕,灾备是云存储的核心功能,如果RTO(恢复时间)、RPO(数据丢失量)达到设计SLA,那么一期项目就可以进入试运营了。
当前国际标准的四级灾备,也就是同城灾备标准为RTO≤4小时,RPO≤2小时,五级灾备属于异地灾备,RTO≤1小时,RPO≤30分钟。
至于六级灾备(零数据丢失),仅金融核心交易系统的无状态业务能落地,对于课程表这种GPU有状态并行计算场景,哪怕三期建成,也无法做到绝对的数据零丢失。
现阶段一期只要四级同城灾备达标、五级异地灾备完成预演,就完全满足试运营要求了。
毕竟第一期的云服务除了应用在贵州,剩下的也仅仅只能用作课程表内部核心业务。
等第一期模式跑通后,就可以在全国主要区域再建立几个节点,等第二期建设完工后,就可以将服务范围扩大到节点区域。
至于第三期?
那是面向全国提供服务的,需要铺设更多的节点。
之前的集群级性能压测与极限容量验证在一个星期前就已经启动了。
主要是在设计峰值容量下,验收GPU任务调度延迟是否<10s,CUDA应用性能是否有明显衰减,在极限7*24小时长稳压测下是否有GPU、CPU宕机情况,有没有驱动崩溃。
要不是在这块花费了太多时间,其实蒋玉宁早就回申城了。
她又不擅长跟地方政府打交道,再加上现场还有很多官媒在跟踪采访报道。
时间在所有人的屏息注视中一点点流逝。
一个半小时后,所有故障恢复完成,业务全量续跑验证通过。
最终结果:RTO≤1.5小时,RPO≤30分钟。
这个数据意味着,哪怕出现极端的机房全故障,课程表云也能在1个半小时内完成业务恢复,仅丢失最多30分钟的计算结果,不仅远超国标四级灾备的要求,甚至摸到了五级异地灾备的标准线。
要知道国标是国标,真正商用时,行业内对外的可用性SLA承诺普遍是99.9%,对应全年累计不可用时间不超过8.76小时。
而这次课程表单次故障2小时内恢复的能力,已经远超行业通用标准了。
同时只丢了30分钟的计算结果,这个预期也高于国际标准。
蒋玉宁对这些数据倒是早有预料。
毕竟之前很多企业都是采用CPU服务集群,课程表算是全球第一个以GPU集群为核心架构、大规模落地云服务的企业。
效率仅仅只是比国际标准高出一倍,主要原因还是因为CUDA并行系统的最大加速比是由任务中不可并行的串行代码占比完全决定。
本小章还未完,请点击下一页继续阅读后面精彩内容!