21CTO导读:GitHub首席技术官承诺在8月第二次系统宕机后进行架构之全面改革。
本周,GitHub 的性能问题与宕机忧虑仍继续。
其首席技术官弗拉基米尔·费多罗夫(Vladimir Fedorov)提供了更多关于8月17日故障的细节——同时小心翼翼地避免使用“对不起”这个词。
宕机持续了7小时47分钟,极大地影响了全球开发者的工作。由于平台无法满足需求扩展,操作、拉取请求、问题、Copilot和API等服务均受到影响。
“如果你今天正准备发布软件,我们让你失望了,”费多罗夫写道。
此次事件发生在8月6日,行动平台发生了第二次故障之后。该平台已经启动了一段时间,并在4月份承认了这一点,但解决根本问题的努力并没有上流量持续增长的走势。
4月份,GitHub的月提交次数达到14亿次。
GitHub 还表示,目前每月处理 29 亿次提交、2400 万个新仓库和 1.3 亿个合并的拉取请求。
Microsoft Azure 平台目前占据了 GitHub 约 58% 的平台负载和 Git 操作的一半。据 Fedorov 称,GitHub 已加速将更多工作负载迁移到其母公司微软的云平台。
他表示:“我们的下一个里程碑是构建一个读取容量随读取器数量线性扩展的架构,从而实现无限次读取操作。我们将逐步推出该架构,首先从最大的批量仓库开始。”
在该架构推出之前,GitHub 必须解决重试风暴和配置错误的限制所暴露的扩展性缺陷。
Fedorov强调说,“这两次宕机都不是由代码或配置更改引起的”——换句话说,这些故障模式在平台中多次潜藏,而不是由新的部署引入的。
该公司仍在努力隔离关键系统,以减少未来故障的影响范围,收紧重试限制,并增加流量高峰早期预警。
GitHub 的间歇机至少让一些开发者感到不安。
社交媒体上的反应褒贬不一:有人普遍存在如此大规模的运营所面临的挑战,而付费用户则对这项服务未能达到预期的失望。
Fedorov最后总结道:
“开发者社区依靠 GitHub 来构建、发布和运维他们的作品。这只有在你们能够相信我们的情况下才有可能实现,但在 8 月 17 日,你们却无法背叛我们。我们有责任解决这个问题。我们将通过平台的可扩展性和可靠性来赢得你们的信任。”
作者:场长
来源:
https://github.blog/news-insights/company-news/the-august-17-outage-and-the-work-ahead/
本篇文章为 @ 场长 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。