百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

从Cloudflare事件,看DNS服务的重要性

nanshan 2024-10-04 18:03 20 浏览 0 评论

7.17事件

美国时间7月17日下午,知名互联网服务商Cloudflare由于路由器发生错误,引起全球性互联网访问中断,中断持续了27分钟,整个网络上的流量下降了50%,造成包括Shopify、Politico、Discord和LOL(英雄联盟)等在内的网站及服务无法访问。随后,Cloudflare从其全球的十二个数据中心重新路由了流量,逐渐恢复了互联网访问。

据悉,故障波及的范围巨大,包括达拉斯、西雅图、洛杉矶、芝加哥、华盛顿特区、亚特兰大、伦敦、阿姆斯特丹、法兰克福、巴黎、斯德哥尔摩、莫斯科、圣彼得堡、圣保罗等多地。

事件起因——“不是攻击的结果”

美国东部时间下午6:09,Cloudflare在其官网上发布一条消息:“今天下午,我们看到了网络中某些部分的中断。这不是攻击的结果。我们全球骨干网中的路由器似乎宣布了错误的路由,并导致网络的某些部分不可用。我们相信我们已经解决了根本原因,并且现在正在监视系统的稳定性。”

随后,Cloudflare博客中更新了此次中断的原因:在处理与纽瓦克到芝加哥的网络阻塞问题时,其网络工程团队更新了亚特兰大路由器上的配置。然而,此配置包含了一个错误,该错误直接导致跨越Cloudflare主干网络的所有流量都发送到了亚特兰大。这很快使亚特兰大的路由器不堪重负,并导致连接到主干网的Cloudflare网络位置出现故障。

时间线

具体的时间线是这样的:

  • 20:25 EWR和ORD之间的主干链路丢失
  • 20:25 ATL和IAD之间的骨干网拥塞
  • 21:12至21:39 ATL吸引了来自整个骨干网的流量
  • 21:39至21:47 ATL从主干链路中删除,服务已恢复
  • 21:47至22:10 核心拥塞导致某些日志下降,边缘继续运行
  • 22:10 全面恢复,包括日志和指标

下图是Cloudflare内部流量管理器工具产生的影响视图:

事件后续

事后,Cloudflare公开发表声明:“我们从未经历过骨干网中断的情况,我们的团队迅速响应以恢复受影响位置的服务,但这对于每个参与人员来说都是一个非常痛苦的时期。对于我们的客户以及中断期间无法访问互联网的所有用户,我们深表歉意。我们已经对主干配置进行了更改,以确保此类情况不会再次发生”。

稳定、安全的DNS服务的重要性

在2019年7月2日,Cloudflare就曾因CPU的大量激增导致主、次系统崩溃,遭受了约30分钟的停机。短短一年时间,Cloudflare又一次发生如此重大的事故,这让我们意识到一个稳定、安全的DNS服务是多么重要。

随着物联网、5G、AI等技术的发展,互联网加速了诸如无人驾驶、远程办公、智能家居等多个新兴行业的诞生与发展。可以试想一下,当无人驾驶汽车运送您前往目的地时、当AI机器人正在为您提供服务时、当您正在进行一个远程大型会议时……如果此时出现断网、网络攻击等问题,将会造成怎样的严重后果。

因此,在这样的背景下,作为本着“用户至上”理念的网络DNS服务厂商,我们更加不能忽视网络安全与稳定的问题。如何保证大量数据运行过程中服务器不宕机、网络不中断,如何反黑客、防止网络攻击,是我们始终需要思考的问题。

阿里云DNS团队拥有多年的DNS运营经验,始终把互联网基础设施重要组成部分作为我们的目标,赢得业界好评。我们的产品深受用户青睐,向来是用户的首要选择。阿里云公共DNS服务,面向所有互联网用户,提供全球公共递归域名解析服务,旨在用优质的服务保障网站运营商的业务持续稳定、保障用户的流畅上网体验。

不论您是普通的互联网用户,还是浏览器的厂商,亦或是智能终端设备的供应商,阿里云公共DNS,都能为您提供安全、稳定、快速的服务。


本文为阿里云原创内容,未经允许不得转载。

相关推荐

服务器数据恢复—Raid5数据灾难不用愁,Raid5数据恢复原理了解下

Raid5数据恢复算法原理:分布式奇偶校验的独立磁盘结构(被称之为raid5)的数据恢复有一个“奇偶校验”的概念。可以简单的理解为二进制运算中的“异或运算”,通常使用的标识是xor。运算规则:若二者值...

服务器数据恢复—多次异常断电导致服务器raid不可用的数据恢复

服务器数据恢复环境&故障:由于机房多次断电导致一台服务器中raid阵列信息丢失。该阵列中存放的是文档,上层安装的是Windowsserver操作系统,没有配置ups。因为服务器异常断电重启后,rai...

服务器数据恢复-V7000存储更换磁盘数据同步失败的数据恢复案例

服务器数据恢复环境:P740+AIX+Sybase+V7000存储,存储阵列柜上共12块SAS机械硬盘(其中一块为热备盘)。服务器故障:存储阵列柜中有磁盘出现故障,工作人员发现后更换磁盘,新更换的磁盘...

「服务器数据恢复」重装系统导致XFS文件系统分区丢失的数据恢复

服务器数据恢复环境:DellPowerVault系列磁盘柜;用RAID卡创建的一组RAID5;分配一个LUN。服务器故障:在Linux系统层面对LUN进行分区,划分sdc1和sdc2两个分区。将sd...

服务器数据恢复-ESXi虚拟机被误删的数据恢复案例

服务器数据恢复环境:一台服务器安装的ESXi虚拟化系统,该虚拟化系统连接了多个LUN,其中一个LUN上运行了数台虚拟机,虚拟机安装WindowsServer操作系统。服务器故障&分析:管理员因误操作...

「服务器数据恢复」Raid5阵列两块硬盘亮黄灯掉线的数据恢复案例

服务器数据恢复环境:HPStorageWorks某型号存储;虚拟化平台为vmwareexsi;10块磁盘组成raid5(有1块热备盘)。服务器故障:raid5阵列中两块硬盘指示灯变黄掉线,无法读取...

服务器数据恢复—基于oracle数据库的SAP数据恢复案例

服务器存储数据恢复环境:某品牌服务器存储中有一组由6块SAS硬盘组建的RAID5阵列,其中有1块硬盘作为热备盘使用。上层划分若干lun,存放Oracle数据库数据。服务器存储故障&分析:该RAID5阵...

「服务器虚拟化数据恢复」Xen Server环境下数据库数据恢复案例

服务器虚拟化数据恢复环境:Dell某型号服务器;数块STAT硬盘通过raid卡组建的RAID10;XenServer服务器虚拟化系统;故障虚拟机操作系统:WindowsServer,部署Web服务...

服务器数据恢复—RAID故障导致oracle无法启动的数据恢复案例

服务器数据恢复环境:某品牌服务器中有一组由4块SAS磁盘做的RAID5磁盘阵列。该服务器操作系统为windowsserver,运行了一个单节点Oracle,数据存储为文件系统,无归档。该oracle...

服务器数据恢复—服务器磁盘阵列常见故障表现&解决方案

RAID(磁盘阵列)是一种将多块物理硬盘整合成一个虚拟存储的技术,raid模块相当于一个存储管理的中间层,上层接收并执行操作系统及文件系统的数据读写指令,下层管理数据在各个物理硬盘上的存储及读写。相对...

「服务器数据恢复」IBM某型号服务器RAID5磁盘阵列数据恢复案例

服务器数据恢复环境:IBM某型号服务器;5块SAS硬盘组成RAID5磁盘阵列;存储划分为1个LUN和3个分区:第一个分区存放windowsserver系统,第二个分区存放SQLServer数据库,...

服务器数据恢复—Zfs文件系统下误删除文件如何恢复数据?

服务器故障:一台zfs文件系统服务器,管理员误操作删除服务器上的数据。服务器数据恢复过程:1、将故障服务器所有磁盘编号后取出,硬件工程师检测所有硬盘后没有发现有磁盘存在硬件故障。以只读方式将全部磁盘做...

服务器数据恢复—Linux+raid5服务器数据恢复案例

服务器数据恢复环境:某品牌linux操作系统服务器,服务器中有4块SAS接口硬盘组建一组raid5阵列。服务器中存放的数据有数据库、办公文档、代码文件等。服务器故障&检测:服务器在运行过程中突然瘫痪,...

服务器数据恢复—Sql Server数据库数据恢复案例

服务器数据恢复环境:一台安装windowsserver操作系统的服务器。一组由8块硬盘组建的RAID5,划分LUN供这台服务器使用。在windows服务器内装有SqlServer数据库。存储空间LU...

服务器数据恢复—阿里云ECS网站服务器数据恢复案例

云服务器数据恢复环境:阿里云ECS网站服务器,linux操作系统+mysql数据库。云服务器故障:在执行数据库版本更新测试时,在生产库误执行了本来应该在测试库执行的sql脚本,导致生产库部分表被tru...

取消回复欢迎 发表评论: