上个月一个做跨境支付的朋友半夜给我打电话,说他的美国服务器被锤了,机房号称"T级防御",结果攻击流量才800G,业务就断了整整47分钟。47分钟啊兄弟,支付通道断47分钟你知道意味着什么吗?客户资金卡在里面出不来,投诉电话把客服打辞职了俩。
问题出在哪?他签合同的时候只看了一个数:"10T防御"。但没人告诉他,这个10T是机房总出口带宽,分到他那个单IP上,实际能用的清洗容量撑死50G。更要命的是,清洗响应时间(TTM)标的是"秒级",实际一测,22秒。22秒在DDoS防御里等于什么?等于你穿着雨衣站在瀑布底下——雨衣是穿了,但水早就灌进去了。
T级清洗到底在洗什么
说白了,DDoS清洗这事儿,管子粗不粗(带宽)只是基础条件。真正决定你挨打时能不能活下来的,是阀门关得快不快、阀门有几个、以及阀门的联动逻辑对不对。
快,才是命。不是带宽大就完事了。(别问我怎么知道的,问就是前东家的NOC值班表排得太离谱,凌晨3点攻击来了,on-call的哥们手机静音睡到5点。)
这里头有三个参数是命门级别的:
- TTM(Time to Mitigation),从攻击流量砸过来到清洗设备把它拦下来,中间隔了几秒。超过15秒,你的业务基本已经在ICU了。Cloudflare 2025年扛过一次31.4 Tbps的攻击,持续35秒[[16]],人家靠的就是Anycast架构把TTM压到个位数秒。
- Anycast接入点的地理分布密度。同一个高防IP,在全球有多少个POP点同时宣告路由?POP点越多,攻击流量被分摊得越薄,单点被打穿的概率越低。有些机房号称T级防御,结果Anycast就3个POP,其中一个还在维护——这不叫防御,这叫行为艺术。
- BGP Flowspec(RFC 5575)策略是不是真的配了、配对了。这玩意儿能让路由器在控制层面直接把恶意流量特征写进转发规则,不用等清洗设备慢慢分析。没配Flowspec的机房,遇到UDP反射放大攻击,清洗设备CPU先扛不住了。
还有一个冷门但救命的东西:RTBH(Remotely Triggered Black Hole)。当攻击流量实在太大、清洗设备也扛不住的时候,RTBH能直接把目标IP的流量全部丢进黑洞,保住机房里其他客户不被连带拖死。没有RTBH的机房,一个客户被锤,整栋楼跟着陪葬。
3家机房防御参数实打实对比
我拿市面上三种典型配置做了个表(品牌名隐了,免得有人说我恰饭)。数据是实测+问同行拿的,不是销售PPT上抄的:
| 参数 | A机房(Ashburn系) | B机房(洛杉矶系) | C机房(达拉斯系) |
|---|---|---|---|
| 标称总防御 | 10 Tbps | 5 Tbps | 2 Tbps |
| 单IP实际可用 | 200 Gbps | 80 Gbps | 50 Gbps |
| 实测TTM | 8秒 | 19秒 | 34秒 |
| Anycast POP数 | 28个 | 9个 | 4个 |
| BGP Flowspec | 已配置,自动下发 | 手动配置,需工单 | 不支持 |
| RTBH响应 | 自动,3秒内 | 半自动,需确认 | 无 |
| 月费(100G套餐) | $2,800左右 | $1,500左右 | $700左右 |
看出来了吧?C机房标称2T,单IP到手50G,TTM 34秒,Flowspec不支持。这配置,攻击者用一台租来的肉鸡集群就能把你锤到怀疑人生。Lumen在全球铺了170 Tbps的清洗容量[[15]],NETSCOUT的Arbor Cloud也拉到了33 Tbps[[10]],人家靠的就是POP密度和自动化策略下发,不是靠一个"T级"的数字唬人。
选机房最容易翻车的3个地方
说几个我见过的、真金白银砸出来的教训:
- 只看总带宽不看单IP分配。销售跟你说"我们机房10T防御",你一听觉得稳了。结果合同里写的是"共享防御池",你那个IP能调用的清洗资源上限就50G。打过来80G,多出来的30G直接穿透,你的源站IP裸奔。签合同前,必须让对方白纸黑字写清楚:单IP独占清洗容量是多少G。
- 不测TTM就上线。很多机房销售页面写"秒级响应",你信了。上线前不拿真实流量压测一下TTM,等攻击来了才发现,从告警到清洗设备介入,中间隔了20多秒。这20秒里你的业务已经在给用户返回502了。上线前,拿美国高防服务器的测试IP,用iperf3+UDP flood模拟打一轮,掐表算TTM。
- CC攻击和DDoS攻击搞混。T级清洗管的是volumetric攻击(UDP flood、SYN flood、DNS放大这些),如果你的对手打的是CC(应用层慢速请求、HTTP GET flood),T级带宽帮不了你,你得的是WAF+速率限制。花大几千刀租了T级高防,结果被CC打得满地找牙,这种冤大头我一年能见好几个。
直接ssh上去敲,别整那些花里胡哨的监控面板。攻击来的时候你根本没时间去翻Grafana,一条命令看连接数最实在:
# 看当前TCP连接状态分布,SYN_RECV堆积说明正在被SYN Flood
ss -s
# 实时看每秒新建连接数,超过5000/s基本可以确认在挨打
watch -n 1 "ss -t state syn-recv | wc -l"
# 抓前100个攻击源IP,按连接数排序
ss -ntu | awk '{print $5}' | cut -d: -f1 | sort | uniq -c | sort -rn | head -100什么情况下别碰T级高防?说句得罪同行的话:如果你的业务日UV不到1000,就是个企业官网或者小博客,Cloudflare免费版套在前面足够了,别花那个冤枉钱。另外,如果你的攻击全是CC层面的(慢速POST、HTTP header flood),T级清洗设备根本不看应用层payload,你租了也白租,老老实实上WAF。
作者简介:前Ashburn某Tier-1 carrier NOC shift lead,干了6年BGP路由和流量工程。后跳到一家DDoS mitigation startup做senior network engineer,4年里经手200+次T级攻击清洗实战。2025年回国,现在给中小出海企业做网络安全独立顾问,博客纯技术记录,不接软文。
攻击不挑时间,你的机房防御配置现在就得验。把上面那条ss命令在你的服务器上跑一遍,SYN_RECV超过2000就别睡了,赶紧联系机房确认清洗策略是不是真的生效。拖一晚上,明天早上你的客户就在社交媒体上骂你了。