半夜两点被PagerDuty叫醒,一看监控,洛杉矶那台机器电信绕道欧洲,RTT飙到350ms。做中美跨境API,晚高峰这网络抖动真要命。别光看商家PPT上写的1Gbps带宽,美国三网直连独立服务器到底稳不稳,得看TCP重传率。这机器,晚高峰跑起来真叫一个憋屈,不抓包根本不知道底层发生了什么。
跨国路由黑洞怎么排查
遇到SSH敲命令卡死,先别急着骂机房。打开终端敲个mtr,看看是不是在洛杉矶的Any2West交换中心炸路由了。
- 很多时候是MTU黑洞导致的。国内运营商出海的包太大,中间节点不支持分片,直接给你Drop掉。
- 把MTU降到1400试试,或者抓个包看看TCP重传是不是超过了5%。超过这个数,你的数据库主从同步基本就断了。
- 别迷信普通的BGP多线,过太平洋海底光缆时,没接对交换中心,三大运营商互相限速能把你卡哭。
三大运营商实测数据对比
| 接入交换中心(IXP) | 晚高峰TCP重传率 | 路由跳数 | API平均延迟 |
|---|---|---|---|
| Any2West (洛杉矶) | 电信8% / 联通2% / 移动1% | 18跳 | 210ms |
| Equinix (圣何塞) | 电信3% / 联通4% / 移动2% | 16跳 | 185ms |
| CoreSite (硅谷) | 电信1% / 联通1% / 移动1% | 15跳 | 160ms |
这三类业务千万别买它
- 纯做北美本地流量的,买这玩意儿纯属浪费钱。三网直连的溢价全在回国线路上,你不出海,这钱花得冤枉。
- 只做静态资源分发的,老老实实用CDN。独立服务器扛不住大规模CC攻击,带宽打满了神仙也救不回来。
- 对延迟要求在50ms以内的量化交易,别做梦了。物理距离摆在那,光速也突破不了太平洋底的光缆限制。
# 强制开启BBR并调整TCP接收窗口
sysctl -w net.ipv4.tcp_congestion_control=bbr
sysctl -w net.ipv4.tcp_rmem='4096 87380 16777216'
sysctl -w net.core.rmem_max=16777216作者简介
老K,前某大厂北美CDN边缘节点运维,现居达拉斯。专治各类跨国路由黑洞,日常靠Wireshark抓包续命。
行动指令
晚高峰API响应超过300ms?别犹豫,直接拿测试IP跑个MTR。线路不行的赶紧换机房,别让网络抖动拖垮你的核心业务。