首先通过端到端的可达性和延迟/丢包指标判断是否为链路问题。常用工具包括ping、traceroute/mtr,以及到台湾目标的多点测试。如果出现目标不可达、跳点在广州出口或台湾入网处突增延迟或持续丢包,则倾向于是广州CN2到台湾线路故障。
推荐命令:ping -c 20(观察丢包率/RTT抖动)、traceroute -n或Windows下的tracert(定位跃点)、mtr(连续测量)。同时查询BGP路径:show ip bgp或在线BGP Looking Glass。
若traceroute在CN2出口或跨境链路处出现高丢包/超时且本地网络正常,则问题很可能位于跨境链路或对端骨干;若多条不同出口均异常,则可能为上游骨干或对端网络问题。
记录发生时间、影响范围、涉及目标IP及抖动曲线,便于后续与ISP或对端沟通取证。
首要目标是快速恢复用户感知并收集故障证据。步骤:确认影响范围、切换备用链路、下发临时路由策略、通知上游ISP并开启抓包。优先保障关键业务链路。
1)切换备份路径:在路由器上临时调整BGP邻居优先级或通过静态路由回流;2)降低频繁的TCP重传通过调整引流策略;3)使用tcpdump或Wireshark进行边界抓包,时间戳同步为必需。
若有备用国际链路(例如非CN2的IPLC或其他ISP),优先启动旁路;若无法立即切换,启用流量限流或按业务优先级放行关键端口。
任何临时路由变更都要记录并设定自动回滚时间,防止配置遗忘引发二次事故。
通过调整BGP本地优先级(local-preference)、AS_PATH prepend或社区标记实现流量引导。若对端有多个出口,可与对端或上游ISP协商更优路径或临时黑洞/重路由。
1)提高备用链路的local-preference使其优先;2)对故障路径做AS_PATH prepend使其降低优先级;3)使用BGP社区向上游请求特定区域的优先级调整。
在边界路由器上先做小范围测试,再逐步放大;变更前务必保存配置快照并告知运维窗口。
为所有应急策略设置严格的回退时间并记录操作日志,确保故障消除后快速恢复原策略。
高质量证据能显著缩短定位时间。必须采集:完整的traceroute/mtr输出、连续ping结果(带时间戳)、边界路由表快照(BGP table)、tcpdump抓包(带time),以及设备系统日志和接口统计(ifconfig/ifstat/ethtool)。
抓包要包含SYN/ACK重传、ICMP超时和明显的丢包时段;记录抓包时的接口速率和错误计数。BGP邻居状态和更新消息也需导出。
按时间顺序整理证据并用可视化图表(延迟/丢包曲线)说明影响窗口,发给ISP并在ticket中指明影响业务和优先级。
若跨境为海缆或移动链路,询问ISP是否有维护公告或路由收敛事件,结合ASN级别的路由变更记录分析。
恢复后应进行事后复盘,包含故障原因、处置过程、花费时间和可改进点。建议建立自动化监控和告警(基于mtr/ping/flow),定期做跨境链路演练和BGP策略审核。
1)部署多运营商多链路(至少一条非CN2备份);2)完善BGP流量工程及社区策略;3)自动化故障切换脚本与Playbook。
建立SLA监控面板、设置阈值告警并定期模拟故障切换,确保演练中能在SLA范围内完成流量切换。
把排查步骤、命令清单、应急联系人写成工程手册,定期培训运维团队以缩短人为操作时间。