线路不通、丢包、BGP抖动?这篇对工程师有实操价值的手册,直接给出可执行排查顺序与关键命令,帮助你在香港安畅CN2上把问题定位到口、到面。
在开始香港安畅CN2线路部署前,必须逐项核对BGP ASN、带宽口、VLAN、MTU与路由策略等关键信息,确保对接无缝且可回溯。
在实际项目落地中,我们经常看到因MTU或ASN错配导致的TCP分段与路由黑洞;因此先做清单:对端AS、对端网段、出口IP、NAT策略、BGP邻居口令。核对AS与对端网段优先于带宽开通。 安排好这些,会让后续的路测和流量切换少许多意外。下一步,进入链路连通与路由验证。
第一步用traceroute/mtr确认从内网到香港安畅出口的每一跳延迟与丢包,排查是否在本地机房或上行ISP出现问题,这是一条快速定位路径的必备流程。
常用命令:traceroute -n、mtr -r、ping -s、iptables-save查看SNAT/DNAT、查看BGP邻居状态(vtysh或bgpd日志)。不少同行反馈:路由策略误配比物理链路故障更常见。先查BGP邻居是否建立、AS号是否一致、是否有多条路由冲突。若发现出口路由被错误广告,立即回退BGP policy并观察一轮收敛情况。接下来需要做性能层面的压力测试与丢包细化分析。
用iperf3做双向吞吐测试并结合tcpdump抓取三次握手与MSS协商,能快速判断是链路带宽受限还是中间设备触发丢包。
在实际项目落地中,我们经常通过增大MTU或调小MSS解决长路径下的分片问题;同时对比iperf3的单流与多流结果,判断是否为并发连接数或CPU限制造成的抖动。若发现Server端TCP队列或软中断飙高,应同步查看内核网卡驱动和中断绑定策略。下一步是把视角转向安全事件与清洗策略。
遇到大流量攻击时,先判定攻击向量(UDP泛洪、SYN洪、HTTP慢速或CC),并马上与上游高防/流量清洗厂商沟通黑白名单及流量切换方案。
不少客户反馈:没有预设清洗计划比被攻击更要命。实操建议:预置BGP社区或API触发的清洗开关,设定高防IP池和回源链路;当清洗完成后,做回源流量的灰度恢复,观察是否有回归攻击或状态异常。处理完安全事件,应做一次完整的故障复盘。
故障复盘需形成三部分记录:事件时间线、根因分析、改进措施;这能将一次故障转化为团队的知识资产,减少未来重复出错的概率。
在复盘中用“反向排除法”列出被排除的可能性并记录验证命令,能让后续工程师快速判断;例如:已排除链路硬件、已排除BGP策略错误、剩余为接入侧或应用层问题。建议建立自动化报警:BGP邻居断开、丢包超阈、异常流量突增要触发工单并联动清洗。下面给出可落地的Checklist,便于立即执行。
下列清单可直接作为运维SOP:1)核对AS/BGP邻居与对端网段;2)MTU/MSS与iperf3双向压测;3)traceroute/mtr定位跳点;4)触发高防API并灰度回源;5)归档复盘并更新Runbook。
把这些步骤写入你的变更流程并做演练,能显著提升恢复速度与团队协作效率。完成Checklist后,建议在一次非高峰窗口做一次全链路故障演练以验证流程的有效性。
快速行动摘要:1. 先核对BGP与MTU;2. 用traceroute/mtr锁定跳点;3. 用iperf3确认吞吐;4. 如遇攻击,立即切换高防并灰度回源;5. 复盘并写入Runbook。