本文目录先限定故障范围物理层二层与三层性能与恢复链路不通不等于模块损坏协议状态如何看恢复后仍要复盘
01

先限定故障范围

记录时间、影响业务、设备告警及最近变更。对比正常链路,区分单端口、单设备与跨网络故障。

02

物理层

核对供电、接口状态、模块识别、线缆和端面,读取设备支持的光功率与错误计数。先确认模块与设备适配,再判断链路问题。

03

二层与三层

二层检查 VLAN、Trunk、MAC 学习、生成树与 LACP;三层检查地址、路由、邻居和访问控制。不要在原因未明时同时改动多项配置。

04

性能与恢复

检查丢包、拥塞、CPU、内存及广播异常。保留诊断输出和变更记录,恢复后验证实际业务并补充预防措施。

05

链路不通不等于模块损坏

先检查端口是否被管理性关闭、目标速率和模块识别,再检查端面、光纤极性及接收光功率。持续观察 CRC、丢包和链路抖动计数,必要时用已知正常的同规格链路交叉验证。诊断值需与具体模块阈值比较。

06

协议状态如何看

生成树阻塞端口可能是在正常消除环路,不应直接关闭保护机制。LACP 先核对每个成员和协商模式;OSPF 的 2-WAY 在特定网络关系中可以是正常状态。BGP 则先查邻居可达性与会话,再查路由发布和策略。

07

恢复后仍要复盘

业务恢复后继续观察一段代表性负载,确认错误计数没有持续增长。保留故障时间线、诊断输出、唯一改动项和回退结果,并同步更新配置与拓扑。重启能暂时恢复并不代表根因已经消除。

资料来源