什么值得买 07-29
护士接错一根网线,医院网络全科室卡死!三组命令5分钟定位环路故障
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者:

上周五下午三点,某医院 HIS 系统突然全科室卡死。信息科电话被打爆,院长直接问责。运维到现场一看,核心交换机所有端口灯同步狂闪,CPU 占用率直接顶到 98%。

你猜故障原因是什么?

一根新入职护士自己接的网线——两头插在同一台交换机上,形成了二层环路。

整个医院网络就这么瘫痪了,就因为一根网线。

这种事我见过不下二十次。每次都是同样的场景:全网卡死、灯狂闪、CPU 打满。工程师一头扎进去查路由、查光模块、查防火墙配置,忙活两小时发现是环路。

浪费时间不说,还被领导质疑能力。

环路排查其实有标准套路,记住三组命令,五分钟内定位问题。下面直接上干货。1

环路来了身体比脑子先知道

环路故障有三个典型症状,看见任何一个都得往环路上想:

端口灯狂闪,但不是正常的通信闪烁。正常的灯是一闪一闪有节奏的,环路状态是连续高频闪烁,像赛车双闪一样停不下来。

交换机 CPU 占用率莫名其妙飙高。正常业务流量不会把 CPU 打满,只有广播风暴才会——所有数据包都被上送 CPU 处理,几秒钟就能把 CPU 吞掉。

同一 VLAN 下所有设备集体卡顿。不是某台设备卡,是整个区域一起卡,跨 VLAN 反而没事。这种区域性卡顿是最明显的信号。2

还有个细节很多人忽略了:重启后网络正常,过一会儿又挂。环路被临时破除,但源头没找到,风暴又会卷土重来。

记住这个判断标准:多症状同时出现,再结合拓扑确认,基本就能实锤环路。3

三组命令锁定环路

环路排查不需要一堆花里胡哨的命令,记住三组就够了。

第一组:查 MAC 漂移——这是环路实锤证据。4

display mac-address flapping record

输出里同一 MAC 在两个端口之间来回跳,这叫 MAC 漂移。正常网络里一个 MAC 只会在一个端口学习到。漂移就是环路最直接的证据。5

第二组:查端口流量和错误帧。

环路端口的带宽利用率会直接跑满,而且会出现大量 CRC 错误帧。

display interface brief

看 InU/OutU(输入 / 输出带宽使用率)那两列。正常端口百分之十以下,环路端口直接顶到九十几。

display interface GigabitEthernet x/x/x

重点看 Broadcast、CRC 错包这两个字段。广播包数量远高于其他端口,基本就是环路没跑。6

第三组:查 STP 状态——看有没有端口被异常阻塞。

display stp brief

正常收敛的网络一定有阻塞端口(DISCARDING),那是 STP 在阻断冗余路径。没有阻塞端口 = 冗余路径没被阻断 = 环路在跑。

display stp interface GigabitEthernet x/x/x

看具体端口的 STP 角色和状态。出现 DISCARDING 状态的端口说明环路被 STP 拦截了,但也说明环路确实存在。7

还有一个辅助命令查 CPU 占用率:

display cpu-usage

华为设备正常不超过 15%,超过 70% 就得警惕。广播风暴会直接把 CPU 打满。4

定位流程:先证据后溯源

三组命令有了,具体怎么用?我总结了一套标准流程,照着走不会乱。

第一步:登核心交换机,查 MAC 漂移记录

先打 display mac-address flapping record,有漂移记录就能实锤环路。同时记录漂移端口,后面溯源用。8

第二步:查端口流量,锁定异常端口

display interface brief 扫一遍所有端口,找带宽使用率异常高的。如果能定位到具体端口,后面的排查范围就小多了。9

第三步:查 STP 状态,验证环路影响

display stp brief 看全局。如果有端口处于 DISCARDING,说明 STP 正在阻断环路。如果没有阻塞端口但环路症状明显——问题可能出在 STP 本身未启用或配置异常。10

第四步:逐级往下追,缩小范围

核心交换机异常端口下联的是汇聚层。登录汇聚交换机,重复同样命令。第一台正常第二台异常,问题就在第二台下面。继续往下追,直到定位到具体接入交换机。2

有个实战技巧:先留证据再动手。

环路故障处理压力大,很多人急着拔线恢复业务,结果环路的根因没找到,过两天又复发了。到时候复盘都复不了。

所以先用 dis logbuffer、display mac-address flapping record 把日志和漂移记录截图保存,再动手处理。

定位到了怎么快速破环

锁定环路位置之后,下一步就是快速破环,把业务先恢复。

最直接的办法:关闭可疑端口。

system-view

[ HUAWEI ] interface GigabitEthernet 0/0/24

[ HUAWEI-GigabitEthernet0/0/24 ] shutdown

端口关闭后观察网络状态,如果恢复了,说明环路就在这个端口下面。后续再物理排查这个端口的连线。11

如果怀疑是傻瓜交换机私接导致的环路,有个笨办法但很管用:

批量关闭可疑区域所有端口,逐个恢复:

[ HUAWEI ] interface range GigabitEthernet 0/0/1 to GigabitEthernet 0/0/24

[ HUAWEI-if-range ] shutdown

然后逐个 undo shutdown,每恢复一个端口观察 30 秒流量。插到哪根线网络又炸了,那根线就是问题线。7

环路破除后一定要做的一件事:溯源物理连线。

找到底是哪根线、哪个设备形成的环路。该拆的拆,该换位置的换位置。

我见过最离谱的案例:两根网线两端都插在同一台交换机上。还有一次是维护工人把同一根网线的两头都插在同一个配线架的两个端口上。

不找到物理根因,环路随时会卷土重来。12

环路排查的几个坑

环路排查避坑指南

症状没确认就动手查配置。MAC 漂移 + 端口流量异常 +CPU 飙升,三条同时满足才是环路实锤。单看任何一个都可能误判——比如广播包激增也可能是 ARP 攻击。4

STP 未启用却指望它防环。display stp brief 一看所有端口都是 FORWARDING,没有阻塞端口——说明 STP 根本没开,根本没在防环。这时候环路就是裸奔。赶紧 stp enable。10

VLAN1 环路最隐蔽。所有端口默认都在 VLAN1,有时候业务 VLAN 配置没问题,但 VLAN1 里悄悄形成了环路。这种故障表现为间歇性卡顿、重启临时恢复,很容易被当成其他问题排查。遇到 " 重启好一阵又挂 " 的怪现象,优先查 VLAN1 配置。13

环路检测功能没配在下行口。loopback-detect enable 只在接入层下行端口配置有意义,配置在上联口会误判。还有检测间隔别设太短,5 秒是默认值,频繁检测反而浪费 CPU。14

防环配置从源头止损

环路定位是救火,防环配置是防火。两者都重要,但防环配置做好能让你少出火警。

基础配置:全局开启 STP。

[ HUAWEI ] stp enable

生产环境建议用 MSTP,多实例支持,灵活控制。

进阶配置:接入层开启环路检测。

环路检测是 STP 的补充,能检测到 STP 失效时的物理环路。配置很简单,两步搞定:

[ HUAWEI ] loopback-detect enable 配置:全局开启

[ HUAWEI ] interface GigabitEthernet 0/0/1

[ HUAWEI-GigabitEthernet0/0/1 ] loopback-detect enable

[ HUAWEI-GigabitEthernet0/0/1 ] loopback-detect action shutdown 检测到环路直接关端口 15

端口安全:限制 MAC 学习数量。

有些环路是私接交换机导致的,可以在接入端口限制 MAC 学习数量,防止异常设备带太多 MAC 进来引发风暴:

[ HUAWEI ] interface GigabitEthernet 0/0/1

[ HUAWEI-GigabitEthernet0/0/1 ] port-security max-mac-num 5

一条命令减少 90% 的私接设备风险。1

最后一条建议:把防环配置写进日常巡检清单。

很多环路故障不是配置没做,而是交换机换了运维人员后配置被改回去了。每季度查一次 STP 全局状态、环路检测开关、端口安全配置,能避免很多不必要的半夜故障。

环路排查总结就三句话:

症状认清楚——灯狂闪 +CPU 高 + 区域卡顿同时出现。

命令用对组合—— MAC 漂移、端口流量、STP 状态,三组命令交叉验证。

根因必须找到——物理环路不破除,业务永远有复发风险。

记住这三板斧,下次遇到环路故障,五分钟内你能给领导一个明确答复。

本文来自什么值得买网站(www.smzdm.com)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

mac 瘫痪 一闪 工程师
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论