全部 AP 重新上电后局域网丢包:怀疑对象是那台默默老化的 PoE 交换机
工厂车间的无线网络这段时间不太稳定,先做了一个临时处理:换一台备用 PoE 交换机,接替原本表现异常的那台,给现场的接入点(AP)供电和联网。换完之后的一次全量重启,又带出一个新问题。
症状:全部 AP 重新上电,局域网开始丢包
给车间的接入点集中断电重新上电之后,本地局域网出现丢包——期间防火墷始终在线,没有异常,说明问题范围被限定在车间内部的局域网这一段,不涉及出口链路。
排查时列出的怀疑对象:
- PoE 交换机本身有问题(毕竟这台本来就是因为原交换机异常才临时顶上的替补);
- 网络出现环路(loop)——环路的前提是有两个网口被意外接到了同一个网段形成闭环,这个可能性在车间这种线路复杂、接线员流动的环境里并不低。
一个不算完美的结局:过一段时间自己好了
排查过程中记录下一个耐人寻味的现象:信号质量随着时间推移逐渐恢复,最后变得”excellent”。也就是说,问题在没有明确干预的情况下自愈了。
这不是一个好答案,而是一个警示。问题自愈不代表问题被解决——很可能是某个不稳定的物理连接(松动的网线接头、老化的 PoE 端口)自己”抖”回了正常状态,但同样的故障机制没有消失,只是暂时没有触发。
“自己好了”是警示信号,不是好消息
该做但没有条件立刻做的事
理想的排查路径是:抓包定位具体是环路还是硬件故障——用网络分析工具在丢包期间捕获流量,看是不是出现广播风暴(环路的典型特征),或者直接用备用端口逐一替换排除法定位哪个物理端口在闹鬼。这些动作需要停机窗口和额外的诊断设备,在车间实际运营压力下往往没法立刻做。
记录下来,作为下一次同样症状出现时的排查起点,是现实条件下能做的最好选择——这也是为什么这类”未完全解决”的故障记录同样值得写下来:下次同样的丢包再出现,直接从”检查这台交换机、检查有没有环路”开始,而不是从零排查。
教训
- 临时替换的设备本身也可能带着问题——用备用交换机顶上不代表故障排除,它自己也要被纳入怀疑名单;
- “过一会儿自己好了”永远不是排查的终点,只是提示你抓包/深入排查的时间窗口错过了,下次故障复发要提前准备好抓包环境;
- 制造业现场(粉尘、温湿度、频繁的物理接线变动)的网络硬件老化速度和故障率通常高于办公室环境,给这类现场的关键网络设备定期做健康检查,比等它报修更划算;
- 排查过程中的”未解决”记录本身有价值——下次同样症状出现,排查团队不用从零开始。