ISP 深夜"维护"完,海外办公室断网了:对方改了配置、换了 IP,却没留下一个字的说明
一早收到海外分部办公室同事的消息:办公室断网了。ISP 的说法是昨晚做了维护(maintenance),所以”现在网络需要重新配置,有新的 IP 地址”,并且让办公室去找”你们内部的 IT”。
这句话翻译一下就是:ISP 在夜间维护里改动了客户侧的接入配置——公网 IP 换了——但没有提前通知,也没有留下任何新配置的说明。
监控先给出了客观时间线
外部监控(UptimeRobot)早就把这次故障记录在案了:对分部公网地址的 ping 监控显示凌晨 03:37 开始无响应,到早上报告时已经持续超过 7 个小时。过去 24 小时的可用率掉到 68%,事件列表里躺着一条 Ongoing。
这份第三方时间线在后续跟 ISP 的沟通里很有用——“从几点断的”不再是各说各话,监控数据是中立证词。
远程支援的死结
这个办公室没有本地 IT,所有技术支援都靠远程。而这次的困境是个标准死结:
- 要远程进去改配置,前提是办公室里有一台能上网的电脑;
- 而办公室断的恰恰就是网。
理论上的解法是让现场同事开手机热点、给一台接着内网网线的台式机同时供上外网,远程进去看。但更现实的判断是:新的接入参数只有 ISP 自己知道(静态 IP、网关、DNS 都换了),客户侧无论谁来操作,没有参数就是巧妇难为无米之炊。这类改动本来就应该由 ISP 的技术员带着新参数上门配置。
于是把要求提回给 ISP:请派技术员到场。周五傍晚,ISP 的人带着自己的笔记本上门,直接连上调制解调器配置完毕,网络恢复。
但是——什么文档都没留下。 现场同事的原话是:“IT 的人带自己的笔记本连上 modem 设置,然后就好了,他们没有说别的。“
事后把配置抄回来
网络恢复了,但”配置只存在于 ISP 技术员的笔记本里”这个状态不能接受:下次再出问题(或者下次”维护”再改一轮),内部支援连现状基线都没有。
下周一远程跟进:现场同事配合,用 TeamViewer 远程进分部的一台电脑,登录办公室的 Linksys 路由器管理界面,把新的 WAN 配置完整记录下来——静态 IP(/30 小段)、默认网关、两个 DNS 服务器地址,全部截图归档。顺手验证了新公网 IP 上的远程管理入口从总部可以直接访问,以后遇到路由器层面的问题,不再依赖现场有人。
“修好了”不等于”结束了”——配置基线补录完,这个事件才算闭环
教训
- ISP 的”维护”完全可能改动客户侧配置(包括换公网 IP)且不通知——对静态 IP 用户这几乎等于直接断网。合同层面应当要求变更提前通知;技术层面,自己手里必须留有一份当前接入参数的存档;
- 给没有本地 IT 的远程办公室,一定要部署外部可用性监控——UptimeRobot 这类免费工具给出的故障起止时间,既是内部响应的触发器,也是和 ISP 对质时的中立证据;
- 远程支援的前置条件要提前演练——“断网时如何让我远程进来”(哪台机器、谁开热点、装什么远程工具)应该是写在分部支援手册里的固定章节,而不是出事时现场发明;
- 第三方修完,配置必须自己再抄一遍——上门技术员不欠你文档,“修好了”和”我知道现在是怎么配的”是两件事,后者才是下次故障时的起点。