新装 12 台无线 AP 与 8 路摄像头接入同一台 PoE 交换机后,AP 每天不定时批量重启。根因是整机功率预算按 802.3af 估算而实际 AP 以 at 级协商,叠加 LLDP-MED 请求峰值功率,预算耗尽触发供电轮换。重新核定预算并分级供电后解决。
会议室视频终端投产后整层接入交换机 CPU 飙高、终端间歇掉线。根因是视频流走未知组播,交换机无 IGMP 侦听按广播泛洪,CPU 被组播复制打满。启用 snooping 与固定 querier 后恢复。
改完 ConfigMap 应用里还是旧配置,重启 Pod 才恢复。根因是开发用 subPath 挂载单个配置文件,该方式不触发 kubelet 原地更新,叠加业务进程不重读文件。改造挂载方式并加 Reloader 后解决。
自研业务埋点上线后 Prometheus 频繁 OOM 重启、TSDB 写放大拖满磁盘。根因是新指标携带用户 ID 等高基数标签,series 数失控。治理标签并设基数上限后恢复。
两节点 Hyper-V 群集实时迁移间歇失败并回滚,虚拟机短暂卡顿。根因是巡检脚本重建 vSwitch 后仅单侧节点同步 QoS 带宽策略,迁移校验失败。统一配置并加基线核对后恢复。
车间 12 台 Modbus 采集网关每隔几小时成批掉线重启,串口日志混乱、CRC 错误率异常。定位为变频器启停瞬间在 RS485 总线上耦合出干扰脉冲,叠加网关固件对串口错误的恢复缺陷,双重整改后稳定。
RDS 农场三台会话主机陆续给用户挂临时配置文件,登录后桌面重置、设置丢失。定位为 UPD 虚拟磁盘挂载失败与磁盘配额静默耗尽,调整 UVHD 模板与配额策略后恢复。
journald Storage=auto + SystemMaxUse 未生效,日志持续写入根分区导致 df 告警,排查发现配置被 override 覆盖。
内部工具在 200 并发定时任务下偶发 ConnectionError,排查发现 urllib3/requests 连接池配置不当 + Keep-Alive 超时策略激进共同导致。
ZN M2(IPQ6000)路由器编译 OpenWrt 时 NSS 硬件加速未生效,速度卡在 200Mbps。排查 firmware 缺失、kernel config 与 ECM 规则后打通 900Mbps+ 转发。