问题背景
公司四楼办公区 9 月底完成无线网络扩容:新增 12 台 Wi-Fi 6 无线 AP,同一楼层还顺带部署了 8 路 IP 摄像头做安全监控,全部接入同一台 24 口 PoE+ 交换机。交换机是三年前采购的,标称 PoE 总功率 370W,当时只带 6 台老 AP,余量充足——采购扩容设备时没有人重新算过功率账。
设备割接完成后第一周风平浪静。第二周开始,无线控制器上每天出现两三次"多台 AP 同时离线再上线"的告警,每次 3~5 台、持续一分多钟自行恢复;同一交换机下的摄像头也在夜间偶发掉线重连。AP 位置分散在整层,不是集中某几个——这个"随机批量"的模式持续了五天,运维按"交换机固件 bug"申请了换机,换完照旧。
故障现象
- 无线控制器告警:AP 批量断开重连,时间点不固定,白天夜间都有,单次涉及 3~5 台,恢复后功能正常。
- AP 本地日志显示是断电重启而非软件重启——事件序列为"供电中断,设备冷启动",不是 CAPWAP 隧道掉线。
- 摄像头夜间红外模式开启时掉线频率明显升高,白天几乎不掉。
- 交换机自身运行正常,端口状态灯正常,
show interface无 CRC/错包,链路从未 down——供电问题不体现在链路层。 - 交换机电源模块无告警,风扇正常,机箱温度正常——不是过热保护。
排查过程
第一步看交换机的 PoE 状态。show power inline 的输出给出第一个关键信息:总功率 370W 的预算,当前实际输出 365W 左右,几乎贴着上限;12 台新 AP 的协商功率全部在 25.5W 一档(802.3at),而当初扩容预算是按 15.4W(802.3af)一台估的——差出来的 120W 正好被新 AP 吃掉。剩下 8 台老 AP 和摄像头把预算占满,只留了 5W 左右的余量。
第二步解释"为什么是随机批量重启"。PoE 交换机的功率分配是动态的:每台受电设备(PD)的实际取电会随工作状态波动,AP 在满负荷射频发射(多用户并发、mesh 回传)时瞬时功率比协商值再高几瓦。当多个 AP 恰好同时进入高负载、总需求超过 370W 时,交换机按优先级拒绝或切断部分端口的供电——被切掉的 AP 断电重启,重启期间其余 AP 的功率需求回落,于是几分钟后又能重新上电。哪个 AP"中奖"取决于当时的瞬时负载分布,这就是"随机批量"的成因。
第三步解释摄像头为何夜间高发。摄像头白天用红外关闭模式,整机功率约 8W;夜间红外补光灯开启,功率爬到 13W 以上。8 路 × 5W 的夜间增量,恰好是压垮本就贴顶的功率预算的最后一根稻草——所以掉线集中在夜间。
第四步核实施工环节的疏漏。查采购与实施记录:扩容方案里写了"AP 802.3at、单台 30W 供电",但功率预算表却按 15.4W/台 计算并标注"370W 充裕"——两处数字自相矛盾,实施时没人交叉核对;LLDP-MED 协商会向交换机请求更高功率档位,进一步抬高了实际占用,这一层在预算表里完全没有体现。
解决方案
- 短期:把 8 路摄像头迁到一台独立的老交换机(非 PoE+ 但摄像头功率低,af 足够),为 AP 释放约 110W 预算;当天完成后一周内零重启。
- 正式:按"802.3at 满档 30W + 20% 余量"重新核定该交换机的接入计划,上限 9 台 AP(当前 12 台超出),超出的 3 台 AP 迁到隔壁机柜的另一台交换机;为高密区域两台 AP 配置为"关键优先级"(交换机 PoE port priority),拥塞时优先保无线。
- 流程:扩容审批表增加一行强制项——“PoE 功率预算核算(按 PD 协商标准上限计,非最低值)",预算表必须体现 LLDP-MED 峰值;采购 PoE 交换机时按"当前需求 × 1.5"选容量。
- 监控:网管平台增加对该交换机
powerUsed / powerAvailable比值的采集,超 80% 告警——这次故障中,365/370 的比值在告警眼皮底下躺了五天,因为没人定义过这个指标。
根因分析
直接根因是扩容按 802.3af 低档估算功率,实际设备以 802.3at 高档协商,叠加 LLDP-MED 峰值请求后总需求逼近 370W 上限;任何瞬时波动都会触发交换机按优先级切断部分端口供电,被切断的 AP 断电重启,负载回落后又恢复,形成"随机批量重启"的循环。深层根因是变更流程缺陷:预算核算用了错误的单台功率基准,且功率余量没有纳入任何监控指标,隐患在告警体系里不可见。
预防措施
- 全网 PoE 交换机功率占用率盘点,超 80% 的列入整改清单;
- PoE 扩容审批强制附功率预算表,按 PD 协商上限+20% 余量计算,双人复核;
- PoE 端口为关键设备(AP/门禁)配置高供电优先级,普通终端低优先级;
- 功率占用率指标纳入网管采集,80% 告警、90% 严重。
总结
PoE 功率问题和机房 UPS 容量问题是同一类错误的两张面孔:按"铭牌最低值"而不是"实际协商上限"做容量规划。370W 听起来很大,但 12 台 at 级 AP 就是 360W 起步——数字不会骗人,被跳过的只是那一步乘法。这次还暴露了告警体系的盲区:数据一直在,指标没定义,等于没有。容量类资源(功率、IP 池、存储、license)的占用率,都应该成为一等公民的监控项。