某早高峰时段,大量员工同时反映AD域账号被锁定无法登录,排查发现是一台服务器上的服务账号密码过期后反复尝试认证导致的连锁锁定。
ES集群进入Red状态、搜索全不可用,根因是主分片所在节点宕机且副本未分配导致数据不可用。
集群规模扩张后新增 Pod 批量报 CNI 分配 IP 失败,根因是 Calico IPAM 池耗尽且自动扩容被配置上限卡死。
晚高峰 QPS 翻倍但 HPA 副本纹丝不动,kubectl get hpa 的 TARGETS 显示 unknown,根因是 metrics-server 指标链路中断。
跨机房 IPSec VPN 下 ping 通、SSH 正常,但文件传输和数据库同步一到大数据量就卡死,最终定位到 PMTUD 黑洞并用 MSS 钳制根治。
一个跑了几天的 Java 服务突然大量报 Too many open files,新连接被拒、健康检查失败,最终定位到 systemd nofile 太小叠加句柄泄漏,用 lsof/proc 定位并根治。
生产环境ESXi主机突发紫屏(PSOD),多台虚拟机强制下线,通过分析紫屏日志定位到是内存硬件故障,记录完整排查与恢复过程。
对外门户 Tomcat 疑似加密外联,顺藤摸到文件上传接口被绕过植入哥斯拉 Webshell 的溯源清剿全过程
服务器为压 TIME_WAIT 开启 tcp_tw_recycle,导致 NAT 后方部分用户 SYN 被 PAWS 静默丢弃、间歇连不上的排查复盘。
订单服务在流量高峰突然大面积超时,日志刷满 HikariPool Connection is not available,最终定位到长事务里嵌了慢外部调用把连接攥住不放,叠加连接池偏小拖垮全站。