故障案例复盘:磁盘 100%、CPU 飙高与 SSH 连不上

故障处理的价值不在"修好",而在"下次更快修好、甚至不再发生"。这篇复盘三个高频故障的定位思路。 通用排查方法论 确认现象 → 看日志 → 提假设 → 验证 → 定位根因 → 修复 → 预防 别一上来就重启(重启会抹掉现场,根因没找到下次还会复发)。 案例一:磁盘 100% 现象 写入报 “No space left on device”,df -h 显示 100%。 定位 df -h # 确认哪个分区满了 sudo du -sh /* 2>/dev/null | sort -rh | head -20 # 根目录谁占最多 # 逐层下钻,直到找到元凶目录 sudo du -sh /var/log/* | sort -rh | head 三个经典原因 日志疯涨:/var/log 下某个日志没切割,无限增长 → logrotate 或清空。 大文件:备份、临时文件、上传文件堆积。 文件删了但没释放空间(最常见陷阱): sudo lsof +L1 | grep deleted # 找到"已删除但仍被进程占用"的文件 # 重启对应进程即可释放 磁盘满了,df 和 du 对不上,基本都是第 3 种情况。 ...

August 15, 2026 · 2 min · 248 words · Pilote Chen

网络排查:网站打不开?从 DNS 到端口一步步定位

“网站打不开"是运维最高频的工单。别乱猜,按下面这条链路从外到内一层层排除,基本都能定位。 DNS 解析 → 网络可达 → 安全组/防火墙 → 端口监听 → 服务进程 → 应用日志 第一步:DNS 解析对不对 dig www.example.com # 查 A 记录 dig @8.8.8.8 www.example.com # 指定公共 DNS 查 nslookup www.example.com 解析不到 / 解析到错误 IP → 去 DNS 控制台看记录(A / CNAME)是否配置正确、是否生效(TTL 有缓存)。 本机 /etc/hosts 会优先于 DNS,排查时先看它有没有写死: cat /etc/hosts cat /etc/resolv.conf # 本机用的 DNS 服务器 第二步:网络通不通、端口开没开 ping <IP> # ICMP 通不通(部分云默认禁 ping,不通不代表坏) nc -vz <IP> 80 # 测试 TCP 80 是否可达 telnet <IP> 80 # 老式但直观 nc -vz 超时 → 网络/安全组/防火墙挡了。 通了但没响应 → 端口没服务在监听,进入下一步。 第三步:安全组与防火墙 云服务器有两层防火墙,都要查: ...

August 15, 2026 · 1 min · 212 words · Pilote Chen