轻量应用服务器突然无响应是常见问题,可按以下步骤系统排查:
一、快速诊断网络连通性
-
本地ping测试
ping 服务器IP- 若超时:网络层问题
- 若延迟高但通:资源瓶颈可能
-
使用云控制台VNC登录
- 通过云厂商控制台的VNC/救援连接直接访问服务器
- 这是最关键的一步,可绕过网络问题
二、服务器资源检查(通过VNC)
-
查看系统负载
top uptime- 关注load average(超过CPU核心数2倍为高)
- 检查%CPU、%MEM使用率
-
检查内存与交换分区
free -h- 若swap使用率高,说明物理内存不足
-
检查磁盘空间
df -h- 重点查看
/根分区使用率(>90%需清理)# 查找大文件 du -sh /* 2>/dev/null | sort -rh | head -10
- 重点查看
-
检查磁盘I/O
iostat -x 1 5- 若
%util持续>90%,磁盘瓶颈
- 若
三、进程与服务排查
-
查看异常进程
ps aux --sort=-%cpu | head -10 ps aux --sort=-%mem | head -10 -
检查关键服务状态
systemctl list-units --type=service --state=failed systemctl status nginx/apache/mysql等关键服务 -
检查系统日志
journalctl -xe -n 50 tail -100 /var/log/messages dmesg | tail -50
四、网络服务排查
-
检查端口监听
ss -tlnp netstat -tunlp -
检查防火墙
iptables -L -n firewall-cmd --list-all
五、云平台侧检查
-
控制台查看
- 监控图表:CPU、内存、磁盘、带宽使用率
- 安全组/防火墙规则是否被修改
- 账户余额是否充足(欠费可能导致服务受限)
-
检查DDOS/CC攻击
- 查看云安全中心告警
- 检查入站流量是否异常激增
六、常见问题与应急处理
-
CPU跑满
# 找出占用CPU最高的进程 top -c -o %CPU # 或使用htop更直观 -
内存耗尽
# 清理缓存(临时缓解) sync && echo 3 > /proc/sys/vm/drop_caches -
磁盘满(特别是根分区)
# 快速清理 rm -f /var/log/*.log.* journalctl --vacuum-size=100M # 删除临时文件 rm -rf /tmp/* -
进程卡死
# 强制重启关键服务 systemctl restart nginx/mysql # 如无效,考虑重启服务器 reboot
七、预防措施
-
设置监控告警
- CPU使用率>80%
- 内存使用率>85%
- 磁盘使用率>90%
-
定期维护
- 设置日志轮转
- 定期清理缓存和临时文件
- 更新系统和应用补丁
-
资源优化
- 升级服务器配置
- 对数据库等应用进行调优
- 使用CDN减轻服务器压力
排查流程图
服务器无响应
↓
1. 云控制台VNC登录 ← 优先使用
↓
2. 检查资源使用(top, free, df)
↓
3. 根据结果定位:
├─ CPU/MEM过高 → 杀进程/重启服务
├─ 磁盘满 → 清理日志/临时文件
├─ 服务异常 → 检查日志并重启
└─ 网络问题 → 检查防火墙/安全组
↓
4. 如无法解决 → 通过控制台重启实例
↓
5. 事后分析日志,设置预防措施
如果以上步骤无法解决,建议联系云服务商技术支持,提供已排查的信息以提速处理。
CLOUD技术笔记