快速定位的第一步是分层判断。先从网络层入手,使用ping、traceroute或mtr确认延迟与丢包;若本地网段无异常,再检查路由与交换机。
执行 ping 目标与默认网关,若网关可达但外网不可达,排查上游链路或路由策略;用 ss 或 netstat 查看连接状态,确认是否为端口或防火墙问题。
若网络测试正常但应用异常,查看网卡状态、链路灯与交换设备日志;通过 ethtool、dmesg 和机器上电/风扇/温度告警排查网卡、内存或CPU故障迹象。
推荐命令:ping/traceroute/mtr/ss/netstat/ethtool/dmesg。若命令显示硬件错误(I/O error、link down),优先按硬件流程处理。
遇到这种情况,先确认是资源瓶颈(CPU、内存、磁盘IO)还是应用层问题(死锁、慢查询)。使用 top/iostat/vmstat 快速定位。
若发现磁盘IO高,可限制并发、暂停大批作业、调整oom策略;若是数据库锁或慢查询,定位并杀掉阻塞线程或临时重启服务以恢复可用性。
短时间内可启用只读模式、切换流量至从库或备用机,清理缓存(如 Redis),或增加临时的资源(扩容CPU/内存/IOPS)以缓解压力。
推荐:top/iostat/vmstat/ss/mysqladmin show processlist/EXPLAIN。记录慢查询并通过索引、拆分或缓存进行根本优化。
首先确认是主机故障还是网络链路与DNS问题。用控制台或管理面板登录主机,检查本机网络配置与路由表(ip addr/ip route)。
若本机能连通但外网不可达,查看默认网关、交换机端口与上游路由器;若全网不可达,检查ISP或BGP状态,同时检查DNS解析是否异常。
可以临时:重启网络服务、修改路由、放行防火墙规则或切换到备用链路/机房;若是DNS问题,切换到备用解析记录或调整TTL以加速生效。
常用:ip addr show/ip route show/systemctl restart network/iptables -L/nslookup/dig。确保先恢复基本连通再进行深度排查。
遇到RAID降级或SMART警告,第一时间不要对阵列做写操作。将服务切到只读或限流,避免进一步损伤数据。
用 smartctl 查看硬盘健康,使用 mdadm --detail 或硬件控制器工具确认哪个盘故障。优先做快照或增量备份,再进行更换。
按厂家建议热插拔更换故障盘,使用 mdadm --manage --add 启动重建;密切监控重建过程,避免在重建期间出现额外故障。
重建期间限制IO,备份重要数据副本,若重建失败考虑将故障盘离线并送检数据恢复公司处理。
数据或配置丢失时,最重要是迅速找到可用的备份与恢复点。优先执行经过验证的恢复流程,而非盲目修改生产环境。
常见策略包括:从全量备份还原、使用增量日志(如MySQL binlog)做点位恢复、从LVM/ZFS快照回滚或从异地备份同步。
在恢复前先做一次当前状态的快照(即便不完整),记录错误步骤,避免在恢复时覆盖其他可用数据;在非高峰期完成大规模恢复操作。
示例:mysqldump/innobackupex/xtrabackup/rsync/pg_restore。恢复后验证数据一致性并逐步切流回线上环境。