1.
课程定位与学习目标
目标:让学员在真实
台湾机房环境或仿真环境中完成从故障发现到决策执行的全流程训练。小分段:定位(异地机房、业务连通);目标(缩短MTTR、提升判断能力);成果(可复用的Runbook与演练记录)。
2.
环境准备:硬件与网络清单
步骤1:列出清单(服务器型号、机架位、电源回路、交换机、光纤链路、ISP接入);步骤2:检验连通(在NOC或笔记本上执行 ping、traceroute、mtr);步骤3:记录控制通道(KVM/IPMI、远程串口)。小分段:命令示例(ping 10.0.0.1;traceroute -n 8.8.8.8)。
3.
基础巡检与基线建立
操作:登录主机(ssh user@host),执行基础命令收集基线数据:uname -a、df -h、free -m、top -b -n1、ip addr、ss -tunlp、journalctl -u 服务名 -n100。小分段:把输出存为 baseline_日期.tar.gz:tar czf baseline_$(date +%F).tar.gz /tmp/collect。
4.
监控与告警实操部署
步骤:安装Prometheus + node_exporter + Alertmanager + Grafana。node_exporter安装示例:wget https://.../node_exporter.tar.gz; tar xzf; sudo cp node_exporter /usr/local/bin; create systemd service;systemctl enable --now node_exporter。小分段:示例告警规则(CPU>90% 5m发送告警);Prometheus配置targets指向台湾机房出口IP。
5.
日志集中与故障追踪
步骤:部署ELK或Loki;配置filebeat/Fluentd采集应用日志并标记机房标签(region:tw)。小分段:排查示例:在 Kibana 中搜索 timeframe、host、error 关键字;用 tcpdump 抓包(tcpdump -i eth0 port 80 -w /tmp/trace.pcap)。
6.
演练场景一:网络中断与多链路切换
场景步骤:1) 模拟ISP A 链路 down(可在交换机上shutdown对应端口或模拟路由策略变更);2) 观察BGP/BFD切换(check bgp summary,或者 ip route);3) 执行回滚与验证(确认服务通过备用链路访问:curl -v http://vip/health)。小分段:验证命令(ip route show; vtysh -c "show ip bgp summary")。
7.
演练场景二:主数据库故障与故障切换
准备:主从复制状态检查(mysql> SHOW SLAVE STATUS\G;)。演练步骤:1) 将主DB降级为只读(SET GLOBAL read_only=ON);2) 选举新主(停止旧主 mysqld stop,on 从库执行 STOP SLAVE; CHANGE MASTER; START SLAVE; 或使用 MHA/Orchestrator 自动化);3) 切换应用写入的VIP或DNS(降低TTL后修改A记录或更新Keepalived配置)。小分段:数据一致性核对用 pt-table-checksum 或 mysqldump 比较。
8.
演练场景三:机房断电与灾备恢复
步骤:1) 模拟主机房断电(关闭PDU口测试冗余);2) 启动灾备中心(启动冷备镜像或托管机房实例);3) 数据回放与验证(使用 rsync/xdcp 或从缓存在备库恢复:mysqlbinlog + mysql);4) 回切流程记录。小分段:PDU 操作注意事项:先通知相关业务、按序断电并记录时间戳。
9.
Runbook与决策矩阵编写方法
步骤:为每类故障建立Runbook:触发条件、初步确认命令、责任人、临时缓解方案、切换步骤、回退步骤、事后复盘要点。小分段:示例条目:故障:HTTP 502;检查:nginx error.log、后端socket;缓解:先行重启后端 one-by-one;切换:启用备用后端。
10.
技能训练:态势感知与沟通演练
训练要点:1) NOC 汇总信息模板(时间、影响范围、影响业务、临时措施、预计恢复时间);2) 轮值演练,模拟客户沟通话术与工程师内部升级流程;3) 使用会议纪要模板记录决策。小分段:模板示例:{"IncidentID": "...", "Start": "...", "Impact": "...", "Actions": "..."}。
11.
合规与本地化注意事项(台湾机房特别提示)
要点:遵循当地电信与数据保护要求,确认链路协议合约,机房进出人员登记流程,备件本地化(网卡、电源模块)。小分段:准备好联络清单(机房值班、托管商、ISPs、本地工程师与应急电话)。
12.
演练后复盘与指标量化
步骤:复盘要包含Timeline(每一步时间戳)、根因分析(RCA)、改进措施、并将MTTR等指标纳入KPI。小分段:数据采集方法:从监控和日志中抽取时间点;生成复盘报告并更新Runbook。
13.
问:案例驱动式台湾机房课对初学者是否可行,如何快速上手?
答:可行。建议先完成环境准备和基线建立(第2-3段),跟随导师一步步执行基础命令并复现小型故障(如服务重启、磁盘填满模拟),同时练习读监控与日志,逐步参与完整演练。
14.
问:在实际切换DNS或VIP时有哪些风险与注意点?
答:风险包括DNS缓存导致的延迟生效、会话丢失、证书域名问题。注意点:提前降TTL、同步会话或使用会话保持、准备回退计划、在低峰窗口操作并通知相关方。
15.
问:如何把课堂学到的决策能力转化为长期团队能力?
答:把演练和Runbook标准化,定期复盘并把复盘结果写入知识库、操练交叉值班并量化MTTR改进,推动自动化工具(如Orchestrator、Ansible)减少人为失误,从而把个人决策能力转化为团队制度。
来源:案例驱动式台湾机房课让学员掌握真实场景下的运维决策能力