OPS
嘉兴中航信数据中心 · IT运维工程师成长方案
版本:2026-05-25 · 适用:应聘准备 + 入职前 6 个月

从会用工具,到能守住生产系统

这是一份按数据中心 IT 运维岗位设计的个人成长路线。目标不是泛泛学技术,而是在 6 个月内具备独立巡检、基础故障定位、规范变更、应急记录和小型自动化改进能力。

24周每周都有学习任务、实验产出和验收标准
260h按每周 10-12 小时估算,可压缩为 14-16 周冲刺版
5项Linux、网络、监控、虚拟化、安全自动化
target: junior-data-center-ops
目标能接告警、查日志、判影响、做升级、写复盘
主机Linux/Windows Server 日常管理与性能排查
网络DNS / TCP / VLAN / 防火墙 / 抓包基础定位
平台虚拟机、宿主机、资源池、快照、迁移、备份认知
监控Zabbix 或 Prometheus + Grafana 指标、告警、看板
安全账号、堡垒机、补丁、基线、审计、应急演练意识
改进巡检自动化、SOP、告警降噪、容量趋势分析

岗位问题地图

进入数据中心后,你面对的核心问题通常不是“不会某个命令”,而是在生产约束下快速、稳妥地判断问题边界。

系统复杂

服务器、操作系统、网络、安全设备、虚拟化、监控、备份、资产台账都可能关联同一个故障。

流程严格

数据中心环境强调审批、窗口期、回退方案、双人复核和操作审计,不能随手改生产。

值班压力

夜间告警、节假日保障、重大活动保障和应急演练都要求你按流程止血、定位、恢复、复盘。

每周时间模型

默认按每周 10-12 小时设计。你如果还有全职工作,就不要把计划做得太满,稳定执行比热血三天更重要。

周一至周四

每天 60-90 分钟

看官方文档/课程 40 分钟,命令或概念练习 30 分钟,记录 10 分钟。

周六

3-4 小时实验

搭环境、制造故障、排查恢复,把过程写成一页 SOP 或复盘。

周日

1 小时回顾

整理本周命令清单、故障案例、面试表达,更新个人知识库。

6个月总路线

阶段
用时
在哪学
学到什么
达到程度
1. 主机基础
第 1-4 周 · 42h
Red Hat 文档、Microsoft Learn、本地虚拟机
Linux/Windows Server、服务、日志、进程、磁盘、网络命令
能独立完成服务器巡检并写记录
2. 网络定位
第 5-8 周 · 44h
Cisco Skills for All、Wireshark 官方指南、实验拓扑
TCP/IP、DNS、VLAN、路由、防火墙、抓包
能判断主机、链路、DNS、策略、对端服务问题
3. 监控与日志
第 9-12 周 · 44h
Zabbix、Prometheus、Grafana 官方文档
指标、告警、看板、日志查询、告警分级
能搭一套小型监控并解释关键指标
4. 虚拟化与备份
第 13-16 周 · 44h
Broadcom VMware vSphere 文档、Hyper-V/VirtualBox 实验
宿主机、虚拟机、资源池、快照、迁移、备份恢复
能看懂虚拟化故障边界和资源争用
5. 安全与流程
第 17-20 周 · 42h
ITIL 4、等保/基线资料、公司流程模板
事件、问题、变更、权限、补丁、审计、应急预案
能写变更方案、回退方案和故障复盘
6. 自动化与改进
第 21-24 周 · 44h
Python 官方教程、Ansible 官方文档、个人实验环境
批量巡检、日志收集、配置核查、报表生成、SOP 知识库
能交付一个可运行的运维小工具

24周执行清单

每周都要有可见产出。只看视频不算完成,必须能在实验环境里复现、记录、解释。

W1
Linux 生存命令

学习文件、权限、进程、端口、磁盘、系统服务。来源:Red Hat/RHEL 管理文档 + 本地 Ubuntu/CentOS/RHEL-like 虚拟机。

用时

10h:文档 4h,命令练习 4h,笔记 2h。

验收

不用搜索能完成 CPU、内存、磁盘、端口、服务状态巡检。

W2
日志与服务定位

学习 systemctl、journalctl、/var/log、计划任务、NTP、SSH。

用时

11h:服务实验 5h,日志分析 4h,SOP 2h。

验收

写出《Linux 服务异常排查 SOP》:现象、检查命令、恢复、升级条件。

W3
Windows Server 基础

学习事件查看器、服务、任务计划、远程桌面、防火墙、性能监视器。来源:Microsoft Learn。

用时

10h:课程 4h,实验 4h,记录 2h。

验收

能找到系统错误日志、服务启动失败原因、端口监听状态。

W4
主机巡检项目

做一份 Linux + Windows 巡检模板,覆盖资源、服务、磁盘、端口、时间同步、补丁状态。

用时

11h:模板 3h,实验 5h,复盘 3h。

验收

输出一份巡检报告,能说明每个指标为什么重要。

W5
TCP/IP 与常见端口

学习 IP、子网、网关、ARP、TCP 三次握手、HTTP/HTTPS、SSH、DNS、NTP。

用时

11h:Cisco 课程 5h,命令实验 4h,端口表 2h。

验收

能解释 ping 通但业务不通、端口不通但主机在线的区别。

W6
DNS 与连通性排障

学习 nslookup/dig、tracert/traceroute、curl、telnet/nc、ss/netstat。

用时

10h:实验 6h,案例记录 4h。

验收

制造 DNS 错误、防火墙拦截、服务停掉三类故障,并能区分。

W7
抓包入门

学习 Wireshark/tcpdump,过滤表达式,TCP 重传、RST、DNS 查询、HTTP 状态码。

用时

12h:官方指南 4h,抓包 6h,截图标注 2h。

验收

能用一张抓包截图说明一次连接失败发生在哪一步。

W8
网络排障演练

画一张小拓扑:客户端、Web、数据库、DNS、防火墙规则,设计 5 个故障点。

用时

11h:拓扑 3h,演练 6h,复盘 2h。

验收

形成《网络连通性排障树》:从用户现象到定位命令。

W9
Zabbix 基础

学习主机、模板、监控项、触发器、动作、告警等级。

用时

11h:文档 4h,部署 5h,看板 2h。

验收

能监控一台 Linux 的 CPU、内存、磁盘、端口和服务。

W10
Prometheus + Grafana

学习 exporter、PromQL、仪表盘、告警思路。

用时

12h:部署 5h,指标查询 4h,看板 3h。

验收

做一张主机健康看板,能解释 5 个关键指标。

W11
日志与告警分级

学习日志采集思路、关键字告警、P1/P2/P3 分级、误报处理。

用时

10h:案例 4h,规则设计 4h,文档 2h。

验收

写出 10 条告警规则,并说明哪些需要立即叫醒人。

W12
监控项目交付

把 W9-W11 合成一个小型监控方案:指标、阈值、通知、看板、处置建议。

用时

11h:整理 5h,演示 3h,复盘 3h。

验收

能用 5 分钟讲清“告警来了我怎么判断影响范围”。

W13
虚拟化概念

学习宿主机、虚拟机、vCPU、内存、数据存储、虚拟交换机、资源池。

用时

10h:文档 5h,画图 2h,实验 3h。

验收

能解释虚拟机慢可能来自 CPU ready、内存争用、存储 I/O 或网络。

W14
快照、备份与恢复

学习快照不等于备份,备份策略、恢复验证、RPO/RTO。

用时

11h:实验 6h,恢复记录 3h,术语 2h。

验收

能完成一次虚拟机备份恢复演练,并写恢复步骤。

W15
资源与容量

学习 CPU、内存、磁盘 I/O、网络吞吐的趋势判断。

用时

11h:监控数据 5h,趋势图 3h,分析 3h。

验收

做一份容量分析:哪些资源接近瓶颈,何时需要扩容。

W16
虚拟化故障案例

模拟虚拟机磁盘满、CPU 飙高、网络不通、快照过多四类问题。

用时

12h:模拟 7h,记录 3h,讲解 2h。

验收

输出《虚拟化基础故障排查清单》。

W17
ITIL 与工单流程

学习事件、问题、变更、配置、发布的差别。

用时

10h:ITIL 资料 4h,案例分类 4h,模板 2h。

验收

能把一次故障拆成事件处理、问题根因、变更改进。

W18
变更与回退

学习变更风险评估、影响范围、操作步骤、验证方法、回退条件。

用时

11h:案例 4h,模板 3h,演练 4h。

验收

写一份“升级 Nginx 配置”的变更单和回退方案。

W19
安全基础

学习账号权限、堡垒机、最小权限、补丁、弱口令、端口暴露、日志审计。

用时

10h:基线学习 4h,检查脚本 4h,记录 2h。

验收

能列出一台服务器的 12 项安全基线检查项。

W20
故障复盘 RCA

学习时间线、影响范围、根因、恢复动作、改进项、责任人、截止时间。

用时

11h:模拟故障 5h,复盘 4h,口头汇报 2h。

验收

写出一份像样的故障复盘报告,而不是“已恢复”。

W21
Shell 自动化

学习变量、条件、循环、函数、退出码、日志输出。

用时

10h:脚本 6h,重构 2h,说明 2h。

验收

写一个巡检脚本,输出 CPU、内存、磁盘、端口、服务状态。

W22
Python 基础

学习文件读写、JSON/CSV、requests、argparse、异常处理。

用时

12h:官方教程 4h,脚本 6h,测试 2h。

验收

写一个日志关键字统计工具,输出 CSV 报表。

W23
Ansible 入门

学习 inventory、playbook、module、变量、幂等性。

用时

11h:文档 4h,批量任务 5h,记录 2h。

验收

用 Ansible 批量检查 2-3 台虚拟机的服务和配置。

W24
毕业项目

交付“数据中心入门运维工具包”:巡检脚本、监控看板、SOP、变更模板、复盘模板。

用时

12h:整合 7h,演示 3h,面试表达 2h。

验收

能用 10 分钟演示项目,并回答“这个工具如何减少故障风险”。

实验环境搭建

没有生产环境也能练。你要搭的是“可制造故障、可恢复、可记录”的小型数据中心模拟环境。

电脑配置建议

16GB 内存起步,32GB 更舒服;安装 VirtualBox、VMware Workstation Player 或 Hyper-V。准备 2 台 Linux、1 台 Windows Server 评估版、1 台监控服务器。

最小实验拓扑

client -> nginx-web -> database,同时加一台 DNS/监控机。每周故意制造 1-2 个故障:停服务、占满磁盘、改错 DNS、拦截端口、时间不同步。

学习到什么程度才算够

主机能在 10 分钟内判断一台服务器的资源、服务、端口、日志是否异常。
网络能用 ping、traceroute、curl、telnet/nc、tcpdump/Wireshark 说明故障边界。
监控能配置基础指标和告警,并区分“立即处理”和“观察趋势”。
流程能写变更单、回退方案、巡检报告、故障复盘,不只会口头描述。
自动化能用 Shell/Python/Ansible 减少重复检查,输出可读报告。

入职后让系统更好的 90 天路线

先读懂现场,不急着改

熟悉资产台账、拓扑图、监控项、告警分级、值班制度、变更流程、应急联系人。每天补一条知识库,不评价旧系统。

做低风险改进

补充巡检模板、规范故障记录、整理常见故障 SOP、标记重复告警。目标是让团队少查一次、少问一次、少漏一次。

交付一个可衡量优化

选择一个小主题:告警降噪、证书到期提醒、磁盘增长趋势、备份失败日报、批量端口检测。用数据说明改进效果。

推荐学习入口

优先看官方文档和官方课程,再用本地实验消化。公开视频可以辅助,但不要让它替代实验。

验证方式:每学一章必须做一次故障复现、一次恢复、一次书面记录。