Roadmap
学习路线
6 个阶段、37 篇课文,约 25 小时。建议按顺序学习;有基础的同学可以直接跳到对应阶段。
你的进度
0 / 37 课已完成
Stage 00 · Prerequisites
启程
搞懂容器,搭好实验环境
Stage 01 · Beginner
入门
掌握核心对象
阶段目标:能用 YAML 声明式地部署一个无状态 Web 应用,并对外提供服务。
- 1.1kubectl 与声明式 APIAPI 对象的结构、kubectl 常用命令、explain / dry-run / diff 工作流。35 min
- 1.2Pod:最小调度单元Pod 的生命周期、多容器模式、Init 容器,以及怎样看日志、进容器。40 min
- 1.3标签、注解与命名空间用标签选择器组织资源,用命名空间做隔离与配额。25 min
- 1.4ReplicaSet 与 Deployment副本控制、滚动更新、回滚与发布策略。40 min
- 1.5Service 与服务发现ClusterIP、NodePort、LoadBalancer、Headless,以及集群 DNS。40 min
- 1.6ConfigMap 与 Secret把配置和敏感信息从镜像里解耦出来,环境变量与卷两种注入方式。30 min
Stage 02 · Intermediate
进阶
让应用可靠地跑起来
阶段目标:能为真实应用配置健康检查、资源、存储、调度和入口流量,并用 Helm / Kustomize 管理。
- 2.1健康检查与资源管理三种探针、requests/limits、QoS 等级、LimitRange 与 ResourceQuota。40 min
- 2.2存储:Volume、PV、PVC 与 StorageClass临时卷与持久卷、静态与动态供给、访问模式和回收策略。45 min
- 2.3StatefulSet 与有状态应用稳定的网络标识和存储,部署一个多副本数据库。35 min
- 2.4Job、CronJob 与 DaemonSet一次性任务、定时任务,以及每个节点一个的守护进程。30 min
- 2.5Ingress 与 Gateway API七层流量入口:Ingress 的用法与局限,新一代 Gateway API。40 min
- 2.6调度:亲和性、污点与拓扑分布nodeSelector、亲和/反亲和、污点与容忍、topologySpreadConstraints、优先级。40 min
- 2.7用 Helm 与 Kustomize 管理应用Chart、values、release;Kustomize 的 base/overlay;Helmwave 组合编排。40 min
Stage 03 · Advanced
原理
深入内部机制
阶段目标:理解控制平面、网络、安全和扩展机制是怎样工作的,能解释"为什么"。
- 3.1控制平面深入:一个 Pod 的诞生apiserver、etcd、scheduler、controller-manager、kubelet 如何协作。45 min
- 3.2网络模型与 CNIPod 网络三原则、CNI 插件、kube-proxy 的 iptables/IPVS 与 Cilium eBPF。50 min
- 3.3认证、授权与 RBACUser 与 ServiceAccount、Role/ClusterRole、最小权限实践。40 min
- 3.4工作负载安全加固securityContext、Pod Security Standards、NetworkPolicy 与按 FQDN 限制出口。45 min
- 3.5自动扩缩容metrics-server、HPA、VPA 与集群节点自动扩缩。35 min
- 3.6CRD 与 Operator 模式扩展 Kubernetes API,理解 Operator 如何把运维知识写成代码。40 min
Stage 04 · Production
生产
部署和运维真实集群
阶段目标:能规划、部署并长期运维一个高可用的生产集群,出了问题知道从哪里查。
- 4.1生产集群规划节点角色与命名规范、高可用拓扑、网络规划、etcd 磁盘验收。40 min
- 4.2用 Kubespray 部署高可用集群inventory 规划、关键变量、kube-vip、离线部署、扩容与重置。60 min
- 4.3生产网络:Cilium、MetalLB 与证书安装 Cilium 的坑、裸金属 LoadBalancer、cert-manager 自动签发证书。50 min
- 4.4生产存储:CSI 选型与 Rook-Cephlocal-path、NFS、Ceph、GPFS 等 CSI 选型,Rook-Ceph 部署与快照。55 min
- 4.5可观测性:指标、日志与事件VictoriaMetrics + Grafana、日志采集、事件持久化与告警。50 min
- 4.6镜像仓库与镜像分发Registry 与 Harbor 选型、P2P 分发(Spegel / Dragonfly)、镜像加速。35 min
- 4.7Day-2 运维:升级、扩容与 etcd 维护版本升级评估、节点增删、控制平面扩容、etcd 备份与碎片整理。50 min
- 4.8故障排查方法论从 Pod 到节点到集群的排查路径,kubectl debug 与常见故障案例。50 min
Stage 05 · Expert
专家
构建 AI 与平台级能力
阶段目标:能在 K8s 上建设 GPU/AI 平台和多租户平台,并持续跟进社区演进。
- 5.1GPU 调度与 GPU OperatorDevice Plugin、NFD、GPU Operator、驱动策略与 GPU 共享。50 min
- 5.2批调度:Kueue、Volcano 与 Gang 调度队列与配额、公平共享、PodGroup 全有或全无调度。45 min
- 5.3分布式训练与高性能网络Kubeflow Trainer、RDMA/RoCE、Network Operator、NCCL 带宽测试。55 min
- 5.4大模型推理服务vLLM / SGLang 部署、LeaderWorkerSet 跨节点推理、推理网关与 llm-d。55 min
- 5.5多租户与平台工程命名空间租户、vcluster 虚拟集群、托管控制平面与 GitOps。45 min
- 5.6认证考试与持续成长CKA / CKAD / CKS 备考、跟进社区与版本演进的方法。20 min