课程目录
共 33 章 · 约 11 小时 · 每章都包含可复制的命令与 YAML, 建议按顺序学习,边读边敲。
学习进度 0/33(0%)
01认识 Kubernetes
从容器到编排先搞清楚 Kubernetes 到底解决什么问题,再理解集群里有哪些角色,最后把本地实验环境跑起来。
02最小工作单元
Pod 与 DeploymentKubernetes 里一切从 Pod 开始。这一模块你会亲手创建 Pod、用 YAML 描述它,再用 Deployment 管理多个副本和滚动更新。
- 4第一个 Pod:kubectl 常用操作15 分钟创建你的第一个 Pod,把 get、describe、logs、exec、port-forward、delete 这几条最常用的 kubectl 命令一次练熟。
- 5用 YAML 描述 Pod:清单结构详解16 分钟从零写一个完整的 Pod 清单,掌握 YAML 缩进、四段骨架、labels、resources 与多容器 Pod 的写法。
- 6Deployment:副本、滚动更新与回滚18 分钟用 Deployment 管理多个 Pod 副本,搞清 selector 与标签的匹配规则,亲手完成一次滚动更新与回滚。
- 7Service 与集群内 DNS18 分钟用 Service 给一组 Pod 一个稳定的访问入口,掌握 ClusterIP、NodePort、LoadBalancer 的取舍与集群内 DNS 解析。
03让应用可访问、可配置
Service / Ingress / 配置 / 存储工作负载跑起来只是第一步。这一模块解决四个现实问题:怎么被别人访问、怎么注入配置、数据怎么持久化、怎么让集群知道应用是否健康。
- 8Ingress:从外部访问集群服务18 分钟装好 Ingress Controller,用一份 Ingress 清单按域名和路径把外部流量路由到 web 与 api 两个 Service。
- 9ConfigMap 与 Secret:把配置从镜像里拿出来16 分钟用 ConfigMap 存普通配置、Secret 存敏感信息,掌握环境变量与挂载文件两种消费方式,以及更新配置后 Pod 的真实行为。
- 10存储卷与 PV/PVC:让数据活过 Pod 重启18 分钟从容器临时文件系统讲到 PVC/PV/StorageClass 三层模型,动手给 redis 挂一块 1Gi 持久卷,并验证删掉 Pod 后数据还在。
- 11探针与资源管理:让集群理解你的应用18 分钟用 liveness、readiness、startup 三种探针告诉集群「我的应用现在能不能接流量」,再用 requests/limits 让调度器和内核都知道该给它多少资源。
04走向生产
隔离、批处理、调度与排障把集群当成多人共用的平台来对待:命名空间与 RBAC 做隔离,Job/CronJob 跑批处理,调度规则决定 Pod 落在哪台机器上,排障手册帮你定位问题。
- 12命名空间与 RBAC:多人共用一个集群18 分钟用一个集群服务多个团队:用 Namespace 做逻辑隔离,用 ServiceAccount 给 Pod 一个身份,用 RBAC 精确控制谁能对什么资源做什么。
- 13Job 与 CronJob:批处理与定时任务14 分钟跑一次就结束的任务该用什么资源?这一章讲清 Job 的完成与重试语义,以及 CronJob 的时间表、并发策略和清理方式。
- 14调度入门:把 Pod 放到合适的节点上16 分钟从调度器的过滤与打分讲起,用 nodeSelector、亲和性、污点容忍与 cordon/drain,把 Pod 放到(或赶下)你指定的节点。
- 15排障手册:出问题先看哪里20 分钟一套固定的排查顺序、一张状态速查表和三个完整案例,让你不再靠猜命令,五分钟定位 Pod 起不来或 Service 连不上的根因。
05综合实战
Helm 与完整应用用 Helm 把一堆 YAML 变成一个可复用的 chart,然后独立部署一个完整的三层应用:前端、后端 API、数据库、Ingress 与监控。
06进阶:生产实践
对齐 k8s-in-action入门主线解决「会用了」,这一模块解决「敢在生产上管」:集群怎么部署与规划、网络插件怎么选、存储怎么落地、可观测怎么搭、安全怎么加固、交付怎么自动化。
- 18生产集群部署:从节点规划到 kubespray25 分钟把集群从本地几个容器搬到真实机房:规划节点与磁盘、用 fio 验证 etcd 磁盘、用 kubespray 完成高可用部署,并学会后续的扩缩容与升级。
- 19集群网络:CNI 选型与 NetworkPolicy22 分钟搞清 Pod、Service、节点三层网络的分工,比较主流 CNI 的取舍,并亲手写出默认拒绝与最小放行的 NetworkPolicy。
- 20生产存储:CSI、Rook/Ceph 与本地盘方案22 分钟从 PVC 往下一层看:CSI 怎么把存储接进集群,本地盘、块存储、文件存储怎么选,以及扩容、快照、性能验证与数据安全怎么做。
- 21可观测性:指标、日志与告警22 分钟把「出事了才登机器看」变成「提前发现、快速定位」:搭起指标、日志与告警三条链路,并知道哪些告警必须配。
- 22安全加固:从最小权限到镜像供应链22 分钟把「跑起来了」变成「跑得安全」:用 Pod Security Admission 和 securityContext 收紧工作负载,用证书与镜像供应链守住入口。
- 23GitOps:用 Git 管理集群状态20 分钟把「谁在什么时候改了集群」变成一条可审计的 Git 提交:用 ArgoCD 拉取式交付,让集群状态自动向仓库收敛。
- 24备份与恢复:把「删错了」变成小事18 分钟分清集群状态、资源清单、卷数据与镜像四层备份,用 etcd 快照、Velero 和 VolumeSnapshot 做一次真的能恢复的备份。
- 25镜像仓库与加速:让拉取又快又稳20 分钟用 Harbor 把镜像拉取收进内网,用 imagePullSecret 打通鉴权,再用 P2P 与节点缓存把「扩容时全员等镜像」变成几秒钟的事。
- 26服务网格:Istio 流量治理与 mTLS22 分钟用 Istio 把灰度、超时重试、熔断与服务间加密从应用代码搬到代理层,并想清楚这套东西什么时候不该上。
07平台化与规模化
多集群 · 虚拟化 · DBaaS当集群从一套变成多套、从只跑容器变成同时提供存储、虚拟机、数据库和 GPU 时,工作重心就转向了「把能力做成平台」。这一模块讲多集群管理、节点与内核调优、文件与对象存储、虚拟机与多租户控制面、数据库 Operator,以及 AI 平台的批调度与模型服务。
- 27多集群与访问管理:kubeconfig、上下文与服务账号20 分钟集群从一套变成多套之后,最危险的不再是「不会用 kubectl」,而是「连错集群、发错凭证」——这一章讲清 kubeconfig 的结构与合并规则、上下文的正确用法,以及怎么给同事和 CI 发一份最小权限的凭证。
- 28节点与内核调优:让 Pod 跑得更稳20 分钟容器共享同一个内核,节点上的 sysctl、DNS 缓存、硬件特性标签与 kubelet 预留参数,决定了 Pod 到底跑得稳不稳。
- 29文件与对象存储:NFS、CephFS、JuiceFS 与对象网关20 分钟把共享文件与对象存储接进集群:NFS CSI 与 CephFS 的 RWX 落地、JuiceFS 在对象存储上做 POSIX 文件系统,以及对象网关该怎么部署。
- 30计算与虚拟化:KubeVirt、Kamaji 与 vcluster22 分钟当集群不只要跑容器,还要跑虚拟机、要给每个租户一套独立控制面时,KubeVirt、Kamaji、vcluster(以及 k3k 与 Soperator)分别在 Kubernetes 里再叠一层,这一章讲清它们各自解决什么、代价是什么。
- 31数据库 Operator:把有状态中间件做成平台能力22 分钟有状态中间件的难点不在「跑起来」而在「一直跑对」,这一章讲 Operator 怎么把人的运维手册变成控制器,并用 KubeBlocks、Redis、TiKV、FoundationDB 对齐生产视角。
- 32GPU 与 AI 工作负载:调度、共享与推理平台22 分钟把 GPU 变成集群里可调度、可共享、可观测的资源:扩展资源模型、Device Plugin、MIG 与时间片共享,以及训练任务与推理服务的工程细节。
- 33AI 平台:批调度、分布式训练与模型服务24 分钟当 GPU 从几张变成一群:用 Kueue/Volcano 把整卡资源排成队列,用 MPI/NCCL/Ray/LWS 跑起分布式训练,用 KServe 与推理网关把模型变成稳定服务。