kubeadm 集群生命周期
kubeadm init 完成初始化后,集群的日常生命周期操作围绕节点和版本展开。
添加节点
升级集群
1
升级控制平面节点
先升级第一个控制平面节点。更新
kubeadm 包后执行 kubeadm upgrade plan 查看可升级版本,确认后用 kubeadm upgrade apply v1.30.x 应用。然后升级该节点的 kubelet 和 kubectl 并重启 kubelet。2
升级其余控制平面节点
逐个执行
kubeadm upgrade node,再升级 kubelet。一次只处理一个节点,保证控制平面始终有法定人数。3
升级工作节点
先
kubectl drain 驱逐负载,执行 kubeadm upgrade node,升级 kubelet 并重启,最后 kubectl uncordon 恢复调度。4
验证集群状态
用
kubectl get nodes 确认所有节点版本一致且状态为 Ready。证书管理与轮换
kubeadm 签发的集群证书默认有效期一年,到期前必须轮换。升级 kubeadm 集群时证书会自动轮换。不升级的年份里,要手动执行
renew 并记录进运维日历。etcd 备份与恢复
etcd 存着集群的全部状态,备份它就是备份整个集群。--data-dir 指向新目录,等待 kubelet 拉起即可。
节点日常维护
维护一台节点的标准流程:集群监控
- metrics-server:提供
kubectl top和 HPA 所需的基础指标,用官方清单一键部署。 - Prometheus + Grafana:生产标配。推荐用
kube-prometheus-stackHelm Chart 部署,一次获得节点、组件、应用三层监控和告警规则。
日志体系
Kubernetes 日志分三层:- 节点日志:
journalctl -u kubelet查看系统组件日志。 - 容器日志:
kubectl logs读取 stdout/stderr,文件落在节点的/var/log/containers。 - 集群事件:
kubectl get events记录调度与生命周期事件,默认只保留一小时。