Module Document
基础架构 · K8S 平台产品文档
基础架构 · K8S 平台产品文档
版本: v0.3
日期: 2026-07-07
归属: 基础架构 / K8S 平台
1. 产品定位
K8S 平台模块是算力编排与可观测底座,覆盖 K8S 集群(ACK/EKS/K3s)、K8S
配套组件、Rancher 多集群控制面、服务器物理主机、Grafana
可观测栈和弹性伸缩。向下对接网络模块(VPC/LB/WAF)和物理服务器,向上为业务系统提供容器化运行平台。
与网络模块的边界:网络模块管 VPC/子网/LB/WAF/CDN/PrivateZone(L3-L7
网络与流量分发);本模块管 K8S 集群、Ingress、CoreDNS、Pod
网络、Rancher、物理主机、Grafana(编排与可观测)。
| 定位维度 |
v0.3 口径 |
| 建设阶段 |
试产期三套集群(ACK/EKS/K3s)+ Rancher 统一管控 + Grafana
可观测。 |
| 事实源原则 |
集群配置、命名空间、Ingress、弹性策略以 GitOps 为事实源。 |
| 180 天目标 |
跑通”Rancher 纳管三集群 + 配套组件标准化 + 物理主机纳管 + Grafana
可观测 + 弹性可扩缩”。 |
2. 五个子域(产品口径)
2.1 K8S 集群与配套
| 能力 |
说明 |
| 三套集群 |
阿里云 ACK(国内)、AWS EKS(海外)、内网 K3s。 |
| 标准配套 |
metrics-server、cert-manager、ArgoCD、Ingress-Nginx、CoreDNS、kube-prometheus。 |
| 命名规范 |
namespace、标签、配额、网络策略模板统一。 |
2.2 Rancher 多集群
| 能力 |
说明 |
| 统一控制面 |
Rancher 纳管 ACK/EKS/K3s,统一 RBAC、应用商店、监控。 |
| 配套分发 |
Rancher 应用商店统一安装标准配套组件。 |
| 集群备份 |
etcd 定期备份到 OSS/S3,可恢复。 |
2.3 服务器物理主机
| 能力 |
说明 |
| 物理机纳管 |
内网 K3s 节点、关键业务裸金属节点登记台账。 |
| 资源规格 |
CPU/内存/磁盘/网卡规格、位置、保修期。 |
| 运维边界 |
物理硬件归本模块纳管,OS 层与 K8S 节点协同。 |
2.4 Grafana 可观测
| 能力 |
说明 |
| 指标可视化 |
Prometheus + Grafana 覆盖集群/节点/Pod/业务指标。 |
| 日志 |
Grafana Loki + Promtail 聚合业务日志。 |
| 看板治理 |
标准看板模板 + 业务自定义看板。 |
2.5 弹性伸缩
| 能力 |
说明 |
| Pod 弹性 |
HPA(CPU/内存/自定义指标)、VPA(资源建议)。 |
| 节点弹性 |
Cluster Autoscaler,ACK ESS / EKS ASG。 |
| 成本护栏 |
命名空间配额 + 费用预算,超阈值告警。 |
3. 使用对象与核心诉求
| 使用对象 |
核心诉求 |
| 平台运维 |
Rancher 一控制台管所有集群 + Grafana 看全貌。 |
| 业务研发 |
按命名空间部署、配 HPA、看自己的看板。 |
| 财务 |
弹性策略与成本可观测,不失控。 |
| IT/资产 |
物理主机台账清晰,资源利用率可查。 |
4. 系统边界
| 负责 |
不负责 |
| K8S 集群生命周期、Rancher、配套组件、命名空间
RBAC、Ingress、CoreDNS、Pod 网络。 |
VPC/子网/LB/WAF/CDN/PrivateZone(归网络模块)。 |
| 物理主机硬件台账、OS 与节点运维。 |
物理服务器采购、IDC 机柜电力(归 IT/资产)。 |
| Grafana + Prometheus + Loki 可观测栈。 |
业务应用日志内容、业务指标定义。 |
| HPA/VPA/Cluster Autoscaler、成本护栏。 |
业务容量规划、业务 SLO。 |
5. 核心场景
- 新业务上线:Rancher 申请命名空间 → ArgoCD 部署 → 配 Ingress + HPA →
Grafana 看板。
- 弹性扩缩:HPA 监控负载扩 Pod,Cluster Autoscaler
扩节点,成本告警兜底。
- 故障排查:Grafana 看指标 → Loki 查日志 → Rancher 看集群状态。
- 物理主机运维:台账查规格 → OS 升级 → K8S 节点排水维护。
6. 权限与运营规则
- 生产只通过 Rancher + ArgoCD GitOps,禁止手工 kubectl 直连生产。
- 物理主机硬件变更需登记台账,OS 变更经审批。
- Grafana 看板按角色/命名空间分权限,敏感指标仅平台可见。
- 弹性策略必须有成本上限,Spot 仅无状态服务。
7. 验收指标
| 指标 |
验收口径 |
| Rancher 纳管 |
三套集群 100% 注册 Rancher,配套组件统一安装。 |
| GitOps 覆盖 |
生产配置变更 100% 经 ArgoCD,0 手工 apply。 |
| Grafana 覆盖 |
集群/节点/Pod 指标 100% 可视,核心业务有看板。 |
| 弹性在线 |
核心命名空间 100% 有 HPA,CA 在线。 |
| 物理主机台账 |
内网 K3s 与裸金属节点 100% 有规格/位置/保修。 |
8. 里程碑
| 阶段 |
交付物 |
| 0-30 天 |
ACK + Rancher HA + 配套组件 + Grafana 基础看板。 |
| 31-90 天 |
内网 K3s + 海外 EKS 接入 Rancher,HPA + CA 上线。 |
| 91-180 天 |
物理主机台账 + Loki 日志 + 成本护栏 + 多集群监控。 |
9. 风险点
| 风险 |
应对 |
| Rancher 单点 |
HA 部署 + etcd 备份,升级先测试后生产。 |
| 弹性雪崩 |
节点上限 + 成本预算双重兜底。 |
| 物理主机故障 |
内网 K3s 不承载生产,故障仅影响内网测试。 |
| Grafana 被滥用 |
看板权限按角色分,敏感指标限平台可见。 |