Module Document

基础架构 · 备份 / 监控 / 审计技术选型

基础架构 · 备份 / 监控 / 审计技术选型

版本: v0.1
日期: 2026-07-06
归属: 基础架构 / 备份 / 监控 / 审计

1. 选型背景与约束

约束 说明
多云环境 阿里云(国内) + AWS(海外) + 内网自建,需统一汇聚。
运维能力 1-2 名云运维,优先开源+托管组合,减少自维护。
成本控制 试产期规模小,日志/指标量不大,避免过度采购。

2. 候选方案对比

指标监控

方案 优势 劣势 场景
Prometheus + Grafana(推荐) 开源标准、K8S 原生、Exporter 生态最广 长期存储需扩展 全部指标监控
Datadog SaaS 全托管、功能强 费用高(按 host 计费) 有预算时备选
阿里云 ARMS 与阿里云原生集成 不能覆盖 AWS 和内网 纯阿里云场景

跨区指标汇聚

方案 优势 劣势 场景
Thanos(推荐) 与 Prometheus 无缝、支持全局查询 部署复杂度中等 多集群汇聚
VictoriaMetrics 高性能、低资源占用 与 Prometheus 生态略有差异 单集群高吞吐备选
Grafana Mimir 云原生、水平扩展 新,社区还在成熟中 未来考虑

日志

方案 优势 劣势 场景
ElasticSearch + Filebeat(推荐) 检索能力强、审计日志首选 资源消耗较大 审计日志/安全检索
Grafana Loki + Promtail 轻量、与 Grafana 统一 检索能力弱 业务应用日志
阿里云 SLS 与阿里云原生集成、托管 不跨云 纯阿里云日志

备份存储

方案 优势 劣势 场景
阿里云 OSS(国内)+ AWS S3(海外)推荐 与各自云原生集成、低成本、高可靠 双云管理 全部备份数据
本地磁盘 访问快 无异地容灾 不推荐单独使用

告警通道

方案 优势 劣势 场景
AlertManager + 飞书 Webhook(推荐) 与 Prometheus 原生集成、飞书即时触达 需维护规则 P0/P1 告警
PagerDuty On-Call 管理成熟 费用高 规模扩大后备选

3. 推荐方案

层级 推荐
指标采集 Prometheus
指标汇聚 Thanos
指标展示 Grafana
应用日志 Grafana Loki + Promtail
审计日志 ElasticSearch + Filebeat
日志冷归档 阿里云 OSS(国内)/ AWS S3(海外)
备份存储 阿里云 OSS(国内)/ AWS S3(海外)
告警 AlertManager + 飞书 Webhook

4. 迁移 / 切换成本

场景 成本评估
Prometheus → Datadog 中:metrics 迁移,Dashboard 重建,2-3 周。
Loki → ES 统一 低:改 Promtail → Filebeat,配置调整,1 周。
AlertManager → PagerDuty 低:告警 Webhook 对接,规则迁移,1 周。

5. 决策记录

决策 结论 日期 决策人
指标监控 Prometheus + Grafana 2026-07-06 IT Owner
跨区汇聚 Thanos 2026-07-06 IT Owner
审计日志 ElasticSearch 2026-07-06 IT Owner
告警通道 AlertManager + 飞书 2026-07-06 IT Owner