Module Document

基础架构 · 备份 / 监控 / 审计概要设计文档

基础架构 · 备份 / 监控 / 审计概要设计文档

版本: v0.1
日期: 2026-07-06
归属: 基础架构 / 备份 / 监控 / 审计

1. 顶层设计

先让关键数据可恢复、关键链路可观测、关键操作可追责,再逐步提高自动化和平台化程度。

层级 设计
数据保护层 备份、快照、归档和恢复演练。
可观测层 指标、日志、trace、告警和看板。
审计证据层 关键操作追加写、不可篡改留存和查询报表。

2. 核心业务流

flowchart LR
  N1["输出指标/日志/审计"] --> N2["标准化采集"]
  N2["标准化采集"] --> N3["聚合分析"]
  N3["聚合分析"] --> N4["分级通知"]
  N4["分级通知"] --> N5["处理恢复"]
  N5["处理恢复"] --> N6["记录结论"]

3. 业务概要设计

业务能力 概要设计
系统分级 按用户影响、生产影响、数据重要性定义 P0/P1/P2 系统和备份等级。
故障闭环 告警必须可确认、可转派、可恢复、可复盘,避免只发消息。
审计策略 围绕账号、权限、设备、订单、内容、发布、备份恢复定义高危操作清单。

4. 系统边界

负责 不负责
数据库备份、对象存储备份、监控指标、日志采集、链路追踪、告警策略、审计日志、恢复演练。 业务流程审批、详细 BI 分析、数据仓库建模、法律合规制度文本。

5. 系统顶层设计

组件 职责
Backup Manager 调度备份、校验、保留、恢复和演练记录。
Observability Stack 接收 metrics/logs/traces 并生成看板。
Alert Router 按系统等级和 owner 路由告警。
Audit Ledger 追加写保存关键操作证据和查询索引。

6. 系统流图

flowchart LR
  N1["App/API/Device Cloud"] --> N2["Metric Collector"]
  N1["App/API/Device Cloud"] --> N3["Log Collector"]
  N1["App/API/Device Cloud"] --> N4["Audit Ledger"]
  N5["Database/Object Storage"] --> N6["Backup Manager"]
  N2["Metric Collector"] --> N7["Observability Stack"]
  N3["Log Collector"] --> N7["Observability Stack"]
  N7["Observability Stack"] --> N8["Alert Router"]
  N8["Alert Router"] --> N9["Feishu Notification"]
  N6["Backup Manager"] --> N10["Restore Drill Report"]

7. 模型设计

模型 关键字段 说明
BackupPolicy systemfrequencyretentionrporto 备份策略。
AlertRule metricthresholdseverityownerroute 告警规则。
AuditEvent actoractionobjectbeforeaftertrace_id 审计事件。
IncidentRecord incident_idseveritytimelineroot_causeactions 故障复盘。

8. 验收点

验收点 标准
备份成功率 核心数据库每日备份成功率不低于 99%,失败 30 分钟内告警。
恢复演练 核心系统每季度至少完成一次恢复演练并记录 RTO/RPO。
告警闭环 P1 告警 15 分钟内确认,所有 P0/P1 有复盘记录。
审计覆盖 管理员高危操作 100% 记录前后值和操作者。

9. 人力评估

角色 估算
SRE/运维 1 人 4 周
后端平台 1 人 2 周
安全 0.5 人 2 周
测试/演练 1 人 1 周

10. 风险点

风险 应对
备份不可恢复 备份成功不等于可恢复,必须做抽样恢复和季度演练。
告警过多无人看 v0.1 只配置少量高价值告警,逐步调阈值和路由。
审计日志被篡改 审计单独存储、追加写、权限隔离和定期导出。