基础架构 · 备份 / 监控 /
审计概要设计文档
版本: v0.1
日期: 2026-07-06
归属: 基础架构 / 备份 / 监控 / 审计
1. 顶层设计
先让关键数据可恢复、关键链路可观测、关键操作可追责,再逐步提高自动化和平台化程度。
| 层级 |
设计 |
| 数据保护层 |
备份、快照、归档和恢复演练。 |
| 可观测层 |
指标、日志、trace、告警和看板。 |
| 审计证据层 |
关键操作追加写、不可篡改留存和查询报表。 |
2. 核心业务流
flowchart LR
N1["输出指标/日志/审计"] --> N2["标准化采集"]
N2["标准化采集"] --> N3["聚合分析"]
N3["聚合分析"] --> N4["分级通知"]
N4["分级通知"] --> N5["处理恢复"]
N5["处理恢复"] --> N6["记录结论"]
3. 业务概要设计
| 业务能力 |
概要设计 |
| 系统分级 |
按用户影响、生产影响、数据重要性定义 P0/P1/P2 系统和备份等级。 |
| 故障闭环 |
告警必须可确认、可转派、可恢复、可复盘,避免只发消息。 |
| 审计策略 |
围绕账号、权限、设备、订单、内容、发布、备份恢复定义高危操作清单。 |
4. 系统边界
| 负责 |
不负责 |
| 数据库备份、对象存储备份、监控指标、日志采集、链路追踪、告警策略、审计日志、恢复演练。 |
业务流程审批、详细 BI 分析、数据仓库建模、法律合规制度文本。 |
5. 系统顶层设计
| 组件 |
职责 |
| Backup Manager |
调度备份、校验、保留、恢复和演练记录。 |
| Observability Stack |
接收 metrics/logs/traces 并生成看板。 |
| Alert Router |
按系统等级和 owner 路由告警。 |
| Audit Ledger |
追加写保存关键操作证据和查询索引。 |
6. 系统流图
flowchart LR
N1["App/API/Device Cloud"] --> N2["Metric Collector"]
N1["App/API/Device Cloud"] --> N3["Log Collector"]
N1["App/API/Device Cloud"] --> N4["Audit Ledger"]
N5["Database/Object Storage"] --> N6["Backup Manager"]
N2["Metric Collector"] --> N7["Observability Stack"]
N3["Log Collector"] --> N7["Observability Stack"]
N7["Observability Stack"] --> N8["Alert Router"]
N8["Alert Router"] --> N9["Feishu Notification"]
N6["Backup Manager"] --> N10["Restore Drill Report"]
7. 模型设计
| 模型 |
关键字段 |
说明 |
| BackupPolicy |
system、frequency、retention、rpo、rto |
备份策略。 |
| AlertRule |
metric、threshold、severity、owner、route |
告警规则。 |
| AuditEvent |
actor、action、object、before、after、trace_id |
审计事件。 |
| IncidentRecord |
incident_id、severity、timeline、root_cause、actions |
故障复盘。 |
8. 验收点
| 验收点 |
标准 |
| 备份成功率 |
核心数据库每日备份成功率不低于 99%,失败 30 分钟内告警。 |
| 恢复演练 |
核心系统每季度至少完成一次恢复演练并记录 RTO/RPO。 |
| 告警闭环 |
P1 告警 15 分钟内确认,所有 P0/P1 有复盘记录。 |
| 审计覆盖 |
管理员高危操作 100% 记录前后值和操作者。 |
9. 人力评估
| 角色 |
估算 |
| SRE/运维 |
1 人 4 周 |
| 后端平台 |
1 人 2 周 |
| 安全 |
0.5 人 2 周 |
| 测试/演练 |
1 人 1 周 |
10. 风险点
| 风险 |
应对 |
| 备份不可恢复 |
备份成功不等于可恢复,必须做抽样恢复和季度演练。 |
| 告警过多无人看 |
v0.1 只配置少量高价值告警,逐步调阈值和路由。 |
| 审计日志被篡改 |
审计单独存储、追加写、权限隔离和定期导出。 |