来源书籍
SRE:Google运维解密
可观测性/监控类
类别清单覆盖
尚未完成类别清单核对。
全书概览
SRE:Google运维解密
类别:可观测性/监控类
评级结论:经典原理(高信息浓度 × 高稳定性)
信息浓度:高。全书以”为什么这样设计”为主线——错误预算为何能化解研发与运维的组织冲突、 SLI/SLO 的定义方法论、琐事(toil)的判定标准、监控系统只应产生告警/工单/日志三类输出的设计 依据、连锁故障的成因链条、无责事后总结的文化机制——这些都是底层设计决策的阐述,而非操作手册。
稳定性:高。核心概念(错误预算、SLO、toil、白盒监控、事故指挥体系、无责文化、连锁故障预防) 是与具体工具版本无关的系统设计原理,十年后依然成立,且已成为整个 SRE/DevOps 行业的通用语言。 仅第三部分”具体实践”中约 1⁄3 的章节(如 Borgmon、GSLB、Cron 系统、数据流水线的具体实现)绑定 了 Google 内部工具细节,稳定性和普适性较低,这部分标记为略读或仅摘取可迁移的设计原则。
四象限结论:经典原理(最高级别)——主体内容属于奠定 SRE 学科基础的原理性论述,少量工程实现 细节章节拉低了平均分但不改变整体定位。
章节进度追踪表
| 章节号 | 章节标题 | 精读/略读 | 状态 | 卡片数 |
|---|---|---|---|---|
| 01 | 第1章 介绍 | 精读 | done | 5 |
| 02 | 第2章 Google 生产环境:SRE视角 | 精读 | done | 3 |
| 03 | 第3章 拥抱风险 | 精读 | done | 4 |
| 04 | 第4章 服务质量目标 | 精读 | done | 5 |
| 05 | 第5章 减少琐事 | 精读 | done | 4 |
| 06 | 第6章 分布式系统的监控 | 精读 | done | 5 |
| 07 | 第7章 Google 的自动化系统的演进 | 精读 | done | 5 |
| 08 | 第8章 发布工程 | 精读 | done | 3 |
| 09 | 第9章 简单化 | 精读 | done | 4 |
| 10 | 第10章 基于时间序列数据进行有效报警 | 精读 | done | 3 |
| 11 | 第11章 on-call轮值 | 精读 | done | 4 |
| 12 | 第12章 有效的故障排查手段 | 精读 | done | 5 |
| 13 | 第13章 紧急事件响应 | 精读 | done | 4 |
| 14 | 第14章 紧急事故管理 | 精读 | done | 4 |
| 15 | 第15章 事后总结:从失败中学习 | 精读 | done | 4 |
| 16 | 第16章 跟踪故障 | 略读 | done | 2(按审查补生成:报警聚合为故障、用故障历史找系统问题) |
| 17 | 第17章 测试可靠性 | 精读 | done | 4 |
| 18 | 第18章 SRE部门中的软件工程实践 | 精读 | done | 3 |
| 19 | 第19章 前端服务器的负载均衡 | 略读 | done | 0 |
| 20 | 第20章 数据中心内部的负载均衡系统 | 略读 | done | 0 |
| 21 | 第21章 应对过载 | 精读 | done | 4 |
| 22 | 第22章 处理连锁故障 | 精读 | done | 5 |
| 23 | 第23章 管理关键状态:利用分布式共识来提高可靠性 | 精读 | done | 4 |
| 24 | 第24章 分布式周期性任务系统 | 略读 | done | 1(按审查补生成:故障切换下避免任务重复) |
| 25 | 第25章 数据处理流水线 | 略读 | done | 0 |
| 26 | 第26章 数据完整性:读写一致 | 精读 | done | 5 |
| 27 | 第27章 可靠地进行产品的大规模发布 | 精读 | done | 3 |
| 28 | 第28章 迅速培养SRE加入on-call | 略读 | done | 1(按审查补生成:on-call前的准备度路径) |
| 29 | 第29章 处理中断性任务 | 精读 | done | 4 |
| 30 | 第30章 通过嵌入SRE的方式帮助团队从运维过载中恢复 | 精读 | done | 4 |
| 31 | 第31章 SRE与其他团队的沟通与协作 | 精读 | done | 4 |
| 32 | 第32章 SRE参与模式的演进历程 | 略读 | done | 0 |
| 33 | 第33章 其他行业的实践经验 | 精读 | done | 5(审查后拆分故障后果不可逆性卡为2张) |
| 34 | 第34章 结语 | 略读 | done | 0 |
| 35 | 附录A 系统可用性 | 精读 | done | 1 |
| 36 | 附录B 生产环境运维过程中的最佳实践 | 精读 | done | 3 |
| 37 | 附录C 事故状态文档示范 | 略读 | done | 0 |
| 38 | 附录D 事后总结示范 | 略读 | done | 0 |
| 39 | 附录E 发布协调检查列表 | 略读 | done | 0 |
| 40 | 附录F 生产环境会议记录示范 | 略读 | done | 0 |
(封面/版权信息/赞誉/译者序/前言/序言/参考文献/索引为非正文内容,不计入本表)
章节与卡片
01 介绍
- Dev/Ops矛盾的组织根源 普通读书笔记卡
- SRE的人员构成与50%规则 普通读书笔记卡
- 错误预算的本质 普通读书笔记卡
- 监控只应产生三类输出 普通读书笔记卡
- 运维手册把MTTR降到三分之一 普通读书笔记卡
02 Google 生产环境:SRE视角
- N+2冗余容量规划逻辑 普通读书笔记卡
- 故障域隔离的调度原则 普通读书笔记卡
- 物理与逻辑服务器解耦的调度自由度 普通读书笔记卡
03 拥抱风险
- 可靠性投入的成本非线性递增 普通读书笔记卡
- 故障类型比故障数量更重要 普通读书笔记卡
- 用背景误差率校准可靠性目标 普通读书笔记卡
- 分层服务水平把成本选择权交给用户 普通读书笔记卡
04 服务质量目标
- SLI/SLO/SLA三层区分 普通读书笔记卡
- 用百分位而非平均值衡量延迟 普通读书笔记卡
- 过度可靠会制造危险的安全假象 普通读书笔记卡
- 从目标反推指标而非从指标凑目标 普通读书笔记卡
- 内外SLO之间留缓冲区 普通读书笔记卡
05 减少琐事
- 琐事的五个判定特征 普通读书笔记卡
- 轮值排班决定琐事占比下限 普通读书笔记卡
- 少量琐事无害,过量才是问题 普通读书笔记卡
- 轻易接手琐事会开创坏先例 普通读书笔记卡
06 分布式系统的监控
- 现象与原因的区分是监控信噪比核心 普通读书笔记卡
- 四个黄金指标 普通读书笔记卡
- 黑盒白盒监控的互补边界 普通读书笔记卡
- 好警报的四个必要条件 普通读书笔记卡
- 短期忍受降级换长期修复 普通读书笔记卡
07 Google 的自动化系统的演进
- 自动化五阶段演进模型 普通读书笔记卡
- 谁维护自动化决定自动化质量 普通读书笔记卡
- 空列表被当作"全部"的自动化事故 普通读书笔记卡
- 自动化会削弱人类的临场反应能力 普通读书笔记卡
- 自动化的隐藏价值是操作与执行者解耦 普通读书笔记卡
08 发布工程
- 密闭构建保证可重现性 普通读书笔记卡
- 高频发布反而降低单次发布风险 普通读书笔记卡
- 发布工程应在项目早期介入 普通读书笔记卡
09 简单化
- 必要复杂度与意外复杂度 普通读书笔记卡
- 死代码比活代码更危险 普通读书笔记卡
- 最小API是深刻理解问题的标志 普通读书笔记卡
- 小批量发布类比梯度下降 普通读书笔记卡
10 基于时间序列数据进行有效报警
- 计数器优于测量器的采集设计 普通读书笔记卡
- 黑盒探针弥补白盒监控的盲区 普通读书笔记卡
- 命运共享决定监控分组粒度 普通读书笔记卡
11 on-call轮值
- SLO反推on-call响应时限 普通读书笔记卡
- 压力下的"过度联想"与两种思维模式 普通读书笔记卡
- 运维压力过低同样是风险 普通读书笔记卡
- 事故与报警比例应接近1:1 普通读书笔记卡
12 有效的故障排查手段
- 假设-排除法的故障排查流程 普通读书笔记卡
- 先止血再溯源 普通读书笔记卡
- 相关不等于因果的排障陷阱 普通读书笔记卡
- 负面结果同样值得公布 普通读书笔记卡
- "什么/哪里/为什么"三问定位资源消耗 普通读书笔记卡
13 紧急事件响应
- 别慌且主动扩大求助范围 普通读书笔记卡
- 未经测试的回滚等于没有回滚 普通读书笔记卡
- 低风险变更评估可能漏掉稀有参数组合 普通读书笔记卡
- 主动想象极端场景来测试韧性 普通读书笔记卡
14 紧急事故管理
- 明确职责分离带来自主行动的自由 普通读书笔记卡
- 未协调的善意帮忙比不作为更危险 普通读书笔记卡
- 宣布进入应急状态的三条触发标准 普通读书笔记卡
- 应急能力靠日常小规模使用维持 普通读书笔记卡
15 事后总结:从失败中学习
- 对事不对人为何能改善系统而非人 普通读书笔记卡
- 事后总结的量化触发标准 普通读书笔记卡
- 未经评审的事后总结等于没写 普通读书笔记卡
- 公开表彰诚实报告事故的人强化文化 普通读书笔记卡
16 跟踪故障
- 报警聚合为故障 普通读书笔记卡
- 用故障历史找系统问题 普通读书笔记卡
17 测试可靠性
- 测试能拦截监控才能发现的问题 普通读书笔记卡
- 金丝雀测试的错误等级分类 普通读书笔记卡
- 高频小发布比年度大发布更可靠 普通读书笔记卡
- 危险工具的三层防护边界设计 普通读书笔记卡
18 SRE部门中的软件工程实践
- 基于意图而非具体数字做资源规划 普通读书笔记卡
- 用简化近似方案代替等待完美设计 普通读书笔记卡
- 可信度积累慢,流失快 普通读书笔记卡
21 应对过载
- QPS陷阱:用资源而非请求数衡量容量 普通读书笔记卡
- 自适应节流让客户端自主降速 普通读书笔记卡
- 请求重要性分级决定过载时舍弃谁 普通读书笔记卡
- 只在拒绝的那一层重试,避免重试风暴 普通读书笔记卡
22 处理连锁故障
- GC死亡螺旋:资源相互依赖的级联恶化 普通读书笔记卡
- 崩溃后降负载到远低于崩溃点才能恢复 普通读书笔记卡
- 多层重试的指数放大效应 普通读书笔记卡
- 截止时间传递避免处理已被放弃的请求 普通读书笔记卡
- 保持调用栈永远向下,避免分布式死锁 普通读书笔记卡
23 管理关键状态:利用分布式共识来提高可靠性
- 心跳超时无法正确实现领头人选举 普通读书笔记卡
- 最终一致把复杂度转嫁给了应用开发者 普通读书笔记卡
- 增加副本数反而可能降低可用性 普通读书笔记卡
- 领头人进程聚集埋下网络流量剧变风险 普通读书笔记卡
24 分布式周期性任务系统
- 故障切换下避免任务重复 普通读书笔记卡
26 数据完整性:读写一致
- 数据完整性的本质是可用性 普通读书笔记卡
- 备份与存档的区别在于能否被重新加载 普通读书笔记卡
- 分级软删除构筑三层防线 普通读书笔记卡
- 复制不是备份,同源故障会污染所有副本 普通读书笔记卡
- 海量数据校验靠"可信点"加分片,而非暴力遍历 普通读书笔记卡
27 可靠地进行产品的大规模发布
- 检查列表膨胀需要门槛管控 普通读书笔记卡
- 标准化基础设施把检查项折叠成一句话 普通读书笔记卡
- 高频发布才有机会打磨出好流程 普通读书笔记卡
28 迅速培养SRE加入on-call
- on-call前的准备度路径 普通读书笔记卡
29 处理中断性任务
- 上下文切换的隐藏成本需要"极化时间" 普通读书笔记卡
- 随机分配工单是对团队时间的不尊重 普通读书笔记卡
- 两种心流状态不应混在一起 普通读书笔记卡
- 尊重自己也尊重用户:把负担还给能承担的一方 普通读书笔记卡
30 通过嵌入SRE的方式帮助团队从运维过载中恢复
- "坏苹果理论"在复杂系统中站不住脚 普通读书笔记卡
- 用引导性问题代替指责性问题 普通读书笔记卡
- 解释决策背后的逻辑,而非只给结论 普通读书笔记卡
- 只派一个人介入,而非两个,以避免防御心理 普通读书笔记卡
31 SRE与其他团队的沟通与协作
- 生产会议靠固定节奏和共建文档维持效率 普通读书笔记卡
- 让较小团队主持跨团队会议平衡话语权 普通读书笔记卡
- 重复造轮子源于局部激励,而非能力不足 普通读书笔记卡
- 先定接口契约,再并行开发两端 普通读书笔记卡
33 其他行业的实践经验
- "差点出事"的事故同样值得深究 普通读书笔记卡
- 故障后果的不可逆性决定人工还是自动化 普通读书笔记卡
- 不可逆后果需要减速阀 普通读书笔记卡
- 风险控制权应独立于逐利部门 普通读书笔记卡
- 自动化速度会放大配置错误 普通读书笔记卡
- 警惕HiPPO现象,让数据说话而非职级 普通读书笔记卡
- 风险控制权应独立于逐利部门 普通读书笔记卡
- 警惕HiPPO现象,让数据说话而非职级 普通读书笔记卡
35 系统可用性
- 部分可用系统应该用比例而非时长衡量可用性 普通读书笔记卡
36 生产环境运维过程中的最佳实践
- 收到坏配置时应保持旧状态而非采用新数据 普通读书笔记卡
- 渐进式发布跨地理位置能更快暴露问题 普通读书笔记卡
- 成熟系统的错误预算周期应该拉长 普通读书笔记卡
相关主题
暂无公开主题。