来源书籍

数据科学工程实践 用户行为分析与建模、AB实验、SQLFlow

统计建模与因果推断类

全书12章均包含概念/术语/原理类内容的实质性讲解(离散选择模型、生存分析、 LTV、可解释模型体系、矩阵分解、因果推断方法、A/B实验原理、实验设计方差控制、特殊场景 实验方法、SQLFlow工作原理、模型可解释性、深度学习聚类原理),按"概念类内容强制生卡" 规则全部标记精读。第10章虽含Docker环境配置等操作步骤,但10.1节"SQLFlow工作原理"有 实质性原理讲解,故整章仍标精读(操作步骤部分精读时不生卡)。

类别清单覆盖

8/8

已覆盖 8 补充生成 0 未覆盖 0

全书概览

数据科学工程实践 用户行为分析与建模、A/B实验、SQLFlow

  • Skill 版本:v1
  • 类别:统计建模与因果推断类

阶段一:整体评级

结论:经典原理(高信息浓度 × 高稳定性)

理由:

  • 信息浓度高:全书围绕”为什么用这个方法、这个方法背后的原理是什么”展开,而非单纯的 操作手册。例如第1章从理性人选择理论、效用理论、揭示性偏好理论层层递进推导出离散选择模型 (DCM)的数学结构;第7章从相关性谬误讲到潜在结果框架(Potential Outcome Framework), 再引出A/B实验作为科学因果推断方法的理论根基;第2章解释了为什么在存在删失数据的场景下 一般回归模型失效、必须选择生存分析。这些内容都是在讲底层设计决策,而非”点击这个按钮”式 的步骤说明。
  • 稳定性高(主体部分):第一部分(观测数据分析,第1~6章)和第二部分(实验设计, 第7~9章)讲的是统计学、计量经济学、实验设计的经典理论(DCM、生存分析、因果推断、 A/B实验、随机区组设计、Switchback实验等),这些原理不依赖特定工具版本,多年后依然适用。
  • 例外(需注意的低稳定性部分):第三部分(第10~12章)介绍开源工具SQLFlow,其中 Docker环境配置、CLI交互步骤等内容与工具版本绑定,稳定性较低;但该部分同时包含模型 可解释性理论(第11章:线性/逻辑回归、决策树、KNN、朴素贝叶斯等可解释模型对比,黑盒 模型解释方法)和深度学习聚类原理(第12章:LSTM-Autoencoder聚类算法原理),这些内容 仍然是高浓度、高稳定性的。整体评级不因局部工具细节而降级,但精读时会区分原理性内容 (生卡)和纯操作步骤(不生卡)。

类别识别

对照 category-checklists.md 现有类别,均未精确命中:

  • “数据科学导论类”要求”广谱概览”,而本书是深挖具体方法(DCM/生存分析/因果推断/实验 设计),不是概览。
  • “数据分析方法论类”聚焦”指标体系构建→MECE拆解→图表呈现”这条业务分析工作流,而本书是 具体的统计/计量经济学方法本身(模型假设、识别策略、效应量估计),技术深度明显更高。
  • “AI 模型类”聚焦模型结构/训练目标,本书虽含LTV神经网络、LSTM-Autoencoder等内容,但 全书主线是”分析框架的选择与因果推断逻辑”,AI建模只是其中一种工具而非主线。

建议新增类别:统计建模与因果推断类

判定标准草案:以讲解特定统计/计量经济学方法(如离散选择模型、生存分析、因果推断方法、 A/B实验与实验设计)在商业场景下的原理、假设与应用为主要目标的书籍;不同于泛泛描述数据 分析工作流程的书(走”数据分析方法论类”),也不同于广谱概览数据科学生态的书(走”数据科学 导论类”)。

必答清单草案: 1. 方法适用场景与前提假设:什么业务问题触发选择该方法,方法背后的假设是什么 2. 从业务问题到统计模型的映射方式:如何把开放商业问题转化为可估计的模型 3. 因果推断逻辑:如何排除混杂、区分相关与因果 4. 实验设计原则:随机化、分层/区组、方差控制等设计手段 5. 效应量估计与显著性判断:如何评估效果大小与统计显著性 6. 方法失效场景与应对:假设不满足时(如无法随机分流、强约束条件)如何调整方法 7. 结果解释与业务落地:模型/实验结果如何转化为业务决策 8. 同类方法的对比与选型:同一问题下多种方法的优劣取舍

用户已确认新增该类别,已追加至 category-checklists.md,阶段四将按此清单执行核对。

章节进度追踪表

章节号 章节标题 精读/略读 状态 卡片数
1 第1章 如何分析用户的选择 精读 done 8
2 第2章 与时间相关的行为分析 精读 done 9
3 第3章 洞察用户长期价值:基于神经网络的LTV建模 精读 done 8
4 第4章 使用体系化分析方法进行场景挖掘 精读 done 6
5 第5章 行为规律的发现与挖掘 精读 done 7
6 第6章 对观测到的事件进行因果推断 精读 done 5
7 第7章 如何比较两个策略的效果 精读 done 8
8 第8章 提高实验效能 精读 done 6
9 第9章 特殊场景下的实验设计和分析方法 精读 done 14
10 第10章 SQLFlow 精读 done 2
11 第11章 机器学习模型可解释性 精读 done 12
12 第12章 基于LSTM-Autoencoder的无监督聚类模型 精读 done 8

理由:全书12章均包含概念/术语/原理类内容的实质性讲解(离散选择模型、生存分析、 LTV、可解释模型体系、矩阵分解、因果推断方法、A/B实验原理、实验设计方差控制、特殊场景 实验方法、SQLFlow工作原理、模型可解释性、深度学习聚类原理),按”概念类内容强制生卡” 规则全部标记精读。第10章虽含Docker环境配置等操作步骤,但10.1节”SQLFlow工作原理”有 实质性原理讲解,故整章仍标精读(操作步骤部分精读时不生卡)。

待关联术语

术语名 出现章节 一句话语境

实践卡进度

序号 实践标题 实践方式 状态 关联章节 产出
1 模拟真实AB实验验证样本方差如何淹没真实效果 实现深读 done AB实验相关章节 三场景1000次模拟统计结果
2 用SHAP解释一个真实训练模型验证局部可加分解 实现深读 done 可解释性相关章节 SHAP值核对记录与排序合理性判断

类别清单核对(统计建模与因果推断类)

维度 覆盖状态 关联卡片标题或未覆盖理由
方法适用场景与前提假设 已覆盖 生存分析解决截面回归的盲点、删失与右删失、DID的平行趋势假设、线性回归的五个假设条件
从业务问题到统计模型的映射方式 已覆盖 DCM的模型簇结构、全量评估的核心困境、场景挖掘框架的三段式组合
因果推断逻辑 已覆盖 相关性不等于因果性、潜在结果框架与AB实验的必要性、合成控制法用加权组合构造反事实对照组、Causal Impact用贝叶斯时间序列建模反事实、单因素生存曲线对比需警惕混杂
实验设计原则(随机化/分层区组/方差控制) 已覆盖 AB实验的三大特性、随机区组实验先分层再分组、随机饱和度实验的两层随机化、Switchback实验用时空切片承载分组、交叉实验让每个单元当自己的对照组、多基线实验在各自时间轴上前后对比
效应量估计与显著性判断 已覆盖 AB实验样本量的四要素、多元回归中调整R方的必要性、R方升高不等于策略有效果、随机检验通过打乱切换时间点判断显著性
方法失效场景与应对 已覆盖 IIA假设与红蓝巴士悖论、网络效应破坏AB实验的独立性假设、既不能分流又不能轮转的强约束场景、区组数量不是越多越好
结果解释与业务落地 已覆盖 逻辑回归系数的几率解读、Cox模型系数的危险保护因素解读、SHAP把Shapley值转化为线性可加分解、决策树的解释形式是与条件链
同类方法的对比与选型 已覆盖 LTV计算方法的五级演进、黑盒模型与白盒模型的取舍、参数法与非参数法的生存函数估计、K均值聚类需要预先指定K值/层次聚类不需要预先指定簇数

核对结论:8/8 维度均已覆盖,均在阶段三精读过程中自然生成对应卡片,无需为凑清单额外补充生卡。

引用文献

标题 类型(书/论文/框架/源码项目) 出现章节 一句话语境
BigQuery ML 框架 第10章 Google 2018年发布的用SQL驱动机器学习的产品,与SQLFlow类似定位但封闭在自家生态内
TeraData SQL for DL 框架 第10章 TeraData推出的用SQL驱动深度学习的方案,同类定位产品
微软SQL Server AI扩展 框架 第10章 微软基于SQL Server推出的AI能力扩展,同类定位产品

章节与卡片

01 如何分析用户的选择

  1. 效用最大化与揭示性偏好 普通读书笔记卡
  2. DCM的模型簇结构 普通读书笔记卡
  3. Logit与Probit的分野 普通读书笔记卡
  4. IIA假设与红蓝巴士悖论 普通读书笔记卡
  5. 备选项特定常数ASC 普通读书笔记卡
  6. 选择数据的长格式与宽格式 普通读书笔记卡
  7. 逻辑回归系数的几率解读 普通读书笔记卡
  8. 共线性检验的VIF阈值 普通读书笔记卡

02 与时间相关的行为分析

  1. 生存分析解决截面回归的盲点 普通读书笔记卡
  2. 删失与右删失 普通读书笔记卡
  3. 生存函数与风险函数 普通读书笔记卡
  4. 半衰期作为生存指标 普通读书笔记卡
  5. KM曲线的非参数估计与局限 普通读书笔记卡
  6. Cox比例风险模型的半参数结构 普通读书笔记卡
  7. Cox模型系数的危险/保护因素解读 普通读书笔记卡
  8. 参数法与非参数法的生存函数估计 普通读书笔记卡
  9. 单因素生存曲线对比需警惕混杂 普通读书笔记卡

03 洞察用户长期价值:基于神经网络的LTV建模

  1. LTV的定义与用户行为估值法 普通读书笔记卡
  2. 用户生命周期的五个阶段 普通读书笔记卡
  3. LTV观察窗口的折衷(LTV90/LTV180) 普通读书笔记卡
  4. LTV计算方法的五级演进 普通读书笔记卡
  5. BG/NBD统计模型的分布假设 普通读书笔记卡
  6. LTV预测的双层CNN-LSTM嵌套结构 普通读书笔记卡
  7. 长尾目标变量的对数变换 普通读书笔记卡
  8. 变长行为序列的截断与填充 普通读书笔记卡

04 使用体系化分析方法进行场景挖掘

  1. 经验化分析的维度诅咒 普通读书笔记卡
  2. 体系化分析:先预测后解释的两步法 普通读书笔记卡
  3. 黑盒模型与白盒模型的取舍 普通读书笔记卡
  4. 决策树不纯度指标的选择逻辑 普通读书笔记卡
  5. 全局代理模型的解释逻辑 普通读书笔记卡
  6. 场景挖掘框架的三段式组合 普通读书笔记卡

05 行为规律的发现与挖掘

  1. 矩阵分解作为体系化规律挖掘手段 普通读书笔记卡
  2. 特征值分解的几何意义 普通读书笔记卡
  3. SVD是特征分解在非方阵上的推广 普通读书笔记卡
  4. 保留top-k奇异值实现降噪与降维 普通读书笔记卡
  5. SVD降维+K均值聚类的组合套路 普通读书笔记卡
  6. NMF非负性带来可解释的局部叠加 普通读书笔记卡
  7. NMF的稀疏性优势 普通读书笔记卡

06 对观测到的事件进行因果推断

  1. 全量评估的核心困境 普通读书笔记卡
  2. 多元回归中调整R²的必要性 普通读书笔记卡
  3. DID的平行趋势假设 普通读书笔记卡
  4. 合成控制法:用加权组合构造反事实对照组 普通读书笔记卡
  5. Causal Impact:用贝叶斯时间序列建模反事实 普通读书笔记卡

07 如何比较两个策略的效果

  1. 相关性不等于因果性 普通读书笔记卡
  2. 潜在结果框架与A/B实验的必要性 普通读书笔记卡
  3. A/B实验的三大特性 普通读书笔记卡
  4. A/B实验的假设检验与证伪逻辑 普通读书笔记卡
  5. 最小预期提升决定实验的业务价值门槛 普通读书笔记卡
  6. A/B实验样本量的四要素 普通读书笔记卡
  7. A/A实验校准分组本身的噪声 普通读书笔记卡
  8. 实验不能看到显著就立即喊停 普通读书笔记卡

08 提高实验效能

  1. 样本方差如何淹没真实效果 普通读书笔记卡
  2. 随机区组实验:先分层再分组 普通读书笔记卡
  3. 随机区组实验拆解出的三部分方差 普通读书笔记卡
  4. 区组特征的选择标准 普通读书笔记卡
  5. 区组数量不是越多越好 普通读书笔记卡
  6. R²升高不等于策略有效果 普通读书笔记卡

09 特殊场景下的实验设计和分析方法

  1. 网络效应破坏A/B实验的独立性假设 普通读书笔记卡
  2. 随机饱和度实验的两层随机化 普通读书笔记卡
  3. 饱和度为0和1的簇提供无偏对照 普通读书笔记卡
  4. 分簇要在独立性和均匀性之间找平衡 普通读书笔记卡
  5. 双边匹配市场不能按用户ID随机分流 普通读书笔记卡
  6. Switchback实验用时空切片承载分组 普通读书笔记卡
  7. 跨片率衡量时空切片划分的好坏 普通读书笔记卡
  8. 交叉实验:让每个单元当自己的对照组 普通读书笔记卡
  9. 交叉实验的延滞效应与消除期 普通读书笔记卡
  10. 交叉实验设计矩阵的均匀性与平衡性 普通读书笔记卡
  11. 既不能分流又不能轮转的强约束场景 普通读书笔记卡
  12. 多基线实验:在各自时间轴上前后对比 普通读书笔记卡
  13. 随机检验:通过打乱切换时间点判断显著性 普通读书笔记卡
  14. 用协变量剥离方差提高小样本实验灵敏度 普通读书笔记卡

10 SQLFlow

  1. SQLFlow用SQL扩展语法封装机器学习流程 普通读书笔记卡
  2. 特征列封装特征工程 普通读书笔记卡

11 机器学习模型可解释性

  1. 算法工程师与数据科学工作者的不同期待 普通读书笔记卡
  2. 可解释模型的纠错双重作用 普通读书笔记卡
  3. 可解释模型的三个特征 普通读书笔记卡
  4. 线性回归的五个假设条件 普通读书笔记卡
  5. 决策树的解释形式是"与"条件链 普通读书笔记卡
  6. KNN是懒惰学习,只能做局部解释 普通读书笔记卡
  7. KNN的k值决定过拟合与欠拟合的走向 普通读书笔记卡
  8. 朴素贝叶斯是生成模型而非判别模型 普通读书笔记卡
  9. 全局代理模型只能解释模型本身 普通读书笔记卡
  10. LIME用局部采样解释单个预测 普通读书笔记卡
  11. Shapley值:合作博弈里的公平贡献分配 普通读书笔记卡
  12. SHAP把Shapley值转化为线性可加分解 普通读书笔记卡

12 基于LSTM-Autoencoder的无监督聚类模型

  1. 聚类分析的本质是相似度定义的选择 普通读书笔记卡
  2. K均值聚类需要预先指定K值 普通读书笔记卡
  3. 层次聚类不需要预先指定簇数 普通读书笔记卡
  4. 判定簇间距离的单连接与全连接 普通读书笔记卡
  5. 自编码器把无监督表征学习拆成压缩与重建 普通读书笔记卡
  6. 深度聚类同步优化特征表示和聚类分配 普通读书笔记卡
  7. 辅助目标分布强化聚类置信度 普通读书笔记卡
  8. 无监督聚类替代人工经验分类 普通读书笔记卡

相关主题

暂无公开主题。