来源书籍
数据科学工程实践 用户行为分析与建模、AB实验、SQLFlow
统计建模与因果推断类
类别清单覆盖
8/8
全书概览
数据科学工程实践 用户行为分析与建模、A/B实验、SQLFlow
- Skill 版本:v1
- 类别:统计建模与因果推断类
阶段一:整体评级
结论:经典原理(高信息浓度 × 高稳定性)
理由:
- 信息浓度高:全书围绕”为什么用这个方法、这个方法背后的原理是什么”展开,而非单纯的 操作手册。例如第1章从理性人选择理论、效用理论、揭示性偏好理论层层递进推导出离散选择模型 (DCM)的数学结构;第7章从相关性谬误讲到潜在结果框架(Potential Outcome Framework), 再引出A/B实验作为科学因果推断方法的理论根基;第2章解释了为什么在存在删失数据的场景下 一般回归模型失效、必须选择生存分析。这些内容都是在讲底层设计决策,而非”点击这个按钮”式 的步骤说明。
- 稳定性高(主体部分):第一部分(观测数据分析,第1~6章)和第二部分(实验设计, 第7~9章)讲的是统计学、计量经济学、实验设计的经典理论(DCM、生存分析、因果推断、 A/B实验、随机区组设计、Switchback实验等),这些原理不依赖特定工具版本,多年后依然适用。
- 例外(需注意的低稳定性部分):第三部分(第10~12章)介绍开源工具SQLFlow,其中 Docker环境配置、CLI交互步骤等内容与工具版本绑定,稳定性较低;但该部分同时包含模型 可解释性理论(第11章:线性/逻辑回归、决策树、KNN、朴素贝叶斯等可解释模型对比,黑盒 模型解释方法)和深度学习聚类原理(第12章:LSTM-Autoencoder聚类算法原理),这些内容 仍然是高浓度、高稳定性的。整体评级不因局部工具细节而降级,但精读时会区分原理性内容 (生卡)和纯操作步骤(不生卡)。
类别识别
对照 category-checklists.md 现有类别,均未精确命中:
- “数据科学导论类”要求”广谱概览”,而本书是深挖具体方法(DCM/生存分析/因果推断/实验 设计),不是概览。
- “数据分析方法论类”聚焦”指标体系构建→MECE拆解→图表呈现”这条业务分析工作流,而本书是 具体的统计/计量经济学方法本身(模型假设、识别策略、效应量估计),技术深度明显更高。
- “AI 模型类”聚焦模型结构/训练目标,本书虽含LTV神经网络、LSTM-Autoencoder等内容,但 全书主线是”分析框架的选择与因果推断逻辑”,AI建模只是其中一种工具而非主线。
建议新增类别:统计建模与因果推断类
判定标准草案:以讲解特定统计/计量经济学方法(如离散选择模型、生存分析、因果推断方法、 A/B实验与实验设计)在商业场景下的原理、假设与应用为主要目标的书籍;不同于泛泛描述数据 分析工作流程的书(走”数据分析方法论类”),也不同于广谱概览数据科学生态的书(走”数据科学 导论类”)。
必答清单草案: 1. 方法适用场景与前提假设:什么业务问题触发选择该方法,方法背后的假设是什么 2. 从业务问题到统计模型的映射方式:如何把开放商业问题转化为可估计的模型 3. 因果推断逻辑:如何排除混杂、区分相关与因果 4. 实验设计原则:随机化、分层/区组、方差控制等设计手段 5. 效应量估计与显著性判断:如何评估效果大小与统计显著性 6. 方法失效场景与应对:假设不满足时(如无法随机分流、强约束条件)如何调整方法 7. 结果解释与业务落地:模型/实验结果如何转化为业务决策 8. 同类方法的对比与选型:同一问题下多种方法的优劣取舍
用户已确认新增该类别,已追加至 category-checklists.md,阶段四将按此清单执行核对。
章节进度追踪表
| 章节号 | 章节标题 | 精读/略读 | 状态 | 卡片数 |
|---|---|---|---|---|
| 1 | 第1章 如何分析用户的选择 | 精读 | done | 8 |
| 2 | 第2章 与时间相关的行为分析 | 精读 | done | 9 |
| 3 | 第3章 洞察用户长期价值:基于神经网络的LTV建模 | 精读 | done | 8 |
| 4 | 第4章 使用体系化分析方法进行场景挖掘 | 精读 | done | 6 |
| 5 | 第5章 行为规律的发现与挖掘 | 精读 | done | 7 |
| 6 | 第6章 对观测到的事件进行因果推断 | 精读 | done | 5 |
| 7 | 第7章 如何比较两个策略的效果 | 精读 | done | 8 |
| 8 | 第8章 提高实验效能 | 精读 | done | 6 |
| 9 | 第9章 特殊场景下的实验设计和分析方法 | 精读 | done | 14 |
| 10 | 第10章 SQLFlow | 精读 | done | 2 |
| 11 | 第11章 机器学习模型可解释性 | 精读 | done | 12 |
| 12 | 第12章 基于LSTM-Autoencoder的无监督聚类模型 | 精读 | done | 8 |
理由:全书12章均包含概念/术语/原理类内容的实质性讲解(离散选择模型、生存分析、 LTV、可解释模型体系、矩阵分解、因果推断方法、A/B实验原理、实验设计方差控制、特殊场景 实验方法、SQLFlow工作原理、模型可解释性、深度学习聚类原理),按”概念类内容强制生卡” 规则全部标记精读。第10章虽含Docker环境配置等操作步骤,但10.1节”SQLFlow工作原理”有 实质性原理讲解,故整章仍标精读(操作步骤部分精读时不生卡)。
待关联术语
| 术语名 | 出现章节 | 一句话语境 |
|---|
实践卡进度
| 序号 | 实践标题 | 实践方式 | 状态 | 关联章节 | 产出 |
|---|---|---|---|---|---|
| 1 | 模拟真实AB实验验证样本方差如何淹没真实效果 | 实现深读 | done | AB实验相关章节 | 三场景1000次模拟统计结果 |
| 2 | 用SHAP解释一个真实训练模型验证局部可加分解 | 实现深读 | done | 可解释性相关章节 | SHAP值核对记录与排序合理性判断 |
类别清单核对(统计建模与因果推断类)
| 维度 | 覆盖状态 | 关联卡片标题或未覆盖理由 |
|---|---|---|
| 方法适用场景与前提假设 | 已覆盖 | 生存分析解决截面回归的盲点、删失与右删失、DID的平行趋势假设、线性回归的五个假设条件 |
| 从业务问题到统计模型的映射方式 | 已覆盖 | DCM的模型簇结构、全量评估的核心困境、场景挖掘框架的三段式组合 |
| 因果推断逻辑 | 已覆盖 | 相关性不等于因果性、潜在结果框架与AB实验的必要性、合成控制法用加权组合构造反事实对照组、Causal Impact用贝叶斯时间序列建模反事实、单因素生存曲线对比需警惕混杂 |
| 实验设计原则(随机化/分层区组/方差控制) | 已覆盖 | AB实验的三大特性、随机区组实验先分层再分组、随机饱和度实验的两层随机化、Switchback实验用时空切片承载分组、交叉实验让每个单元当自己的对照组、多基线实验在各自时间轴上前后对比 |
| 效应量估计与显著性判断 | 已覆盖 | AB实验样本量的四要素、多元回归中调整R方的必要性、R方升高不等于策略有效果、随机检验通过打乱切换时间点判断显著性 |
| 方法失效场景与应对 | 已覆盖 | IIA假设与红蓝巴士悖论、网络效应破坏AB实验的独立性假设、既不能分流又不能轮转的强约束场景、区组数量不是越多越好 |
| 结果解释与业务落地 | 已覆盖 | 逻辑回归系数的几率解读、Cox模型系数的危险保护因素解读、SHAP把Shapley值转化为线性可加分解、决策树的解释形式是与条件链 |
| 同类方法的对比与选型 | 已覆盖 | LTV计算方法的五级演进、黑盒模型与白盒模型的取舍、参数法与非参数法的生存函数估计、K均值聚类需要预先指定K值/层次聚类不需要预先指定簇数 |
核对结论:8/8 维度均已覆盖,均在阶段三精读过程中自然生成对应卡片,无需为凑清单额外补充生卡。
引用文献
| 标题 | 类型(书/论文/框架/源码项目) | 出现章节 | 一句话语境 |
|---|---|---|---|
| BigQuery ML | 框架 | 第10章 | Google 2018年发布的用SQL驱动机器学习的产品,与SQLFlow类似定位但封闭在自家生态内 |
| TeraData SQL for DL | 框架 | 第10章 | TeraData推出的用SQL驱动深度学习的方案,同类定位产品 |
| 微软SQL Server AI扩展 | 框架 | 第10章 | 微软基于SQL Server推出的AI能力扩展,同类定位产品 |
章节与卡片
01 如何分析用户的选择
- 效用最大化与揭示性偏好 普通读书笔记卡
- DCM的模型簇结构 普通读书笔记卡
- Logit与Probit的分野 普通读书笔记卡
- IIA假设与红蓝巴士悖论 普通读书笔记卡
- 备选项特定常数ASC 普通读书笔记卡
- 选择数据的长格式与宽格式 普通读书笔记卡
- 逻辑回归系数的几率解读 普通读书笔记卡
- 共线性检验的VIF阈值 普通读书笔记卡
02 与时间相关的行为分析
- 生存分析解决截面回归的盲点 普通读书笔记卡
- 删失与右删失 普通读书笔记卡
- 生存函数与风险函数 普通读书笔记卡
- 半衰期作为生存指标 普通读书笔记卡
- KM曲线的非参数估计与局限 普通读书笔记卡
- Cox比例风险模型的半参数结构 普通读书笔记卡
- Cox模型系数的危险/保护因素解读 普通读书笔记卡
- 参数法与非参数法的生存函数估计 普通读书笔记卡
- 单因素生存曲线对比需警惕混杂 普通读书笔记卡
03 洞察用户长期价值:基于神经网络的LTV建模
- LTV的定义与用户行为估值法 普通读书笔记卡
- 用户生命周期的五个阶段 普通读书笔记卡
- LTV观察窗口的折衷(LTV90/LTV180) 普通读书笔记卡
- LTV计算方法的五级演进 普通读书笔记卡
- BG/NBD统计模型的分布假设 普通读书笔记卡
- LTV预测的双层CNN-LSTM嵌套结构 普通读书笔记卡
- 长尾目标变量的对数变换 普通读书笔记卡
- 变长行为序列的截断与填充 普通读书笔记卡
04 使用体系化分析方法进行场景挖掘
- 经验化分析的维度诅咒 普通读书笔记卡
- 体系化分析:先预测后解释的两步法 普通读书笔记卡
- 黑盒模型与白盒模型的取舍 普通读书笔记卡
- 决策树不纯度指标的选择逻辑 普通读书笔记卡
- 全局代理模型的解释逻辑 普通读书笔记卡
- 场景挖掘框架的三段式组合 普通读书笔记卡
05 行为规律的发现与挖掘
- 矩阵分解作为体系化规律挖掘手段 普通读书笔记卡
- 特征值分解的几何意义 普通读书笔记卡
- SVD是特征分解在非方阵上的推广 普通读书笔记卡
- 保留top-k奇异值实现降噪与降维 普通读书笔记卡
- SVD降维+K均值聚类的组合套路 普通读书笔记卡
- NMF非负性带来可解释的局部叠加 普通读书笔记卡
- NMF的稀疏性优势 普通读书笔记卡
06 对观测到的事件进行因果推断
- 全量评估的核心困境 普通读书笔记卡
- 多元回归中调整R²的必要性 普通读书笔记卡
- DID的平行趋势假设 普通读书笔记卡
- 合成控制法:用加权组合构造反事实对照组 普通读书笔记卡
- Causal Impact:用贝叶斯时间序列建模反事实 普通读书笔记卡
07 如何比较两个策略的效果
- 相关性不等于因果性 普通读书笔记卡
- 潜在结果框架与A/B实验的必要性 普通读书笔记卡
- A/B实验的三大特性 普通读书笔记卡
- A/B实验的假设检验与证伪逻辑 普通读书笔记卡
- 最小预期提升决定实验的业务价值门槛 普通读书笔记卡
- A/B实验样本量的四要素 普通读书笔记卡
- A/A实验校准分组本身的噪声 普通读书笔记卡
- 实验不能看到显著就立即喊停 普通读书笔记卡
08 提高实验效能
- 样本方差如何淹没真实效果 普通读书笔记卡
- 随机区组实验:先分层再分组 普通读书笔记卡
- 随机区组实验拆解出的三部分方差 普通读书笔记卡
- 区组特征的选择标准 普通读书笔记卡
- 区组数量不是越多越好 普通读书笔记卡
- R²升高不等于策略有效果 普通读书笔记卡
09 特殊场景下的实验设计和分析方法
- 网络效应破坏A/B实验的独立性假设 普通读书笔记卡
- 随机饱和度实验的两层随机化 普通读书笔记卡
- 饱和度为0和1的簇提供无偏对照 普通读书笔记卡
- 分簇要在独立性和均匀性之间找平衡 普通读书笔记卡
- 双边匹配市场不能按用户ID随机分流 普通读书笔记卡
- Switchback实验用时空切片承载分组 普通读书笔记卡
- 跨片率衡量时空切片划分的好坏 普通读书笔记卡
- 交叉实验:让每个单元当自己的对照组 普通读书笔记卡
- 交叉实验的延滞效应与消除期 普通读书笔记卡
- 交叉实验设计矩阵的均匀性与平衡性 普通读书笔记卡
- 既不能分流又不能轮转的强约束场景 普通读书笔记卡
- 多基线实验:在各自时间轴上前后对比 普通读书笔记卡
- 随机检验:通过打乱切换时间点判断显著性 普通读书笔记卡
- 用协变量剥离方差提高小样本实验灵敏度 普通读书笔记卡
10 SQLFlow
- SQLFlow用SQL扩展语法封装机器学习流程 普通读书笔记卡
- 特征列封装特征工程 普通读书笔记卡
11 机器学习模型可解释性
- 算法工程师与数据科学工作者的不同期待 普通读书笔记卡
- 可解释模型的纠错双重作用 普通读书笔记卡
- 可解释模型的三个特征 普通读书笔记卡
- 线性回归的五个假设条件 普通读书笔记卡
- 决策树的解释形式是"与"条件链 普通读书笔记卡
- KNN是懒惰学习,只能做局部解释 普通读书笔记卡
- KNN的k值决定过拟合与欠拟合的走向 普通读书笔记卡
- 朴素贝叶斯是生成模型而非判别模型 普通读书笔记卡
- 全局代理模型只能解释模型本身 普通读书笔记卡
- LIME用局部采样解释单个预测 普通读书笔记卡
- Shapley值:合作博弈里的公平贡献分配 普通读书笔记卡
- SHAP把Shapley值转化为线性可加分解 普通读书笔记卡
12 基于LSTM-Autoencoder的无监督聚类模型
- 聚类分析的本质是相似度定义的选择 普通读书笔记卡
- K均值聚类需要预先指定K值 普通读书笔记卡
- 层次聚类不需要预先指定簇数 普通读书笔记卡
- 判定簇间距离的单连接与全连接 普通读书笔记卡
- 自编码器把无监督表征学习拆成压缩与重建 普通读书笔记卡
- 深度聚类同步优化特征表示和聚类分配 普通读书笔记卡
- 辅助目标分布强化聚类置信度 普通读书笔记卡
- 无监督聚类替代人工经验分类 普通读书笔记卡
相关主题
暂无公开主题。