来源书籍

用户画像:方法论与工程化解决方案

全书概览

用户画像:方法论与工程化解决方案(赵宏田)

Skill 版本:v1

评级结论:工程实践(第二级别)— 高浓度 + 低稳定性

理由:

  • 高浓度:书中不只是罗列操作步骤,而是解释了不少设计决策背后的”为什么”——第3章讲清楚 Hive/MySQL/HBase/Elasticsearch 四种存储在不同场景下的选型逻辑;第5章”数据倾斜调优”分析了 倾斜产生的根本原因(分布式计算中 key 分布不均导致某个 task 拖慢整体),并给出通用解法 (过滤无意义 key、随机数打散两阶段聚合);ID-Mapping / 拉链表(缓慢变化维)是数仓设计中的 经典模式,讲清楚了”为什么需要拉链表”而不只是”怎么建表”。

  • 低稳定性:全书内容强绑定 2019 年前后的具体大数据技术栈——Hive SQL、HBase、 Spark Streaming + Kafka、Airflow 安装配置、sklearn 朴素贝叶斯分类代码等,大量篇幅是可 直接复制的 SQL/Python 脚本和工具安装步骤,随工具版本迭代会显著过时。

综合来看,全书更像是一份”有原理支撑的工程实战手册”,落在工程实践象限。

章节进度追踪表

章节号 章节标题 精读/略读 状态 卡片数
前言 前言 略读 done 0
第1章 用户画像基础 精读 done 6
第2章 数据指标体系 精读 done 6
第3章 标签数据存储 精读 done 8
第4章 标签数据开发 精读 done 10
第5章 开发性能调优 精读 done 4
第6章 作业流程调度 略读 done 0
第7章 用户画像产品化 精读 done 2
第8章 用户画像应用 精读 done 3
第9章 实践案例详解 精读 done 9
附录 某产品用户画像项目规划文档 略读 done 0

章节 spine 文件对照

  • 前言: text00002.html
  • 第1章: text00003.html - text00017.html
  • 第2章: text00018.html - text00027.html
  • 第3章: text00028.html - text00044.html
  • 第4章: text00045.html - text00083.html
  • 第5章: text00085.html - text00089.html
  • 第6章: text00090.html - text00105.html
  • 第7章: text00106.html - text00112.html
  • 第8章: text00114.html - text00124.html
  • 第9章: text00125.html - text00151.html
  • 附录: text00152.html

实践卡进度

序号 实践标题 实践方式 状态 关联章节 产出
1 给本仓库书籍设计标签体系并检验互斥与非互斥划分 真实任务 done 标签体系相关章节 本仓库标签体系设计表与抽查结果
2 用同现矩阵挖掘本仓库真实待关联术语之间的相关性 真实任务 done 同现矩阵相关章节 术语同现矩阵与主题归类分析

待关联术语

术语名 出现章节 一句话语境

引用文献

| 标题 | 类型(书/论文/框架/源码项目) | 出现章节 | 一句话语境 | |—|—|—|

章节与卡片

01 用户画像基础

  1. 三类用户标签及工程占比 普通读书笔记卡
  2. 画像数仓存储引擎分工 普通读书笔记卡
  3. 数据项目七阶段落地流程 普通读书笔记卡
  4. 全量表与增量表的取舍 普通读书笔记卡
  5. 定量画像与定性画像互补 普通读书笔记卡
  6. 标签价值只在业务使用中产生 普通读书笔记卡

02 数据指标体系

  1. userid与cookieid双轨标签体系 普通读书笔记卡
  2. 标签互斥与非互斥关系判断 普通读书笔记卡
  3. 行为代理标签与人口统计标签的差异 普通读书笔记卡
  4. 品类×行为组合圈人 普通读书笔记卡
  5. 标签体系的双重分类维度 普通读书笔记卡
  6. 标签命名的编码规范设计 普通读书笔记卡

03 标签数据存储

  1. 数据仓库与业务库的本质区别 普通读书笔记卡
  2. 三类事实表的设计选择 普通读书笔记卡
  3. 缓慢变化维的四种处理方式 普通读书笔记卡
  4. 分表存储与汇聚表的两级设计 普通读书笔记卡
  5. HBase RowKey设计三原则 普通读书笔记卡
  6. KV存储加全文索引的分离架构 普通读书笔记卡
  7. 数据管道的对账监控与新鲜度灾备 普通读书笔记卡
  8. ID-Mapping打通设备与账号的行为 普通读书笔记卡

04 标签数据开发

  1. 标签增量更新的全连接upsert模式 普通读书笔记卡
  2. 用数据分布定义分层阈值 普通读书笔记卡
  3. 机器学习标签开发的标注-训练-预测流程 普通读书笔记卡
  4. 训练集特征空间必须复用到测试集 普通读书笔记卡
  5. 流式消费的offset检查点容错模式 普通读书笔记卡
  6. TF-IDF跨领域迁移建模用户标签权重 普通读书笔记卡
  7. 标签时效性的时间衰减与多因子权重 普通读书笔记卡
  8. 同现矩阵挖掘标签相关性 普通读书笔记卡
  9. 离线在线服务层划分与多渠道去重 普通读书笔记卡
  10. 图计算挖掘社交二度关系 普通读书笔记卡

05 开发性能调优

  1. 数据倾斜的根因与两种解法 普通读书笔记卡
  2. 小文件问题与分区数控制 普通读书笔记卡
  3. 内存缓存复用中间计算结果 普通读书笔记卡
  4. 数据仓库中间层设计原则 普通读书笔记卡

07 用户画像产品化

  1. 用户分群与人群分析的产品定位区别 普通读书笔记卡
  2. 标签覆盖量环比监控作为质量预警 普通读书笔记卡

08 用户画像应用

  1. AARRR模型与留存复购率口径 普通读书笔记卡
  2. 人群分析必须有对比才有信息量 普通读书笔记卡
  3. 营销效果评估要先看KPI导向 普通读书笔记卡

09 实践案例详解

  1. 风控画像的多主体维度设计 普通读书笔记卡
  2. A/B测试的控制变量法与哈希分桶 普通读书笔记卡
  3. LTV生命周期价值公式的推导逻辑 普通读书笔记卡
  4. 提升ROI的三个杠杆 普通读书笔记卡
  5. 用时间窗口分布定位生命周期干预时机 普通读书笔记卡
  6. 精准营销的消耗周期择时与黑名单排除 普通读书笔记卡
  7. 用户行为分析的三类指标框架 普通读书笔记卡
  8. 渠道质量对比要看成本绝对值 普通读书笔记卡
  9. 页面停留分布对比定位转化障碍 普通读书笔记卡

相关主题

暂无公开主题。