来源书籍
Excel+Python:飞速搞定数据分析与处理(图灵图书)
全书概览
Excel+Python:飞速搞定数据分析与处理(图灵图书)
- 书名:Excel+Python:飞速搞定数据分析与处理(图灵图书)
- Skill 版本:v1
- 四象限结论:速查手册(低浓度 + 低稳定性)
- 评级理由:本书大量篇幅用于 Anaconda/Jupyter/VS Code 安装配置、pandas/xlwings/OpenPyXL 等具体 API、Excel 菜单与版本差异,例如第 2 章讲开发环境安装,第 7-10 章围绕 read_excel、ExcelWriter、读写包和 xlwings 配置展开,信息形态更接近工具操作与实践速查。书中也有关注点分离、DRY、测试、索引对齐、向量化、对象模型等可迁移概念,但这些概念服务于具体工具链,整体稳定性会随库版本和 Excel 能力变化而下降。
- 类别识别:未命中现有类别;本书是 Excel、Python、pandas 与 xlwings 混合的数据分析实践书,不以编程语言设计、单一框架设计、数据库/存储原理或系统架构原理为主,阶段四跳过。
章节精读/略读划分
- 01《第 1 章 为什么要用 Python 为 Excel 编程》:精读。Excel 被视作编程语言,本章集中解释电子表格风险、工程最佳实践和 Python 替代价值。
- 02《第 2 章 开发环境》:精读。虽然多为安装步骤,但 Conda 环境和 Jupyter 执行顺序是后续分析可复现性的关键概念。
- 03《第 3 章 Python 入门》:精读。Python 对象、切片、函数、模块和类型提示属于基础术语定义,按规则强制生卡。
- 04《第 4 章 NumPy 基础》:精读。NumPy 数组、向量化、广播、视图与副本是 pandas 底层模型的关键概念。
- 05《第 5 章 使用 pandas 进行数据分析》:精读。DataFrame、索引对齐、缺失值、连接、聚合和数据形态转换是数据分析主干概念。
- 06《第 6 章 使用 pandas 进行时序分析》:精读。DatetimeIndex、重采样、滚动窗口等是时序分析的核心抽象。
- 07《第 7 章 使用 pandas 操作 Excel 文件》:精读。本章说明 pandas 脱离 Excel 应用读写文件的边界和限制。
- 08《第 8 章 使用读写包操作 Excel 文件》:精读。读写包选择、大文件模式和格式保真是 Excel 文件工程化处理的关键判断。
- 09《第 9 章 Excel 自动化》:精读。xlwings、Excel 对象模型、转换器和跨应用调用性能是自动化架构核心。
- 10《第 10 章 Python 驱动的 Excel 工具》:精读。把 Excel 作为前端、RunPython 桥接和配置层级涉及工具部署架构。
- 11《第 11 章 Python 包追踪器》:精读。案例章包含 Web API、关系数据库、异常处理和前后端分层的实质讲解。
- 12《第 12 章 用户定义函数》:精读。UDF、动态数组和缓存定义了 Excel 公式与 Python 计算的集成方式。
- A《附录 A Conda 环境》:略读。主要是命令步骤补充,概念已在第 2 章覆盖。
- B《附录 B 高级 VS Code 功能》:略读。主要是调试器和笔记本操作步骤,作为工具速查即可。
- C《附录 C 高级 Python 概念》:略读。补充类、时区和可变对象,主线卡片已优先覆盖第 3 章的基础概念。
章节进度追踪
| 章节号 | 章节标题 | 精读/略读 | 状态(pending/done) | 卡片数 |
|---|---|---|---|---|
| 01 | 第 1 章 为什么要用 Python 为 Excel 编程 | 精读 | done | 5 |
| 02 | 第 2 章 开发环境 | 精读 | done | 2 |
| 03 | 第 3 章 Python 入门 | 精读 | done | 3 |
| 04 | 第 4 章 NumPy 基础 | 精读 | done | 4 |
| 05 | 第 5 章 使用 pandas 进行数据分析 | 精读 | done | 6 |
| 06 | 第 6 章 使用 pandas 进行时序分析 | 精读 | done | 3 |
| 07 | 第 7 章 使用 pandas 操作 Excel 文件 | 精读 | done | 2 |
| 08 | 第 8 章 使用读写包操作 Excel 文件 | 精读 | done | 3 |
| 09 | 第 9 章 Excel 自动化 | 精读 | done | 4 |
| 10 | 第 10 章 Python 驱动的 Excel 工具 | 精读 | done | 3 |
| 11 | 第 11 章 Python 包追踪器 | 精读 | done | 3 |
| 12 | 第 12 章 用户定义函数 | 精读 | done | 3 |
| A | 附录 A Conda 环境 | 略读 | done | 0 |
| B | 附录 B 高级 VS Code 功能 | 略读 | done | 0 |
| C | 附录 C 高级 Python 概念 | 略读 | done | 0 |
待关联术语
| 术语名 | 出现章节 | 一句话语境 |
|---|---|---|
| Power Query | 第 1 章 | 作为现代 Excel 工具被简要介绍,用于连接和清理外部数据源。 |
| Power Pivot | 第 1 章 | 作为现代 Excel 的数据建模和分析工具被介绍,但未深入展开设计。 |
| Power BI | 第 1 章 | 作为支持 Python 的商业智能应用被提及,未展开内部机制。 |
| PEP 8 | 第 3 章 | 作为 Python 风格指南和静态检查工具背景被介绍。 |
| Plotly | 第 5 章 | 作为 pandas 绘图章节中的交互式图表库被使用。 |
| pyxlsb | 第 8 章 | 作为处理 xlsb 文件的读写包被列入包选择表。 |
| xlrd/xlwt/xlutils | 第 8 章 | 作为旧式 xls 文件读写与编辑相关包被概览。 |
| Google Trends | 第 12 章 | 作为 UDF 案例中的外部数据源被使用。 |
引用文献
| 标题 | 类型(书/论文/框架/源码项目) | 出现章节 | 一句话语境 |
|---|---|---|---|
| The Pragmatic Programmer /《程序员修炼之道》 | 书 | 第 1 章 | 用于说明 DRY 原则来源,但未展开该书体系。 |
| Microsoft Application Architecture Guide, 2nd Edition | 书/框架 | 第 1 章 | 作为表示层、业务层、数据层术语来源被脚注提及。 |
| Report of JPMorgan Chase & Co. Management Task Force Regarding 2012 CIO Losses | 报告 | 第 1 章 | 用于举例说明 London Whale Excel 风险事件。 |
| xlwings documentation | 框架 | 第 9-10 章 | 多处建议查询 xlwings 文档获取自定义转换器、插件和部署细节。 |
实践卡进度
| 序号 | 实践标题 | 实践方式 | 状态 | 关联章节 | 产出 |
|---|---|---|---|---|---|
| 1 | 用真实数据实测向量化相比逐行循环的性能差距 | 真实任务 | done | 第4/5章 | 不同规模×三种写法耗时对照表 |
| 2 | 写一个真实xlwings自定义函数挂到Excel里调用 | 真实任务 | done | 第9/12章 | 可运行UDF代码与Excel调用截图 |
阶段五(类别清单核对)
未执行:本书未命中现有类别清单。
章节与卡片
01 为什么要用 Python 为 Excel 编程
02 开发环境
03 Python 入门
04 NumPy 基础
05 使用 pandas 进行数据分析
06 使用 pandas 进行时序分析
07 使用 pandas 操作 Excel 文件
- 读写可脱离Excel 普通读书笔记卡
- pandas不保真 普通读书笔记卡
08 使用读写包操作 Excel 文件
- 按格式选包 普通读书笔记卡
- OpenPyXL重编辑 普通读书笔记卡
- 大文件要流式 普通读书笔记卡
09 Excel 自动化
10 Python 驱动的 Excel 工具
- Excel可当前端 普通读书笔记卡
- RunPython作桥 普通读书笔记卡
- 配置按近覆盖 普通读书笔记卡
11 Python 包追踪器
12 用户定义函数
相关主题
暂无公开主题。