知识卡片

抓取与爬取

专业/工作 · 916.j

内容

两个词描述的是自动获取网络数据这件事的两个不同层面。抓取指的是从一个网页里剔除无关的HTML标签等冗余信息,只提取需要的数据内容(比如把表格里的数据转成CSV);爬取指的是按顺序在多个网页之间自动巡回访问,把抓取这个动作在大量页面上重复执行——两者常常配合使用:爬取负责”跑遍该跑的页面”,抓取负责”每到一页该拿什么”。爬取真正的风险不在技术实现,而在于对目标服务器的影响:人工翻页访问不会有什么问题,但程序化的高频连续访问可能超出服务器的处理能力,造成宕机——这意味着写爬虫程序时必须主动控制访问间隔(比如设置几秒一次的请求频率),这不是可选的礼貌,而是避免对他人系统造成实际损害的责任边界。

参考来源

《图解数据科学》第6章《有关安全与隐私的问题》