这个模块解决什么问题
有些数据必须从网站上取,但网站不会给你导出的 Excel。常见的三种情况:
- 固定网站定期更新:每周去抄一遍
- 页面需要交互:得点进去、翻页、筛选才能看到数据
- 抄回来还得洗:粘到 Excel 里格式全乱
本模块 3 项技能应对这三种情况。模块本体仅 3MB,需要操作网页时再按需下载浏览器扩展。
前置说明:关于浏览器运行时
「定时采集」和「流程图采集」需要能操作网页,这依赖浏览器运行时(约 203MB)。
- 首次使用时软件会提示按需下载
- 如果只用「采集数据清洗」(纯表格处理),不需要下载
- 长期规划是把浏览器操作改为驱动系统已装的 Edge/Chrome,届时不再需要这个运行时
采集属技术支持能力,请自行确认目标网站的 robots 协议与使用条款,遵守相关法律法规,不要采集非公开数据或用于侵权用途。
定时采集任务
适用场景:某个网站每周更新一批数据,你想让它自动采。
- 打开「数据采集」→「定时采集任务」。
- 新建任务,配置:
- 目标网址
- 采集字段:页面上哪些内容要(标题、日期、编号、金额等)
- 采集频率:每分钟 / 每小时 / 每天 / 每周
- 保存并启用任务。
- 系统按频率自动执行。
增量去重:系统自动判断哪些是新数据,只保存新增部分,不会每次把全部内容重复存一遍。这是它比手工复制好用的关键。
任务管理:
- 立即执行:不等定时,手动跑一次验证配置
- 启用 / 禁用:临时停掉任务但保留配置
- 结果位置:保存在本地 Excel / JSON
建议:新建任务后先点「立即执行」,确认采到的字段是对的、内容没有空值,再开启定时。
流程图采集模式
适用场景:数据不在第一页,需要输入条件、点查询、翻几页才能采全。
- 打开「流程图采集模式」。
- 手动添加步骤,从页面下拉选择:
- 打开页面:填写网址
- 输入:在指定输入框填入内容(如查询条件、日期范围)
- 等待:等页面加载完成(设置等待秒数)
- 提取数据:选择页面上要提取的元素
- 翻页:设置翻页规则与页数上限
- 步骤以流程图形式展示,可拖动调整顺序。
- 点「按流程回放执行」。
- 结果保存为 Excel 或 JSON。
配置要点:
- 「等待」步骤不能省。网速慢时页面没加载完就提取,会采到空值。
- 「翻页」要设置上限,避免无限循环。
- 每加完一个「打开页面」建议先单独回放一次,确认页面能正常打开再继续加步骤。
采集数据清洗
适用场景:采集回来的数据字段混乱,手机号身份证挤在一列里。
- 打开「采集数据清洗」。
- 导入采集结果(Excel/CSV)。
- 选择要执行的操作(可多步依次执行):
- 字段合并:把「楼栋」和「房号」拼成完整地址
- 查找替换:支持正则表达式,批量替换不规则内容
- 按列去重:去掉重复记录
- 提取手机号 / 身份证 / 邮箱 / URL:从混杂文本里抽出来,变成独立列
- 点执行,依次跑完所有步骤。
- 导出 Excel。
多个步骤会按你排的顺序依次执行,顺序会影响结果。比如先「提取手机号」再「按列去重」,与反过来做,结果不同。
典型的采集工作流
以「每周更新行业名单」为例:
- 第一步:用「流程图采集模式」试配置,确认能采到目标数据(先手动跑通)
- 第二步:确认识别规则稳定后,改成「定时采集任务」,设成每周一次
- 第三步:配置「采集数据清洗」,把字段整理成你需要的格式
- 第四步:把清洗后的表格交给「数据分析」模块出报告
常见问题
Q:采集会不会被封 IP? A:频率过高可能触发对方网站的访问限制。建议把频率设得保守一些(每天/每周),不要设置成每分钟高频访问。
Q:为什么采到的数据是空的? A:多数是三种原因:① 页面还没加载完(加「等待」步骤);② 元素选择不对(重新选提取目标);③ 网站需要登录(需要在浏览器里先登录好)。
Q:能不能采集需要登录的网站? A:取决于目标网站的条款。请在合规前提下使用,不要用于抓取他人隐私数据或绕过访问控制。
Q:采集模块要下载 203MB 扩展,能省吗? A:如果只做「采集数据清洗」,完全不需要下载。只有需要真正操作网页时才需要。长期版本会改为驱动系统自带浏览器,不再需要这笔下载。