这个扩展是干什么的
「数据采集」模块里的定时采集和流程图采集需要能操作网页。而操作网页依赖一个浏览器运行时(约 203MB)。
S3 就是这个运行时所在的免费扩展:
- 免费,不额外收费
- 按需下载,不用采集功能的人不用下这 203MB
- 装完,「采集」模块的网页操作能力才能用
什么时候需要它
| 你要做的事 | 需要 S3 吗 |
|---|---|
| 采集数据清洗(纯 Excel 处理) | 不需要 |
| 定时采集网页数据 | 需要 |
| 流程图配置化采集 | 需要 |
| 表格处理、公文、PDF 等其他模块 | 不需要 |
安装与启用
- 先安装主程序。
- 进入「数据采集」模块,首次使用网页采集功能时会提示需要下载扩展。
- 按提示完成下载与安装。
- 回到采集模块,即可使用网页采集能力。
下载体积较大,建议在网络条件好的时候进行。安装完成后不需要重复下载。
采集方式一:定时采集
适合结构固定的页面,配置一次长期使用。
- 新建定时任务,填目标网址。
- 选择要提取的字段。
- 设置频率(每分钟 / 每小时 / 每天 / 每周)。
- 先点「立即执行」验证配置,确认字段采到正确的值。
- 启用定时。
采集方式二:流程图采集
适合需要交互的页面:要先输入条件、点查询、翻几页才能采全。
- 添加步骤:
- 打开页面:填网址
- 输入:在输入框填查询条件
- 等待:设置等待秒数
- 提取数据:选择页面元素
- 翻页:设置翻页规则与页数上限
- 流程图形式展示步骤,可调整顺序。
- 回放执行,结果导出 Excel/JSON。
最容易踩的坑:忘了加「等待」。页面没加载完就提取,采到一片空值。
关于浏览器自动化
这个扩展的本质是嵌入式浏览器 + 自动化控制:软件内嵌一个浏览器内核,按你配置的步骤去操作页面,像人工一样点击、输入、翻页。
与普通抓接口的区别:
- 抓接口:直接请求数据接口,快,但有些网站拿不到
- 浏览器自动化:真的打开页面操作,慢一些,但什么页面都能处理
合规提醒
使用前请确认:
- 遵守目标网站的 robots 协议与使用条款。
- 不要高频访问,避免给对方网站造成压力(这也是建议用「每天/每周」而不是「每分钟」的原因)。
- 不要采集非公开数据,不要用于获取他人隐私信息。
- 不要绕过访问控制,不采集需要越权才能看到的内容。
- 采集结果的使用需符合相关法律法规。
未来规划
这个 203MB 的浏览器运行时是个体积负担。长期方案是:把采集模块改为驱动你系统里已安装的 Edge / Chrome,这样就不需要再下载运行时了。
这是一个明确的优化方向,实施后 S3 扩展将不再需要下载。
常见问题
Q:这个扩展收费吗? A:免费。它是采集能力的依赖项,不单独收费。
Q:装了会占多少硬盘? A:解压后约 203MB 左右。
Q:能不装吗? A:如果只用「采集数据清洗」或其他模块,完全可以不装。
Q:为什么采集速度和手工操作差不多? A:因为是真实的浏览器操作,需要等页面加载、等元素渲染,速度天然接近人工。定时采集的价值在于「自动」而不是「快」。
Q:可以用它做别的浏览器自动化吗? A:当前定位是数据采集。更通用的自动化场景建议使用专业的 RPA 工具。