一、内置浏览器
1、基本概念
内置浏览器是八爪鱼采集器的默认采集模式,它的特点在于: (1)客户端内置:由客户端启动采集,模拟访问常规浏览器。 (2)后台静默运行:任务可以在后台持续执行。 (3)资源占用低:不需要启动完整浏览器、可以同时运行多个采集任务、对电脑性能要求更低。 (4)故障排查方便:内置浏览器窗口可显示网页内容、同时查看日志,快速定位问题。2、适用场景
大批量公开数据采集。 反爬较弱的常规页面。 资源有限,需同时运行多任务。3、 使用介绍
步骤一:确认采集规则任务
请先自定义配置完任务或者配置完模板任务。特别说明: a. 配置模板任务
b.内置浏览器模式是默认采集方式。
步骤二:启动采集
特别说明: a. 模板点击启动:
步骤三:查看采集状态
1.客户端会开两个窗口:一个源窗口,一个采集窗口。
任务概况:可查看采集开始/结束时间,去重后数量以及资源使用情况(验证码、代理IP)。
数据列表:可以预览采集到的数据。



特别说明: a. 打开显示网页结合日志是排查问题的关键步骤。具体请参考:本地排错4.采集运行控制 暂停:可以停止流程采集,用于控制/操作流程间突发验证与排错。 停止:直接终止采集。

步骤四:数据导出
点击停止或者正常采集结束,选择导出方式即可。
二、独立浏览器
1、基本概念
独立浏览器是八爪鱼采集器针对高难度反爬场景推出的解决方案。它的核心优势在于: (1)真实浏览器环境:网站难以区分是真人还是爬虫。 (2)全程可见可控:打开独立浏览器窗口,采集过程一览无余、发现异常可以随时手动干预、新弹出的窗口会单独显示。2、适用场景
目标网站需要账号登录。 反爬检测严格(频次、行为分析)。 需要人工确认或干预的流程。 采集过程需要实时监控。 无需配置复杂的登录规则。 适合需要会话保持的采集任务。 可以随时暂停任务手动输入验证码,处理完继续执行,无缝衔接。3、 使用介绍
步骤一:确认采集规则任务
请先自定义配置完任务或者配置完模板任务。(请参考一、内置浏览器的该步骤)步骤二:启动采集
特别说明: a. 由于本地采集默认采集方式内置浏览器,所以要在下拉框选择独立浏览器采集。
步骤三:查看采集状态
1.客户端会开两个窗口:一个源窗口,一个采集窗口。同时独立浏览器会开一个新窗口用于采集。
任务概况:可查看采集开始/结束时间,去重后数量以及资源使用情况(验证码、代理IP)。
数据列表:可以预览采集到的数据。




特别说明: a. 如果需要排错,建议用客户端日志窗口与新浏览器采集窗口对比排查。4.采集运行控制 暂停:可以停止流程采集,用于控制/操作流程间突发验证与排错。 停止:直接终止采集。

步骤四:数据导出
点击停止或者正常采集结束,选择导出方式即可。
三、本地浏览器
1、基本概念
本地浏览器是八爪鱼采集器为高灵活性和复杂交互场景提供的专业采集模式。它会调用电脑上已经安装的浏览器(如 Chrome、Edge)执行采集,主要特点包括: (1)复用本地环境: 直接使用本地浏览器及其登录状态,无需在八爪鱼内重复登录。 (2)高度拟人化: 浏览器指纹、缓存和 Cookies 与日常使用环境保持一致,更接近真实用户行为。 (3)支持人工干预: 采集过程中可以手动处理滑动验证、弹窗或账号切换,操作完成后点击“继续”恢复流程。 (4)降低封号风险: 使用真实浏览器环境,并可按人工节奏控制操作频率,有助于降低被目标网站识别为自动化程序的风险。2、适用场景
- 网站需要登录,且登录验证机制复杂,例如扫码或短信验证码。
- 网站反爬策略严格,会分析浏览器指纹和操作行为。
- 采集流程包含多级菜单、地图拖拽等需要人工判断的复杂交互。
- 需要使用本地浏览器已有的翻译、代理等插件辅助采集。
- 需要长时间保持登录会话,避免频繁掉线。
3、使用介绍
步骤一:确认采集规则任务
请先完成自定义任务配置,或配置好需要使用的模板任务。任务配置方法可参考前文“内置浏览器”部分。 本地采集默认使用内置浏览器。如需切换,请在左侧任务栏的“工具”中选择“本地浏览器插件”。
.exe 文件)。




步骤二:启动采集
步骤三:查看采集状态
采集启动后,客户端会显示源窗口和采集窗口;同时,指定的本地浏览器(如 Chrome)会打开一个新窗口或标签页,用于实时展示采集页面。
- 任务概况:查看采集开始与结束时间、去重后数量,以及验证码、代理 IP 等资源使用情况。
- 数据列表:预览已经采集到的数据。
- 任务日志:查看任务流程的实时运行记录。
- 任务历史:查看该任务的历史执行记录。





步骤四:控制采集并导出数据
- 暂停:暂时停止流程,适合处理突发验证或排查流程问题;人工操作完成后可继续执行。
- 停止:直接终止本次采集。


四、模式对比与选择
1、模式对比
2、场景推荐
作者:YfY
