

步骤一、打开网页
在首页【输入框】中输入目标网址 https://www.baidu.com/,点击【开始采集】,八爪鱼自动打开网页。
- a. 打开网页后,如果开始开始【自动识别】,请点击【不再自动识别】或【取消识别】将其关掉。因为本文不适合使用【自动识别】。
- b. 【自动识别】适用于自动识别网页上的列表、滚动和翻页,识别成功后直接启动采集即可获取数据。详情点击查看 【自动识别】教程
步骤二、批量输入多个关键词并搜索
1.批量输入多个关键词 选中百度搜索框,在操作提示框中,点击【输入文本】-【批量输入文本】 2.点击检索 点击网页上的【百度一下】设置点击检索步骤步骤三、创建【循环翻页】,采集多页数据
1、建立【循环翻页】 如果只是采集一页数据,可跳过此步骤。 如果需要翻页以采集多页数据:选择页面中的【下一页>】按钮,在操作提示上单击【循环点击下一页】,创建【循环翻页】。 进入【点击翻页】设置页面,勾选【执行前等待】,时间选择5s;【Ajax超时**】,时间选择10s,设置好之后保存。** 特别说明:- a. 创建【循环翻页】后,八爪鱼会自动点击【下一页】按钮进行翻页,从第1页,第2页…直到最后1页。如果只需采集特定页的数据,可在八爪鱼中设置循环翻页的次数,详情点击查看 翻页以采集多页数据教程。
- b. 执行前等待,即在执行此步骤前等待一段时间,可有效避免因网页未加载完全导致的漏数据,详情点击查看 执行前等待使用场景与设置方法
- a.为什么要修改【循环翻页】的XPath?这是因为,当翻到第2页的时候,软件自动生成的 XPath
//A[@class="n"]定位到的是【<上一页】按钮。那么,八爪鱼采集器在执行的时候,会点击【<上一页】按钮,回到第一页,然后又点击【下一页>】按钮翻到第2页,造成的现象就是会重复采集第一页和第二页的数据。这么修改 XPath,需要一定的 XPath 知识,点击查看 XPath学习与实例教程 。
步骤四、创建【循环列表】,采集所有搜索结果中的数据
1、创建【循环列表】 ①、选中页面上1条不是广告的搜索结果(注意一定要选中一条搜索结果的整个列表,包含所有所需字段) ②、继续选中页面上另1条不是广告的搜索结果 ③、在操作提示框中,点击【采集以下元素文本】 经过以上操作后,整块列表作为一个字段提取下来。 特别说明:- a. 经过以上连续4步,【循环-提取数据】创建完成。【循环】中的项,对应着页面上所有评价列表,【提取数据】中的字段,对应着每个评价列表中的字段。启动采集以后,八爪鱼就会按照循环中的顺序依次提取每个列表中的字段。
- b. 为何通过以上4步,可建立【循环-提取数据】?详情点击查看 列表数据采集教程 。
- a. 一定要在当前搜索结果列表中提取字段,否则字段提取无法与【循环列表】产生联动,会重复采集某一条列表中的字段。
- b. 当网页层级在A标签时,操作提示框中才会有采集链接的提示。如果不在A标签层级,可以通过点击操作提示框右下角的扩大选项按钮 来调整选中的层级,但调整范围也是仅限于红框区域内,不可超出这个红框。
步骤五、编辑字段,修改字段的XPath
1、编辑字段 进入【提取列表数据】设置页面,可删除多余字段,修改字段名,移动字段顺序等。 2、修改字段XPath 为了精准采集到所有搜索结果中的字段,需修改字段的定位XPath。 进入【提取列表数据】设置页面,将【简介】字段的XPath修改为://div[contains(@class,‘clamp-2’)],备用元素选择【相对xpath】://div[contains(@class,‘clamp-3’)]然后点击【应用】。 特别说明:- a. 在【提取列表数据】步骤里面的【简介】字段。在采集时发现有问题,有字段错位的现象存在,即采集的内容不是【简介】的内容,这是由于字段的XPath定位不准确的缘故,需修改其定位XPath。这里需要一定的XPath知识。点击查看 XPath学习与实例教程 。
步骤六、启动采集
1、单击【采集】并【启动本地采集】。启动后八爪鱼开始自动采集数据。
- a.【本地采集】是使用自己的电脑进行采集,【云采集】是使用八爪鱼提供的云服务器采集,点击查看本地采集与云采集详解。

