

步骤一、打开网页
在首页【输入框】中输入目标网址 http://www.cbirc.gov.cn/cn/view/pages/ItemList.html?itemPId=914&itemId=915&itemUrl=ItemListRightList.html&itemName=%E7%9B%91%E7%AE%A1%E5%8A%A8%E6%80%81,点击【开始采集】,八爪鱼自动打开网页。
- a. 打开网页后,如果开始开始【自动识别】,请点击【不再自动识别】或【取消识别】将其关掉。因为本文不适合使用【自动识别】。
- b. 【自动识别】适用于自动识别网页上的列表、滚动和翻页,识别成功后直接启动采集即可获取数据。详情点击查看 【自动识别】教程
步骤二、建立【循环-点击元素】,进入每条监管动态的详情页
1、建立【循环-点击元素】,进入每条监管动态的详情页 通过以下3步,实现循环点击每个链接,进入详情页: ① 选中页面上第1条监管动态链接(注意一定要选中链接) ② 点击【循环点击每个链接】,进入第1条监管动态的详情页
- a. 经过以上连续3步,【循环-点击元素】创建完成。【循环】中的项,对应着页面上所有监管动态链接。启动采集以后,八爪鱼就会按照循环中的顺序依次点击每个链接,进入详情页,以采集每条监管动态的详情页数据。
- b. 为何通过以上3步,可建立【循环-点击元素】?详情点击查看 采集点击多个链接后的详情页数据教程 。
进入【循环翻页】设置页面,选择【循环方式】为【不固定元素列表】,修改XPath为://span[@class=“title”]/a,然后点击【应用】保存。 改完后,再次点击【点击元素】步骤,进入问题详情页。

- a. 默认生成的循环方式为【固定元素列表循环】,无法精准定位到所有的问题链接,所以我们需要手动修改XPath,使之定位到所有的问题链接。这里需要一定的XPath知识。点击查看 XPath学习与实例教程 。
步骤三、提取详情页中的文本字段
进入详情页后,选中页面中的文本,然后在操作提示框中,点击【采集该元素文本】。 文本类字段都可以按照这样的方式提取。示例中我们提取了当前位置、发布时间、来源、标题、正文等字段。
步骤四、编辑字段
1、编辑字段 在【当前页面数据预览】页面,可删除、增加多余字段,修改字段名,移动字段顺序等。


步骤五、创建循环翻页
1、创建循环翻页 如果只是采集一页数据,可跳过此步骤。 如果需要翻页以采集多页数据: ① 先点击流程中的【循环列表】步骤,以回到列表页(如果已在列表页可直接继续操作) ② 再选择页面中的【下一页】按钮,在操作提示上单击【循环点击下一页】,创建【循环翻页】。

步骤六、启动采集
1、单击【采集】并【启动本地采集】。启动后八爪鱼开始自动采集数据。
- a. 【本地采集】是使用自己的电脑进行采集,【云采集】是使用八爪鱼提供的云服务器采集,点击查看 本地采集与云采集详解。

