采集场景

今日头条上有很多头条号,实例网址:https://www.toutiao.com/c/user/52255723016/#mid=52255723016,是头条号【北青网】的主页。主页上展示其发布的文章列表。点击文章标题链接,可进入文章详情页,查看文章正文(文字+图片)。

 

采集字段

文章标题、文章链接、发布时间、阅读数、评论数等字段。

 

 

鼠标放到图片上,右键,选择【在新标签页中打开图片】可查看高清大图

下文其他图片同理 

 

采集结果

采集结果可导出为Excel,CSV,HTML,数据库等多种格式。导出为Excel示例:

 

 

教程说明

本篇制作时间:2020/4/29    八爪鱼版本:V8.1.8

如果因网页改版造成网址或步骤无效,无法收集到目标数据,请联系官方客服,我们将及时修正。

 

采集步骤

步骤一:打开网页

步骤二、创建【循环列表】,采集所有文章列表中的数据

步骤三、点击进入文章详情,采集文章正文

步骤四、编辑字段

步骤五、设置页面滚动

步骤六、启动采集

 

以下为具体步骤:

 

步骤一、打开网页

 

在首页【输入框】中输入目标网址 https://www.toutiao.com/c/user/52255723016/#mid=52255723016,点击【开始采集】,八爪鱼自动打开网页。

 

 

特别说明:

a. 打开网页后,如果开始开始【自动识别】,请点击【不再自动识别】或【取消识别】将其关掉。因为本文不适合使用【自动识别】。

b. 【自动识别】适用于自动识别网页上的列表、滚动和翻页,识别成功后直接启动采集即可获取数据。详情点击查看 【自动识别】教程

c. 可以根据需求,更换头条号的网址。

 

步骤二、创建【循环列表】,采集所有文章列表中的数据

 

通过以下连续4步完成:

1、选中页面上1个文章列表(注意一定要选中整个列表,包含所有所需字段) 

2、在黄色操作提示框中,点击【选中子元素】

3、点击【选择全部】

4、点击【采集数据】

 

 

特别说明:

a. 经过以上连续4步,【循环-提取数据】创建完成。【循环】中的项,对应着页面上所有文章列表,【提取数据】中的字段,对应着每个文章列表中的字段。启动采集以后,八爪鱼就会按照循环中的顺序依次提取每个列表中的字段。 

b. 为何通过以上4步,可建立【循环-提取数据】?详情点击查看 列表数据采集教程 

 

步骤三、点击文章链接进入详情页,采集正文和图片

 

1、点击文章链接进入详情页

在当前文章列表中(在网页中用红色框框起来),选中文章标题,在操作提示框中点击【点击该链接】,点击后自动进入该文章详情页。

 

 

特别说明:

a. 一定要在当前文章列表中选中文章链接做【点击该链接】,否则【点击元素】步骤无法与【循环】中的文章列表产生联动,会一直重复点击某一条文章链接,进入其文章详情页,无法实现依次点击每个文章链接。

b. 如何找到当前文章列表?在【循环列表】中查看当前项(蓝色背景),然后点击【提取列表数据】,网页中被红色框框起来的就是当前文章列表。

 

2、采集文章详情页中的字段

选中页面中的文本,然后在操作提示框中,点击【采集该元素文本】。

文本类字段都可以按照这样的方式提取。示例中我们提取了文章标题、作者、发布时间、正文等字段。

 

 

特别说明:

a. 文本、图片、视频、源码是不同的数据形式,在操作提示框选择提取方式时稍有不同。文本一般为【采集该元素文本】,图片一般为【采集该图片地址】,更多提取方式请点击查看  不同数据类型(文本、图片、链接、源码等)的抓取方式 教程

 

3、建立【循环列表】,提取正文内所有图片地址

 

一篇文章内可能有多张图片,通过以下几步,采集文章内的所有图片地址:

① 选中一张图片

② 在黄色操作提示框中,选择【选中全部】

③ 选择【采集以下图片地址】

 

 

特别说明:

a. 经过以上连续3步,【循环-提取数据】创建完成。【循环】中的项,对应着页面上所有图片,【提取数据】中的字段,对应着每个图片的图片地址。启动采集以后,八爪鱼就会按照循环中的顺序依次提取每个图片地址。 

b。为何通过以上3步,可建立【循环-提取数据】?点击查看 列表数据采集教程 

 

步骤四、编辑字段

 

进入【提取数据】设置页面,可删除多余字段,修改字段名,移动字段顺序等。

 

 

步骤五、设置页面滚动

 

打开头条号网页后,向下滚动页面加载出更多文章列表,在八爪鱼中也需进行滚动设置。

进入【打开网页】下方高级设置页面,点开【页面滚动】,滚动方式为【滚动到底部】,【滚动次数】为10次,【每次间隔】0.5秒 并保存。

 

 

特别说明:

a. 设置中的滚动次数和时间间隔,请根据采集需求和网页加载情况进行设置,并非是一成不变的,具体请点击查看 处理滚动加载数据的网页教程

 

步骤六、启动采集

 

1、单击【采集】并【启动本地采集】。启动后八爪鱼开始自动采集数据。今日头条可能会出现滑块验证等情况,建议结合左上角的【暂停】功能,手动验证后,点击【继续】,即可开始采集。

 

  

特别说明:

a. 【本地采集】是使用自己的电脑进行采集,【云采集】是使用八爪鱼提供的云服务器采集,点击查看 本地采集与云采集详解

 

2、采集完成后,选择合适的导出方式导出数据。支持导出为Excel、CSV、HTML、数据库等。这里导出为Excel。数据示例: