> ## Documentation Index
> Fetch the complete documentation index at: https://www.bazhuayu.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 【百度】搜索结果采集

**一、采集场景**

在百度首页 [https://www.baidu.com/](https://www.baidu.com/)  输入关键词搜索，采集搜索后得到的搜索结果。

<img src="https://mintcdn.com/bazhuayu/YYF9fsAWuaMQhYsw/assets/academy/case-studies/baidu-search-results/01-653b711d59bf0.png?fit=max&auto=format&n=YYF9fsAWuaMQhYsw&q=85&s=8700d626f194ed96e629b817eb34ee30" alt="【百度】搜索结果采集" width="1196" height="849" data-path="assets/academy/case-studies/baidu-search-results/01-653b711d59bf0.png" />

 

 

**二、采集字段**

标题、网页链接、简介

 

**三、采集结果**

采集结果可导出为Excel，CSV，HTML，数据库等多种格式。导出为Excel示例：

<img src="https://mintcdn.com/bazhuayu/YYF9fsAWuaMQhYsw/assets/academy/case-studies/baidu-search-results/02-653b712ab79d6.png?fit=max&auto=format&n=YYF9fsAWuaMQhYsw&q=85&s=6f295d1cdfc80bc965067cabec00a2bf" alt="【百度】搜索结果采集" width="1128" height="615" data-path="assets/academy/case-studies/baidu-search-results/02-653b712ab79d6.png" />

 

**教程说明**

 八爪鱼版本：V8.5.2

如果因网页改版造成网址或步骤无效，无法采集到目标数据，请联系官方客服，我们将及时修正。

 

**四、采集步骤**

步骤一、打开网页

步骤二、批量输入多个关键词并搜索

步骤三、创建【循环翻页】，采集多页数据

步骤四、创建【循环列表】，采集所有搜索结果中的数据

步骤五、编辑字段，修改字段的Xpath

步骤六、启动采集

 

**以下为具体步骤：**

** **

#### 步骤一、打开网页

 

在首页【输入框】中输入目标网址 [https://www.baidu.com/](https://www.baidu.com/)，点击【开始采集】，八爪鱼自动打开网页。

<img src="https://mintcdn.com/bazhuayu/YYF9fsAWuaMQhYsw/assets/academy/case-studies/baidu-search-results/03-653b71458269c.gif?s=51f2fc2159eb467ea2f1147a9c4afd77" alt="【百度】搜索结果采集" width="1200" height="800" data-path="assets/academy/case-studies/baidu-search-results/03-653b71458269c.gif" />

特别说明：

* a. 打开网页后，如果开始开始【自动识别】，请点击【不再自动识别】或【取消识别】将其关掉。因为本文不适合使用【自动识别】。
* b. 【自动识别】适用于自动识别网页上的列表、滚动和翻页，识别成功后直接启动采集即可获取数据。详情点击查看 [【自动识别】教程](https://www.bazhuayu.com/helpcenter/docs/eeI3gE)

 

#### 步骤二、批量输入多个关键词并搜索

 1.批量输入多个关键词

选中百度搜索框，在操作提示框中，点击【输入文本】-【批量输入文本】

<video controls src="http://1251101074.vod2.myqcloud.com/8cc84bf5vodgzp1251101074/8aeb13a25145403696624430456/OOHaew7Cg50A.mp4" width="100%" />

2.点击检索

点击网页上的【百度一下】设置点击检索步骤

<video controls src="http://1251101074.vod2.myqcloud.com/fbbb38d8vodcq1251101074/68beb2065145403696627066209/PWaFhUD4ilEA.mp4" width="100%" />

 

#### 步骤三、创建【循环翻页】，采集多页数据

 

1、建立【循环翻页】

如果只是采集一页数据，可跳过此步骤。

如果需要翻页以采集多页数据：选择页面中的【下一页>】按钮，在操作提示上单击【循环点击下一页】，创建【循环翻页】。

进入【点击翻页】设置页面，**勾选【执行前等待】，时间选择****5s****；【****Ajax****超时**\*\*】，时间选择****10s****，设置好之后保存。\*\*

<video controls src="http://1251101074.vod2.myqcloud.com/fbbb38d8vodcq1251101074/30c1e4955145403696626964875/TTRqOhveEFUA.mp4" width="100%" />

特别说明：

* a. 创建【循环翻页】后，八爪鱼会自动点击【下一页】按钮进行翻页，从第1页，第2页......直到最后1页。如果只需采集特定页的数据，可在八爪鱼中设置循环翻页的次数，详情点击查看  [翻页以采集多页数据教程](/docs/zh/academy/basic-collection/pagination/next-page-button)。
* b. 执行前等待，即在执行此步骤前等待一段时间，可有效避免因网页未加载完全导致的漏数据，详情点击查看 [执行前等待使用场景与设置方法](https://www.bazhuayu.com/helpcenter/docs/zigIaV)

 

2、修改【循环翻页】的XPath

默认的【循环翻页】XPath会在第二页，重复翻页至第一页，导致不断重复采集第一页的数据，需修改【循环翻页】XPath。

进入【循环翻页】设置页面，修改XPath为：//span\[contains(text(),'下一页')]/..

<video controls src="http://1251101074.vod2.myqcloud.com/8cc84bf5vodgzp1251101074/10eb2d885145403696636400939/05TTCCldKAYA.mp4" width="100%" />

 

特别说明：

* a.为什么要修改【循环翻页】的XPath？这是因为，当翻到第2页的时候，软件自动生成的 XPath `//A[@class="n"]` 定位到的是 `【&lt;上一页】` 按钮。那么，八爪鱼采集器在执行的时候，会点击 `【&lt;上一页】` 按钮，回到第一页，然后又点击 `【下一页&gt;】` 按钮翻到第2页，造成的现象就是会重复采集第一页和第二页的数据。这么修改 XPath，需要一定的 XPath 知识，点击查看 [XPath学习与实例教程](https://www.bazhuayu.com/helpcenter/docs/V2h1Ec) 。

 

#### 步骤四、创建【循环列表】，采集所有搜索结果中的数据

 

**1、创建【循环列表】**

 

①、选中页面上1条不是广告的搜索结果（注意一定要选中一条搜索结果的整个列表，包含所有所需字段） 

②、继续选中页面上另1条不是广告的搜索结果

③、在操作提示框中，点击【采集以下元素文本】

经过以上操作后，整块列表作为一个字段提取下来。

 

特别说明：

* a. 经过以上连续4步，【循环-提取数据】创建完成。【循环】中的项，对应着页面上所有评价列表，【提取数据】中的字段，对应着每个评价列表中的字段。启动采集以后，八爪鱼就会按照循环中的顺序依次提取每个列表中的字段。
* b. 为何通过以上4步，可建立【循环-提取数据】？详情点击查看 [列表数据采集教程 ](https://www.bazhuayu.com/helpcenter/docs/RXxvh9)。

 

 

**2、提取字段**

 

以上将整块列表作为一个字段提取。我们可以手动将标题、网页链接、简介字段单独提取出来。

先找到当前搜索结果列表（流程中当前步骤为【提取列表数据】时，当前项在网页上以红色框框起来），然后：

<video controls src="http://1251101074.vod2.myqcloud.com/8cc84bf5vodgzp1251101074/2f50197f5145403696640401718/UCR6emXD1BcA.mp4" width="100%" />

【标题】：选中标题，在操作提示框中点击【文本内容】。

【简介】：选中简介，在操作提示框中点击【文本内容】。

【网页链接】：选中标题，然后点击操作提示的【a】,在操作提示框中点击【链接地址】。

<video controls src="http://1251101074.vod2.myqcloud.com/8cc84bf5vodgzp1251101074/6f859b2e5145403696644991157/rHAnaYVAsgUA.mp4" width="100%" />

特别说明：

* a. 一定要在当前搜索结果列表中提取字段，否则字段提取无法与【循环列表】产生联动，会重复采集某一条列表中的字段。
* b. 当网页层级在A标签时，操作提示框中才会有采集链接的提示。如果不在A标签层级，可以通过点击**操作提示框右下角的扩大选项按钮  **来调整选中的层级，但调整范围也是仅限于红框区域内，不可超出这个红框。

 

#### 步骤五、编辑字段，修改字段的XPath

 

1、编辑字段

进入【提取列表数据】设置页面，可删除多余字段，修改字段名，移动字段顺序等。

<video controls src="http://1251101074.vod2.myqcloud.com/8cc84bf5vodgzp1251101074/666e69c45145403696651333870/X11WWA8GsWAA.mp4" width="100%" />

 

2、修改字段XPath

为了精准采集到所有搜索结果中的字段，需修改字段的定位XPath。

进入【提取列表数据】设置页面，将【简介】字段的XPath修改为：//div\[contains(@class,'clamp-2')],备用元素选择【相对xpath】://div\[contains(@class,'clamp-3')]然后点击【应用】。

<video controls src="http://1251101074.vod2.myqcloud.com/fbbb38d8vodcq1251101074/05b789215145403696660336162/P9G4WuWS434A.mp4" width="100%" />

特别说明：

* a. 在【提取列表数据】步骤里面的【简介】字段。在采集时发现有问题，有字段错位的现象存在，即采集的内容不是【简介】的内容，这是由于字段的XPath定位不准确的缘故，需修改其定位XPath。这里需要一定的XPath知识。点击查看 [XPath学习与实例教程](https://www.bazhuayu.com/helpcenter/docs/V2h1Ec) 。

 

#### 步骤六、启动采集

 

1、单击【采集】并【启动本地采集】。启动后八爪鱼开始自动采集数据。

<img src="https://mintcdn.com/bazhuayu/YYF9fsAWuaMQhYsw/assets/academy/case-studies/baidu-search-results/04-653b71d822b4c.gif?s=b888898d6966265affb722fdde0e5c90" alt="【百度】搜索结果采集" width="1200" height="800" data-path="assets/academy/case-studies/baidu-search-results/04-653b71d822b4c.gif" />

特别说明：

* a.【本地采集】是使用自己的电脑进行采集，【云采集】是使用八爪鱼提供的云服务器采集，点击查看[本地采集与云采集详解](https://www.bazhuayu.com/helpcenter/docs/2xF5Mz)。

 

2、采集完成后，选择合适的导出方式来导出数据。支持导出为Excel，CSV，HTML，数据库等。这里导出为Excel。数据示例：

<img src="https://mintcdn.com/bazhuayu/YYF9fsAWuaMQhYsw/assets/academy/case-studies/baidu-search-results/05-653b71e1b8d26.png?fit=max&auto=format&n=YYF9fsAWuaMQhYsw&q=85&s=2b752146896138e998b6b03598f66bb5" alt="【百度】搜索结果采集" width="1128" height="615" data-path="assets/academy/case-studies/baidu-search-results/05-653b71e1b8d26.png" />
