> ## Documentation Index
> Fetch the complete documentation index at: https://www.bazhuayu.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 采集原理/逻辑

> 采集原理/逻辑教程，来自八爪鱼帮助中心「操作指南 / 基本采集」。

经过前几课的学习，我们已经掌握了<a href="/docs/zh/academy/basic-collection/beginner/list-collection" target="_blank" rel="noopener noreferrer">列表数据</a>、<a href="/docs/zh/academy/basic-collection/beginner/list-to-detail" target="_blank" rel="noopener noreferrer">点击多个链接后的详情页数据</a>、<a href="/docs/zh/academy/basic-collection/beginner/table-collection" target="_blank" rel="noopener noreferrer">表格数据 </a>任务配置方法。

 

在此基础上，本课将详解八爪鱼的采集原理和流程执行逻辑，让大家对八爪鱼采集数据的方法有一个更深入的理解。

 

### **一、八爪鱼采集原理**

 

1、模拟人的行为，通过内置Chrome浏览器浏览网页数据。

 

所以采集数据的第一步永远是找到目标网址并输入。这跟通过普通浏览器访问网页完全一样。

在普通浏览器中需要点击链接进入详情、点击翻页按钮查看更多数据，在八爪鱼中也需如此操作。

 

2、根据网页特性和采集需求，设计采集流程，八爪鱼根据流程全自动采集数据。

 

平常我们浏览网页的动作不会被记录下来。例如：这次在京东上输入关键词【手机】查询相关商品数据，下次还需要输。

 

在用八爪鱼采集数据的时候，我们就需要根据网页特性和采集需求，设计采集流程，将我们的采集需求记录下来。之后八爪鱼就能根据设计好的采集流程，全自动的采集数据。

 

例如：在前几课中学到的，需采集页面上的所有商品列表，我们就做一个【循环-提取数据】的步骤。采集时有很多页，需要翻页，我们就做一个【循环翻页】的步骤。

 

 

### \*\*二、****【****采集****流程****】\*\***执行逻辑**

 

八爪鱼通过【采集流程】全自动采集数据。【采集流程】执行逻辑遵循2个原则：先从上至下、再由内而外。

 

【采集流程】由两大部分组成。如下图一高亮的步骤是会执行的步骤，八爪鱼与网页发生互动。如下图二高亮的步骤起记录网页的作用，不会与网页发生互动。

 

                        <img src="https://mintcdn.com/bazhuayu/K35QhvLCziLtcQgp/assets/academy/basic-collection/collection-logic/01-65a7307cea623.png?fit=max&auto=format&n=K35QhvLCziLtcQgp&q=85&s=b93d83a8ca4c664d000890a695e18aa9" alt="" width="254" height="430" data-path="assets/academy/basic-collection/collection-logic/01-65a7307cea623.png" /> <img src="https://mintcdn.com/bazhuayu/K35QhvLCziLtcQgp/assets/academy/basic-collection/collection-logic/02-65a73085253bd.png?fit=max&auto=format&n=K35QhvLCziLtcQgp&q=85&s=fb43251d4e3ffa8039563ac6acd15615" alt="" width="254" height="430" data-path="assets/academy/basic-collection/collection-logic/02-65a73085253bd.png" />

 

 

 

                                         

来看几个实例，更深入理解【采集流程】执行逻辑。

 

#### 实例1：

       

<img src="https://mintcdn.com/bazhuayu/K35QhvLCziLtcQgp/assets/academy/basic-collection/collection-logic/03-65a77617c2dd4.png?fit=max&auto=format&n=K35QhvLCziLtcQgp&q=85&s=c828853f1d01a52e66c9fa7a3ab3c7a9" alt="" width="844" height="430" data-path="assets/academy/basic-collection/collection-logic/03-65a77617c2dd4.png" />

 

#### 实例2：

 

<img src="https://mintcdn.com/bazhuayu/K35QhvLCziLtcQgp/assets/academy/basic-collection/collection-logic/04-65a786e54a394.png?fit=max&auto=format&n=K35QhvLCziLtcQgp&q=85&s=e401413b5c2f9d99d4f3c1cadb376501" alt="" width="887" height="493" data-path="assets/academy/basic-collection/collection-logic/04-65a786e54a394.png" />

 

#### 实例3：

 

<img src="https://mintcdn.com/bazhuayu/K35QhvLCziLtcQgp/assets/academy/basic-collection/collection-logic/05-65a78bba89cc8.png?fit=max&auto=format&n=K35QhvLCziLtcQgp&q=85&s=379e8dcde73a120fc335df7b2bce6f12" alt="" width="745" height="429" data-path="assets/academy/basic-collection/collection-logic/05-65a78bba89cc8.png" />

 

#### 特别说明：

a. 【采集流程】无固定标准，符合网页本身的跳转逻辑即可。

b. 【采集流程】中可设置多个点击步骤、多个嵌套循环，以实现网页多层级的数据采集。

c. 【采集流程】中的步骤，可以拖动调整位置。鼠标选中步骤并拖住移动至想要的  <img src="https://mintcdn.com/bazhuayu/K35QhvLCziLtcQgp/assets/academy/basic-collection/collection-logic/06-6513eead15ba9.png?fit=max&auto=format&n=K35QhvLCziLtcQgp&q=85&s=d32fec4d948ba1d913198f38a47e3cad" alt="" className="academy-inline-icon" width="30" height="21" data-path="assets/academy/basic-collection/collection-logic/06-6513eead15ba9.png" />位置。

 

<img src="https://mintcdn.com/bazhuayu/K35QhvLCziLtcQgp/assets/academy/basic-collection/collection-logic/07-6513eead409ac.gif?s=09e441253a45fca31ff9e5faa3ce2ba3" alt="" width="611" height="455" data-path="assets/academy/basic-collection/collection-logic/07-6513eead409ac.gif" />

 

 

看到这里的小伙伴，恭喜您已经完成了【自定义配置采集数据】全部的入门课程。现在，您已经掌握基础的数据采集技能啦！

 

如果您有任何的问题与建议，请通过官网右侧QQ、电话、客服系统等多种渠道联系我们！

 

作者：Echo\
编辑：Echo
