一、按整条数据去重(默认)
在数据采集完成后,系统有一套默认的去重机制:某一行数据(一行数据即一条数据)的全部字段内容与其他行内全部字段内容都相同,则认为该行数据是重复数据,去重后仅保留重复数据中的第1条。 例1:第1、4条数据全部字段内容都相同,它们是重复数据,去重后仅保留第1条数据。
二、按字段去重(需手动设置)
在制作采集规则时,可以设置按字段去重:根据用户选择的某个或多个字段,比对某一行数据该字段的内容与其他行该字段的内容是否相同。仅比对已选择的字段,只要选择的字段都是相同的,就认为该条数据是重复数据,其他未选择的字段会自动忽略,即使其他字段内容是不相同的也不进行考虑。去重后仅保留重复数据中的第1条。 例1:选择【字段2】为对比字段,第1、2、4条数据的【字段2】内容相同,则第1、2、4条数据为重复数据,去重后仅保留第1条数据。

三、按字段去重实例
采集需求: 采集微博某个博主的最新博文,采集字段如下图所示。要求每小时采集一次,并且每次要过滤掉之前已经采集过的博文。



特别说明: 云采集数据去重时,只会对比相同去重条件的历史数据,从而对新数据进行去重。 例如: 设置去重条件是A(选择【字段1】作为对比去重条件),得到第1批云采集数据。 修改去重条件为B(选择【字段2】作为对比去重条件),得到第2批云采集数据。则第2批云采集数据不会和第1批云采集数据进行对比去重。 再将去重条件改为A(选择【字段1】作为对比去重条件),得到第3批云采集数据。则第3批云采集数据将和第1批云采集数据进行对比去重,自动删除重复数据,但不会和第2批云采集数据进行对比去重。作者:Tina
