第一步:发现模板
用户提出采集、抓取或提取网页数据的需求时,先调用search_templates,不要在缺少有效 templateName 和业务参数时直接执行任务。
recommendedTemplateName,或选择 executionMode 包含 Cloud 的模板。确定模板后用 id 或 slug 精确查询,取得完整 inputSchema、outputSchema 和可能存在的根级 sourceOptions。
第二步:校验参数
使用inputSchema[].field 组装参数,并通过 validateOnly: true 预检:
canExecuteNow、blockingIssues 和 nextAction。如果 status 为 awaiting_source_selection,根据返回的 sourceOptions 继续选择依赖项,再次预检。
source-backed 字段传选项的
key;MultiInput 字段始终传字符串数组。parameters 在原始 MCP 接口中是 JSON 对象字符串。第三步:运行任务
预检通过后,以同一组参数调用execute_task,移除 validateOnly 或设为 false。
- 客户端支持 MCP Tasks:优先使用 Task 模式,并通过
tasks/get跟踪状态、通过tasks/result获取最终执行结果。 - 客户端不支持 MCP Tasks:调用会在创建并启动成功后返回
accepted和八爪鱼taskId;等待约 10-30 秒后使用export_data轮询。
targetMaxRows。它会在采集数量达到阈值后尽力停止,可能略有超出;0 或省略表示让任务自然结束。
第四步:预览和导出
支持 MCP Tasks 时,先等待 Task 达到成功终态,再调用:export_data 返回 collecting 或 exporting 时,等待 10-30 秒后重试。返回 sampleData 时以表格展示;存在 exportFileUrl 时始终向用户提供下载地址。
模板串联
模板的outputSchema 描述可采集字段。这些字段可以作为后续模板的候选输入,用于构建多步采集流程;每一步仍应单独完成精确模板查询和 validateOnly 预检。
其他工作流
以下流程是同一个 MCP 服务针对不同任务场景的工具分工,可以按业务需要串联使用:- 已有任务:
search_tasks→start_or_stop_task→export_data - 数据中心存量检索:
list_platforms→ 从实时清单选择domain→search_platform_content。需要限定来源时,把域名传给include或exclude,不要填写平台展示名称;该流程直接查询提前采集的数据,不会创建新的采集任务 - 电商评论:
ecommerce_data_task→query_collected_reviews
execute_task、export_data