Skip to main content
按你的场景选择路径:新 URL 先用 detect 生成任务文件,已有任务使用 run <taskId>。采集完成后统一通过 data export 导出数据。
开始前请已完成 安装登录 采集需要登录的网站时,还需先完成 用户浏览器配置,并确认 browser status --json 返回 readyForUserBrowserRun: true

路径一:让 Agent 生成并试采任务

LLM 或 Agent 创建任务时,推荐使用可信的本地 Agent 运行器,并立即采集少量样品验证质量:
--agent-command 是本地 shell 命令,不是自然语言提示。detect --agent 不需要 --yes;旧脚本传入时仍会被兼容。--run-sample 只支持 --agent 且必须为正整数。命令返回单个 JSON envelope;任务生成结果与样品采集结果应分别检查,尤其是 sampleRun.exitCodesampleRun.summary

路径二:直接操作 CLI 生成并运行任务

如果没有现成任务,先检测网页并生成任务文件:
--auto 适合用户直接操作 CLI。detect 会分析列表页、详情页与分页逻辑,但不会直接执行采集。v0.1.32 遇到验证码、访问限制或安全验证页面会在生成任务前提前失败;先处理网站验证或访问限制,再重新检测。v0.1.25 起,detect 生成的普通任务还会自动同步到八爪鱼桌面客户端任务列表,你可以在客户端中查看和编辑后再运行。v0.1.27 对 DOM 候选弱的 API 支撑列表页会优先生成 api_list 本地任务,这类任务当前不自动同步云端。

采集需要登录的页面

v0.1.30 可复用 Chrome / Edge 用户 Profile。首次安装扩展并启用用户模式后,为依赖登录状态的 detect 和 run 指定同一个浏览器与 Profile:
如果已通过 bazhuayu browser use user 保存默认模式,可以省略这些浏览器参数。用户模式不支持 --headless

detect → 客户端编辑 → 采集

常用检测方式:
需要手动选择候选区域时,先查看候选结果,再生成任务:

路径三:运行已有任务

先列出任务:
从结果中记下 任务 IDtaskId)。 查看与校验任务:
本地运行:
后台运行后可查看、暂停、恢复或停止:
云端运行:

导出数据

查看历史、计数和样例数据:
导出结果:
支持格式:xlsxcsvhtmljsonxml--unexported 只读取云端未导出数据,不会自动把这些数据标记为已导出。

下一步

网页检测与任务生成

查看 bazhuayu detect 的模式、参数与迁移说明。

运行采集任务

本地或云端运行已有任务和任务文件。

浏览器管理

配置登录状态复用和多 Profile 切换。