按你的场景选择路径:新 URL 先用开始前请已完成 安装 与 登录。 采集需要登录的网站时,还需先完成 用户浏览器配置,并确认detect生成任务文件,已有任务使用run <taskId>。采集完成后统一通过data export导出数据。
browser status --json 返回 readyForUserBrowserRun: true。
路径一:让 Agent 生成并试采任务
LLM 或 Agent 创建任务时,推荐使用可信的本地 Agent 运行器,并立即采集少量样品验证质量:--agent-command 是本地 shell 命令,不是自然语言提示。detect --agent 不需要 --yes;旧脚本传入时仍会被兼容。--run-sample 只支持 --agent 且必须为正整数。命令返回单个 JSON envelope;任务生成结果与样品采集结果应分别检查,尤其是 sampleRun.exitCode 和 sampleRun.summary。
路径二:直接操作 CLI 生成并运行任务
如果没有现成任务,先检测网页并生成任务文件:--auto 适合用户直接操作 CLI。detect 会分析列表页、详情页与分页逻辑,但不会直接执行采集。v0.1.32 遇到验证码、访问限制或安全验证页面会在生成任务前提前失败;先处理网站验证或访问限制,再重新检测。v0.1.25 起,detect 生成的普通任务还会自动同步到八爪鱼桌面客户端任务列表,你可以在客户端中查看和编辑后再运行。v0.1.27 对 DOM 候选弱的 API 支撑列表页会优先生成 api_list 本地任务,这类任务当前不自动同步云端。
采集需要登录的页面
v0.1.30 可复用 Chrome / Edge 用户 Profile。首次安装扩展并启用用户模式后,为依赖登录状态的 detect 和 run 指定同一个浏览器与 Profile:bazhuayu browser use user 保存默认模式,可以省略这些浏览器参数。用户模式不支持 --headless。
detect → 客户端编辑 → 采集
路径三:运行已有任务
先列出任务:taskId)。
查看与校验任务:
导出数据
查看历史、计数和样例数据:xlsx、csv、html、json、xml。--unexported 只读取云端未导出数据,不会自动把这些数据标记为已导出。
下一步
网页检测与任务生成
查看
bazhuayu detect 的模式、参数与迁移说明。运行采集任务
本地或云端运行已有任务和任务文件。
浏览器管理
配置登录状态复用和多 Profile 切换。
