设计合作伙伴预览CRAWL API · 设计合作伙伴预览

采集多个页面。让遍历保持有边界。

Crawl 面向需要多页面采集的工作流。在完成更广泛生产验证前,它保持设计合作伙伴预览状态。

有边界多页面任务
重试与队列控制
任务状态与产物交付

Crawl 当前为预览能力

可用性和限制取决于账户、环境、目标来源以及当前产品文档中的配置。

接口
/api/v1/crawl
输入
入口 URL + 文档化边界
输出
任务状态 + 每页产物
请求示例
POST /api/v1/crawl
{
  "url": "https://example.com/docs",
  "limit": 50
}
预期响应结构
{
  "status": "queued",
  "job_id": "...",
  "coverage": "pending"
}

能力

具有明确限制的遍历

目标是拥有清晰范围、进度、重试策略和停止条件的采集任务,而不是承诺无限爬虫。

01

有边界遍历

通过明确页面与深度限制,让采集保持可理解和可控制。

02

队列驱动执行

把多页面工作表示为可以重试、对账和观察的任务。

03

真实的部分失败

当验收标准不满足时,让页面或任务保持失败或未完成状态。

工作流程

如何设计 Crawl 工作流

执行前定义范围,采集结束后验证覆盖。

01

定义范围

从已批准入口或过滤后的 Map 结果开始。

02

设定边界

设置文档化的遍历和页面限制。

03

采集

通过配置的 Worker 处理页面并记录任务状态。

04

对账

复核失败、覆盖、产物和下游验收结果。

使用场景

适合预览验证的场景

文档集合

采集公开文档网站的明确栏目。

目录研究

在完成发现后采集有边界的列表页面集合。

知识库刷新

按约定频率刷新定义明确的公开来源集合。

常见问题

先证明范围,再承诺规模。

带上有边界工作负载和验收标准,在成为生产依赖前验证行为。