01
有边界遍历
通过明确页面与深度限制,让采集保持可理解和可控制。
Crawl 面向需要多页面采集的工作流。在完成更广泛生产验证前,它保持设计合作伙伴预览状态。
可用性和限制取决于账户、环境、目标来源以及当前产品文档中的配置。
POST /api/v1/crawl
{
"url": "https://example.com/docs",
"limit": 50
}{
"status": "queued",
"job_id": "...",
"coverage": "pending"
}能力
目标是拥有清晰范围、进度、重试策略和停止条件的采集任务,而不是承诺无限爬虫。
通过明确页面与深度限制,让采集保持可理解和可控制。
把多页面工作表示为可以重试、对账和观察的任务。
当验收标准不满足时,让页面或任务保持失败或未完成状态。
工作流程
执行前定义范围,采集结束后验证覆盖。
从已批准入口或过滤后的 Map 结果开始。
设置文档化的遍历和页面限制。
通过配置的 Worker 处理页面并记录任务状态。
复核失败、覆盖、产物和下游验收结果。
使用场景
采集公开文档网站的明确栏目。
在完成发现后采集有边界的列表页面集合。
按约定频率刷新定义明确的公开来源集合。
常见问题
带上有边界工作负载和验收标准,在成为生产依赖前验证行为。