现已可用MAP API

先发现网站。再规划抓取。

Map 从公开 sitemap、robots 和页面链接信号中发现站点结构,并返回去重后的 URL 集合,用于下游采集规划。

Sitemap 与 robots 发现
渲染页面链接发现
带来源上下文的去重 URL 结果

Map 具有当前生产证据

可用性和限制取决于账户、环境、目标来源以及当前产品文档中的配置。

接口
/api/v1/map
输入
一个或多个公开入口 URL
输出
发现 URL + Map 产物
请求示例
POST /api/v1/map
{
  "url": "https://example.com"
}
预期响应结构
{
  "status": "queued",
  "job_id": "...",
  "artifacts": { "links": "..." }
}

能力

执行前先发现

把未知域名转化为明确范围,再进行过滤、复核并交给有边界的下游任务。

01

多种发现信号

组合公开 sitemap、robots 和渲染页面链接,而不是假设单一信号完整。

02

带来源上下文的链接

保留 URL 的发现方式,使下游规划不会丢失来源上下文。

03

抓取前范围

在更昂贵的多页面采集前筛选并优先处理高价值路径。

工作流程

Map 如何进入工作流

先用发现定义范围,再决定站点哪些部分值得深度采集。

01

入口

提交公开起始 URL。

02

发现

读取可用 sitemap、robots 和页面链接信号。

03

标准化

去重并标准化发现的 URL 集合。

04

规划

把 Map 过滤为需要 Fetch、Crawl、Track 或复核的路径。

使用场景

常见 Map 工作流

Crawl 规划

在多页面采集前识别相关 URL 家族。

内容盘点

理解公开内容在域名中的组织方式。

变化发现

比较 Map 快照,识别新增或删除的公开路径。

常见问题

在扩大采集前先理解数据源。

用 Map 把域名转成可复核范围,再把相关路径送入下一阶段。