网站全站链接提取 · Sitemap URL Extractor
Pricing
$5.00 / 1,000 解析一个 sitemaps
Go to Apify Store

网站全站链接提取 · Sitemap URL Extractor
输入域名,自动读取 sitemap.xml 并递归展开 sitemap 索引,支持 .gz 压缩 sitemap,输出全站 URL、lastmod、changefreq、priority。适合 SEO 排查、站点迁移盘点、爬虫种子准备。Sitemap parser, website URL list, SEO audit tool.
Pricing
$5.00 / 1,000 解析一个 sitemaps
Rating
0.0
(0)
Developer
Li Sun
Maintained by CommunityActor stats
0
Bookmarked
2
Total users
1
Monthly active users
20 hours ago
Last modified
Categories
Share
网站全站链接提取(Sitemap & URL Extractor)
给一个网站地址,自动找到它的 sitemap,输出全站 URL 清单(含最后修改时间、更新频率、优先级)。
它会做什么
- 先读
robots.txt,取里面声明的 sitemap(这是最可靠的入口) - 再试常见位置:
/sitemap.xml、/sitemap_index.xml、/sitemap-index.xml、/sitemap/sitemap.xml - 遇到 sitemap 索引(一个 sitemap 里套多个 sitemap)会递归展开
- 支持 .gz 压缩的 sitemap 与 gzip 传输(很多大站都是这样,未处理会拿到乱码)
输出字段
| 字段 | 说明 |
|---|---|
url | 页面地址 |
lastmod | 最后修改时间(若站点提供) |
changefreq | 更新频率(若提供) |
priority | 优先级(若提供) |
sourceSitemap | 这条 URL 是从哪个 sitemap 文件里读到的 |
在 Apify 控制台 Export 可一键导出 CSV / Excel / JSON。
典型用途
- SEO 排查:拿到全站 URL 清单,检查收录、找失效页、比对新旧版本
- 迁移前盘点:换域名/改版前,先把现有 URL 全量导出
- 内容审计:统计站点规模、按 lastmod 找长期未更新的页面
- 给爬虫准备种子:把 sitemap 变成抓取任务清单
输入参数
| 参数 | 默认 | 说明 |
|---|---|---|
startUrls | — | 网站地址(首页即可),支持多个 |
maxSitemaps | 20 | 最多解析几个 sitemap(超大站点会分成上千个,用它控额度) |
maxUrls | 5000 | 最多输出多少条 URL |
respectRobots | 开 | 读 robots.txt(同时也从里面取 Sitemap 声明) |
计费
按成功解析的 sitemap 文件数计费(sitemap-parsed 事件)。取不到或解析失败的 sitemap 不计费。
使用边界
- 只读取公开的 sitemap 与 robots.txt,不做任何登录或绕过。
- 内置轻微限速(每个 sitemap 间隔 0.2 秒),不做并发轰炸。
- 请遵守目标网站的服务条款。
已知限制
- 站点没有 sitemap 时无法工作(这不是抓取器,不会去爬遍全站找链接)。若对方 robots.txt 与常见路径都没有声明,结果就是空——这是正常的,不是故障。
- 部分站点会限制 sitemap 抓取(例如维基百科对非浏览器 UA 返回
403 Sitemap Restricted),这类站点拿不到数据。 lastmod/priority只有站点自己写了才有;很多站点不写。