网站全站链接提取 · Sitemap URL Extractor avatar

网站全站链接提取 · Sitemap URL Extractor

Pricing

$5.00 / 1,000 解析一个 sitemaps

Go to Apify Store
网站全站链接提取 · Sitemap URL Extractor

网站全站链接提取 · Sitemap URL Extractor

输入域名,自动读取 sitemap.xml 并递归展开 sitemap 索引,支持 .gz 压缩 sitemap,输出全站 URL、lastmod、changefreq、priority。适合 SEO 排查、站点迁移盘点、爬虫种子准备。Sitemap parser, website URL list, SEO audit tool.

Pricing

$5.00 / 1,000 解析一个 sitemaps

Rating

0.0

(0)

Developer

Li Sun

Li Sun

Maintained by Community

Actor stats

0

Bookmarked

2

Total users

1

Monthly active users

20 hours ago

Last modified

Share

网站全站链接提取(Sitemap & URL Extractor)

给一个网站地址,自动找到它的 sitemap,输出全站 URL 清单(含最后修改时间、更新频率、优先级)。

它会做什么

  1. 先读 robots.txt,取里面声明的 sitemap(这是最可靠的入口)
  2. 再试常见位置:/sitemap.xml、/sitemap_index.xml、/sitemap-index.xml、/sitemap/sitemap.xml
  3. 遇到 sitemap 索引(一个 sitemap 里套多个 sitemap)会递归展开
  4. 支持 .gz 压缩的 sitemap 与 gzip 传输(很多大站都是这样,未处理会拿到乱码)

输出字段

字段说明
url页面地址
lastmod最后修改时间(若站点提供)
changefreq更新频率(若提供)
priority优先级(若提供)
sourceSitemap这条 URL 是从哪个 sitemap 文件里读到的

在 Apify 控制台 Export 可一键导出 CSV / Excel / JSON。

典型用途

  • SEO 排查:拿到全站 URL 清单,检查收录、找失效页、比对新旧版本
  • 迁移前盘点:换域名/改版前,先把现有 URL 全量导出
  • 内容审计:统计站点规模、按 lastmod 找长期未更新的页面
  • 给爬虫准备种子:把 sitemap 变成抓取任务清单

输入参数

参数默认说明
startUrls—网站地址(首页即可),支持多个
maxSitemaps20最多解析几个 sitemap(超大站点会分成上千个,用它控额度)
maxUrls5000最多输出多少条 URL
respectRobots开读 robots.txt(同时也从里面取 Sitemap 声明)

计费

按成功解析的 sitemap 文件数计费(sitemap-parsed 事件)。取不到或解析失败的 sitemap 不计费。

使用边界

  • 只读取公开的 sitemap 与 robots.txt,不做任何登录或绕过。
  • 内置轻微限速(每个 sitemap 间隔 0.2 秒),不做并发轰炸。
  • 请遵守目标网站的服务条款。

已知限制

  • 站点没有 sitemap 时无法工作(这不是抓取器,不会去爬遍全站找链接)。若对方 robots.txt 与常见路径都没有声明,结果就是空——这是正常的,不是故障。
  • 部分站点会限制 sitemap 抓取(例如维基百科对非浏览器 UA 返回 403 Sitemap Restricted),这类站点拿不到数据。
  • lastmod / priority 只有站点自己写了才有;很多站点不写。