网页正文转 Markdown · Web Page to Clean Markdown avatar

网页正文转 Markdown · Web Page to Clean Markdown

Pricing

$8.00 / 1,000 转换一个页面

Go to Apify Store
网页正文转 Markdown · Web Page to Clean Markdown

网页正文转 Markdown · Web Page to Clean Markdown

输入网址,自动剥离导航、广告、脚本、侧栏,输出干净 Markdown 正文,保留标题层级、列表、代码块、引用、链接。喂给 AI 做摘要、RAG 知识库、语料清洗之前先洗一遍。HTML to Markdown, article extractor, LLM ready text.

Pricing

$8.00 / 1,000 转换一个页面

Rating

0.0

(0)

Developer

Li Sun

Li Sun

Maintained by Community

Actor stats

0

Bookmarked

2

Total users

1

Monthly active users

20 hours ago

Last modified

Share

网页正文转 Markdown

给一个网址,输出干净的 Markdown 正文:自动剥离导航、广告、侧边栏、页脚、脚本与样式。

解决什么问题

把网页喂给 AI 之前,你拿到的是一整页 HTML:菜单、广告、cookie 提示、相关推荐全都混在正文里。 直接丢给模型,既浪费 token,又污染结果。这个工具只留正文。

输出字段

字段说明
url页面地址
title页面标题
markdown干净的正文 Markdown
chars正文字符数
truncated是否因超长被截断
stats质量指标:块数、字符数、段落数、标点数的原始统计
fetchedAt抓取时间

在 Apify 控制台 Export 可导出 JSON / CSV。

还原能力

  • 标题层级 → # ## ###
  • 列表 → -(支持缩进层级)
  • 代码块 → 三反引号围栏
  • 引用 → >
  • 链接 → [文字](绝对地址)(相对地址自动补全)
  • 图片 → ![说明](地址)(可选)

会主动丢弃:<script> <style> <nav> <footer> <aside> <form> <iframe> <button> 与 HTML 注释、<head> 内容。

典型用途

  • RAG / 知识库:先把网页洗成 Markdown 再切片入库,检索质量明显更好
  • AI 摘要与翻译:去掉噪声再喂模型,省 token 也更准
  • 语料清洗:批量把网页转成训练/微调语料
  • 存档:把网页正文存成可读、可版本管理的纯文本

输入参数

参数默认说明
urls—要转换的网页,支持多个
includeLinks开保留超链接
includeImages关保留图片
maxChars100000单页输出上限

计费

按成功转换的页面数计费(page-converted 事件)。抓取失败的页面不计费。

已知限制(请先读这段再评估是否适用)

做的好的:常规文章页、文档页、博客页。实测:

  • docs.python.org 教程页 → 20415 字符,开头就是正文("In the following examples...")
  • gnu.org 哲学文章 → 从 34K 降到 29K,页头/语言选择器/站点导航被切掉
  • 合成测试页 → 标题层级、列表、代码块、引用、链接全部正确还原

做不好的(诚实说明,避免误用):

  1. 极短页面的目录切不干净。 当页面正文与导航体量接近时(例如 PEP 页这种一屏短文), 开头的 "Table of Contents" 可能残留。原因:正文判定靠"文本密度 vs 链接占比", 导航和正文一样大时无法可靠区分。
  2. 完全依赖前端 JS 渲染的页面(单页应用) 拿到的 HTML 里没有正文,结果会偏空—— 这类页面需要浏览器渲染型抓取器。
  3. 正文内部嵌的复杂组件(评分卡、相关推荐、评论区)可能残留一部分。
  4. 不做 OCR;表格保留为文本行,不还原成 Markdown 表格。

如果你要处理的是大批量同类页面,建议先用少量样本跑一遍看效果,再决定是否批量。