网页转Markdown,给AI Agent的高质量资料入口
把公开网页URL转换为适合AI Agent理解、检索和使用的干净Markdown。
怎么使用URL转Markdown
输入一个公开网页URL,或者切换到HTML粘贴模式提供已有源码。系统定位正文,提取标题、段落、列表、表格、代码、图片和链接,清理导航、广告、评论、推荐模块以及重复页面外壳。结果生成后,先检查正文边界、来源URL和文章结尾,再复制或下载Markdown。
真实输出和结构保留
简单文章会保留标题、章节和来源。包含表格和代码的博客会尽量保留表头、行列关系、代码围栏和语言提示。中文内容按原文输出,不会因为界面语言切换而被错误翻译。HTML转Markdown的目标是语义结构,不是复制网页的视觉样式。
保留什么,清理什么
保留标题层级、表格、代码块、图片alt和原始URL、正文链接与来源信息。清理导航、广告、评论、推荐、弹窗、Cookie提示和重复页面组件。这样生成的Markdown更适合阅读、检索、引用和交给AI Agent继续处理。
为AI Agent和开发者准备
API适合程序化转换和批量任务,MCP适合让兼容的AI客户端调用工具,CLI适合终端、脚本和CI流程,浏览器插件适合当前浏览器已经渲染的页面。开发者工作流应记录输入URL、状态、解析提示、来源和是否需要人工复核。
Herdown与其他网页解析工具的区别
Firecrawl更偏向开发者网页抓取、渲染和任务编排,JinaAI更偏向远程阅读、搜索和内容提取。Herdown把单页URL、本地文件、多页面Website转Markdown以及API、MCP、CLI放在同一套资料整理工作流里,并强调来源保留、失败反馈和本地文件边界。
支持范围与限制
登录墙、付费墙、验证码、反爬规则、超时和客户端动态渲染都可能使结果不完整。服务不会授予私有页面访问权限,也不会承诺绕过访问控制。遇到这些情况,可以使用浏览器插件,或粘贴你有权访问的HTML源码;扫描版资料应使用本地OCR。
为什么AI工作流适合使用Markdown
HTML包含大量展示标签、脚本和页面外壳,Markdown更容易控制上下文长度和信息顺序。标题、列表、表格、代码块和链接都有清晰边界,检查后的内容可以进入RAG、Prompt、知识库、代码仓库或发布流程。
从输入到交付
根据任务选择:URL转Markdown处理一个公开页面;Website转Markdown处理域名、起始URL或Sitemap下的多个页面;Markdown查看器用于检查结果。确认标题、表格、代码、链接、图片、来源和结尾后,再继续导出HTML、PDF、Word,或进入微信公众号和小红书工具。
已测试的真实输出
以下内容来自实际公开页面转换和本地HTML粘贴测试,展示标题、正文、链接、代码围栏和中文结构如何进入Markdown。每组示例都保留输入和输出,方便用户核对,而不是只展示抽象承诺。
简单公开页面
https://example.com/
Example Domain This domain is for use in documentation examples without needing permission. Avoid use in operations. [Learn more](https://iana.org/domains/example)
标题、正文、链接和来源可以直接检查;页面外壳没有混入结果。源页面很短,因此输出保持短小,不会为了增加词数而编造段落。
技术页面代码摘录
https://developers.cloudflare.com/workers/get-started/guide/
### 1. Create a new Worker project Open a terminal window and run C3 to create your Worker project. ```bash npm create cloudflare@latest -- my-first-worker ```
标题、说明、命令和代码围栏保持分离,开发者可以检查代码语言提示和复制边界。结果是正文结构的摘录,不承诺重建原页面的视觉布局。
中文HTML粘贴测试
# 转换测试 ## 输入与输出 网页正文会保留标题、段落和来源链接。
这个受控HTML测试验证中文标题、段落和层级保持原文,并明确它是本地粘贴测试而不是远程中文页面的冒充结果。
首页常见问题
网页转Markdown免费吗?
公开网页URL可以按照页面显示的免费额度使用,首页和API共用额度,不是无限抓取。
不安装软件也能在线转换吗?
可以,在浏览器中粘贴公开网页URL即可使用,不需要安装或API密钥。
有网页转Markdown浏览器插件吗?
有,当前浏览器已经渲染的页面可以使用插件进行本地提取。
可以HTML转Markdown吗?
可以,已有HTML源码时使用HTML粘贴模式。
为什么有些页面失败?
登录墙、付费墙、验证码、反爬、动态渲染、超时和没有可读正文都可能影响结果。
可以用Python接入吗?
可以通过RESTAPI调用解析接口,并把Markdown保存到本地。
GitHub上有示例吗?
Herdown公开仓库包含CLI、MCP、SDK和开发者文档。
网页转Markdown和Website转Markdown有什么区别?
网页转Markdown处理一个公开URL,Website转Markdown从域名、起始URL或Sitemap抓取多个页面。
我的内容会保存到服务器吗?
HTML粘贴和本地文档流程在浏览器中处理,公开网页转换不是内容托管或知识库服务。