Herdown

网页转Markdown,给AI Agent的高质量资料入口

把公开网页URL转换为适合AI Agent理解、检索和使用的干净Markdown。

免费 · 无需注册 · 无需API密钥

怎么使用URL转Markdown

输入一个公开网页URL,或者切换到HTML粘贴模式提供已有源码。系统定位正文,提取标题、段落、列表、表格、代码、图片和链接,清理导航、广告、评论、推荐模块以及重复页面外壳。结果生成后,先检查正文边界、来源URL和文章结尾,再复制或下载Markdown。

真实输出和结构保留

简单文章会保留标题、章节和来源。包含表格和代码的博客会尽量保留表头、行列关系、代码围栏和语言提示。中文内容按原文输出,不会因为界面语言切换而被错误翻译。HTML转Markdown的目标是语义结构,不是复制网页的视觉样式。

保留什么,清理什么

保留标题层级、表格、代码块、图片alt和原始URL、正文链接与来源信息。清理导航、广告、评论、推荐、弹窗、Cookie提示和重复页面组件。这样生成的Markdown更适合阅读、检索、引用和交给AI Agent继续处理。

为AI Agent和开发者准备

API适合程序化转换和批量任务,MCP适合让兼容的AI客户端调用工具,CLI适合终端、脚本和CI流程,浏览器插件适合当前浏览器已经渲染的页面。开发者工作流应记录输入URL、状态、解析提示、来源和是否需要人工复核。

Herdown与其他网页解析工具的区别

Firecrawl更偏向开发者网页抓取、渲染和任务编排,JinaAI更偏向远程阅读、搜索和内容提取。Herdown把单页URL、本地文件、多页面Website转Markdown以及API、MCP、CLI放在同一套资料整理工作流里,并强调来源保留、失败反馈和本地文件边界。

支持范围与限制

登录墙、付费墙、验证码、反爬规则、超时和客户端动态渲染都可能使结果不完整。服务不会授予私有页面访问权限,也不会承诺绕过访问控制。遇到这些情况,可以使用浏览器插件,或粘贴你有权访问的HTML源码;扫描版资料应使用本地OCR。

为什么AI工作流适合使用Markdown

HTML包含大量展示标签、脚本和页面外壳,Markdown更容易控制上下文长度和信息顺序。标题、列表、表格、代码块和链接都有清晰边界,检查后的内容可以进入RAG、Prompt、知识库、代码仓库或发布流程。

从输入到交付

根据任务选择:URL转Markdown处理一个公开页面;Website转Markdown处理域名、起始URL或Sitemap下的多个页面;Markdown查看器用于检查结果。确认标题、表格、代码、链接、图片、来源和结尾后,再继续导出HTML、PDF、Word,或进入微信公众号和小红书工具。

已测试的真实输出

以下内容来自实际公开页面转换和本地HTML粘贴测试,展示标题、正文、链接、代码围栏和中文结构如何进入Markdown。每组示例都保留输入和输出,方便用户核对,而不是只展示抽象承诺。

简单公开页面

https://example.com/

Example Domain

This domain is for use in documentation examples without needing permission. Avoid use in operations. [Learn more](https://iana.org/domains/example)

标题、正文、链接和来源可以直接检查;页面外壳没有混入结果。源页面很短,因此输出保持短小,不会为了增加词数而编造段落。

技术页面代码摘录

https://developers.cloudflare.com/workers/get-started/guide/

### 1. Create a new Worker project

Open a terminal window and run C3 to create your Worker project.

```bash
npm create cloudflare@latest -- my-first-worker
```

标题、说明、命令和代码围栏保持分离,开发者可以检查代码语言提示和复制边界。结果是正文结构的摘录,不承诺重建原页面的视觉布局。

中文HTML粘贴测试

# 转换测试

## 输入与输出

网页正文会保留标题、段落和来源链接。

这个受控HTML测试验证中文标题、段落和层级保持原文,并明确它是本地粘贴测试而不是远程中文页面的冒充结果。

首页常见问题

网页转Markdown免费吗?

公开网页URL可以按照页面显示的免费额度使用,首页和API共用额度,不是无限抓取。

不安装软件也能在线转换吗?

可以,在浏览器中粘贴公开网页URL即可使用,不需要安装或API密钥。

有网页转Markdown浏览器插件吗?

有,当前浏览器已经渲染的页面可以使用插件进行本地提取。

可以HTML转Markdown吗?

可以,已有HTML源码时使用HTML粘贴模式。

为什么有些页面失败?

登录墙、付费墙、验证码、反爬、动态渲染、超时和没有可读正文都可能影响结果。

可以用Python接入吗?

可以通过RESTAPI调用解析接口,并把Markdown保存到本地。

GitHub上有示例吗?

Herdown公开仓库包含CLI、MCP、SDK和开发者文档。

网页转Markdown和Website转Markdown有什么区别?

网页转Markdown处理一个公开URL,Website转Markdown从域名、起始URL或Sitemap抓取多个页面。

我的内容会保存到服务器吗?

HTML粘贴和本地文档流程在浏览器中处理,公开网页转换不是内容托管或知识库服务。