跳转到主要内容

PDF 转 Markdown

您的 PDF 变成结构清晰的文本,可直接用于 Markdown 编辑器。

您的文件始终不会离开您的设备

请把您的 PDF 放到这里

放入后会自动开始转换

如何把 PDF 转换为 Markdown,一步一步来

PDF 中的文字,根据其视觉排版——字号、项目符号列表或编号列表——直接在您的浏览器中重建为 Markdown。

  1. 放入 PDF

    把文件拖入放置区,或点击浏览您的文件。转换会自动开始,逐页进行。

  2. 查看进度

    在 VellumPDF 把文字归并为标题、列表和段落的同时,一条消息会显示当前正在处理的页面(“第 n 页,共 total 页”)。

  3. 选择是否分隔各页

    “用一行 --- 分隔各页”这一选项默认已勾选,它会在每一页之间插入一行分隔线;若想得到没有页面标记的连续文档,请取消勾选。

  4. 查看显示的 Markdown

    结果会出现在一个可滚动的框中,正上方是字符数。

  5. 下载或复制结果

    “下载 .md”会保存一个 Markdown 文件;“复制”会把它放入剪贴板。

与简单的文字提取一样,受密码保护的 PDF 会被直接拒绝:请先用解除密码的工具移除保护。

常见问题

VellumPDF 如何确定 Markdown 文件中的标题?

工具会分析 PDF 中的字号,找出视觉上的层级,并据此推断出 1、2 或 3 级标题。对于没有清晰字体层级的文档,结果仍然是平铺的文字。

表格和分栏的版式会保留吗?

不会,表格不会被重建为 Markdown,而分栏的版式,可能会按出乎意料的顺序被读取,因为分析是逐行进行的,而不是按页面区域进行的。结果更适合文字流简单的文档。

如果我的 PDF 是扫描的文档,会怎样?

如果无法提取任何文字,很可能是因为这个 PDF 由扫描得来的图像组成。需要先用 VellumPDF 的 OCR 工具处理,然后再转换为 Markdown。转换本身是免费的,并且在您的浏览器中进行。

标题是根据哪些信号识别出来的?

PDF 从不声明“这是一个标题”:只能去猜。工具只依据一个信号,即字号,并与整份文档中占主导的正文字号相比较。明显更大的字号(至少大 15%)会形成标题的档次:最大的变成 1 级标题,其次的变成 2 级标题,其他所有的变成 3 级标题。工具既不看字重,也不看页面上的位置,也不看“Chapitre”或“Article”这类词。

我可以更正所建议的层级吗?

在工具里不行:VellumPDF 一遍就生成 Markdown,在导出之前,没有需要修饰的标题列表。检测给出一个起点,之后的更正,在任何文本编辑器中进行——这恰恰是这种格式的价值所在。转换会在文件放入时自动开始;唯一存在的设置,在结果就绪之后显示,是一个复选框,用来在页面之间添加或移除一行 ---。

把 PDF 导出为 Markdown 有什么用?

用来以保留结构、并且在任何地方都能重新阅读的形式,取回文字:代码仓库、笔记本、站点生成器、语言模型。与导出为纯文本不同,标题仍然是标题,因此文档的大纲得以保留。