PDF 转 Markdown
您的 PDF 变成结构清晰的文本,可直接用于 Markdown 编辑器。
您的文件始终不会离开您的设备请把您的 PDF 放到这里
放入后会自动开始转换
如何把 PDF 转换为 Markdown,一步一步来
PDF 中的文字,根据其视觉排版——字号、项目符号列表或编号列表——直接在您的浏览器中重建为 Markdown。
放入 PDF
把文件拖入放置区,或点击浏览您的文件。转换会自动开始,逐页进行。
查看进度
在 VellumPDF 把文字归并为标题、列表和段落的同时,一条消息会显示当前正在处理的页面(“第 n 页,共 total 页”)。
选择是否分隔各页
“用一行 --- 分隔各页”这一选项默认已勾选,它会在每一页之间插入一行分隔线;若想得到没有页面标记的连续文档,请取消勾选。
查看显示的 Markdown
结果会出现在一个可滚动的框中,正上方是字符数。
下载或复制结果
“下载 .md”会保存一个 Markdown 文件;“复制”会把它放入剪贴板。
与简单的文字提取一样,受密码保护的 PDF 会被直接拒绝:请先用解除密码的工具移除保护。
常见问题
VellumPDF 如何确定 Markdown 文件中的标题?
工具会分析 PDF 中的字号,找出视觉上的层级,并据此推断出 1、2 或 3 级标题。对于没有清晰字体层级的文档,结果仍然是平铺的文字。
表格和分栏的版式会保留吗?
不会,表格不会被重建为 Markdown,而分栏的版式,可能会按出乎意料的顺序被读取,因为分析是逐行进行的,而不是按页面区域进行的。结果更适合文字流简单的文档。
如果我的 PDF 是扫描的文档,会怎样?
如果无法提取任何文字,很可能是因为这个 PDF 由扫描得来的图像组成。需要先用 VellumPDF 的 OCR 工具处理,然后再转换为 Markdown。转换本身是免费的,并且在您的浏览器中进行。
标题是根据哪些信号识别出来的?
PDF 从不声明“这是一个标题”:只能去猜。工具只依据一个信号,即字号,并与整份文档中占主导的正文字号相比较。明显更大的字号(至少大 15%)会形成标题的档次:最大的变成 1 级标题,其次的变成 2 级标题,其他所有的变成 3 级标题。工具既不看字重,也不看页面上的位置,也不看“Chapitre”或“Article”这类词。
我可以更正所建议的层级吗?
在工具里不行:VellumPDF 一遍就生成 Markdown,在导出之前,没有需要修饰的标题列表。检测给出一个起点,之后的更正,在任何文本编辑器中进行——这恰恰是这种格式的价值所在。转换会在文件放入时自动开始;唯一存在的设置,在结果就绪之后显示,是一个复选框,用来在页面之间添加或移除一行 ---。
把 PDF 导出为 Markdown 有什么用?
用来以保留结构、并且在任何地方都能重新阅读的形式,取回文字:代码仓库、笔记本、站点生成器、语言模型。与导出为纯文本不同,标题仍然是标题,因此文档的大纲得以保留。