PDF 转文本
PDF 的内容,变成可重复使用的纯文本。
您的文件始终不会离开您的设备请把您的 PDF 放到这里
放入后会自动提取文字
如何提取 PDF 中的文字,一步一步来
该工具会逐页取出文件中真实存在的文字,以便重新阅读,或在别处重复使用。任何内容都不会发送到您的浏览器之外。
放入 PDF
把文件拖入放置区,或点击浏览您的文件。提取会立刻开始,无需点击任何按钮。
让 VellumPDF 遍历每一页
每一页的文字都会被取出,然后按它在文件中出现的顺序,用“———— 第 n 页 ————”的标记与下一页连接起来。
查看显示的结果
完整的文字会出现在一个可滚动的框中,正上方是字符数和词数。
下载或复制文字
“下载 .txt”会保存一个与原始 PDF 同名的文本文件;“复制”会把结果放入剪贴板,以便粘贴到别处。
受密码保护的 PDF 会被直接拒绝,并给出专门的提示:必须先用解除密码的工具移除保护,然后再回到这里。
常见问题
从 PDF 中提取的文字是什么样子的?
文字会以 .txt 文件的形式呈现,按页组织,可以在文字处理软件或任何其他工具中重复使用。取回的是文件中真实存在的文字,不带任何格式。
这个工具对扫描的 PDF 有效吗?
无效,提取只依据 PDF 文件中已有的文字,而不是对图像的识别。如果文档是没有底层文字的扫描件,就不会提取出任何文字:请先用 VellumPDF 的 OCR 工具处理。
这项服务免费吗,文档会被发送到网上吗?
是的,这个工具免费,使用不受限制。提取完全在您的浏览器中进行,不会把 PDF 发送到服务器。
提取出的文字会保留版式吗?
不会,这正是这种格式的特点:您取回的是文字,而不是版式。各栏会一栏接一栏地依次展开,表格会失去它的网格。如果结构很重要,导出为 Markdown 至少能保留标题;如果版式很重要,就该导出为 Word。
对于两栏的页面,文字会按什么顺序输出?
按它在文件中声明的顺序,这通常符合自然的阅读顺序,但并不总是如此。在宣传册或报纸上,有时会有一个文本框插在一个段落的中间。快速浏览一遍,就能发现。
为什么对某些文件,提取不出任何内容?
因为文档没有文字层:它是一张页面图像,通常是扫描件或照片。这时确实没有任何东西可以提取。请先把文件交给字符识别,它会添加这一层,然后再重新开始提取。