跳转到主要内容

PDF 转 Excel

PDF 中的表格,重新变回可用的数据。

您的文件始终不会离开您的设备

请把您的 PDF 放到这里

或点击浏览您的文件

如何把 PDF 转换为 Excel,一步一步来

VellumPDF 根据文字在页面上的位置来识别表格:规则的网格转换得很好,没有对齐的文档,则逐行取回。

  1. 放入 PDF

    如有需要,可以指定要分析的页码范围;受密码保护的文件会被拒绝。

  2. 阅读所显示的警告

    表格是根据逐行重复出现的空白重建的:合并单元格、跨两行的行,或者间距不规则的表格,可能会被错误地切分。

  3. 点击“检测表格”

    如果无法提取任何文字——扫描 PDF 的情形——工具会停止,并给出错误消息。

  4. 逐页核对预览

    每一页都会显示检测到的行数和列数;如果空白不够规则,则显示“没有检测到表格”。

  5. 如有需要,勾选“包含没有表格的页面”

    只有当部分页面含有表格时,这个选项才会出现;它会把其他页面的文字,逐行添加进来。

  6. 选择格式并下载

    Excel(.xlsx)或 CSV;对于 CSV,分隔符可选分号或逗号。

生成的文件中不会重建任何公式,只有数值。对于扫描的 PDF,请先做 OCR:与“PDF 转 Word”工具不同,这里的错误消息不会给出直接的链接,但同样的办法同样适用。

常见问题

VellumPDF 如何检测 PDF 中的表格?

工具根据文字在页面上的位置来识别各列,尤其是逐行重复出现的空白间隙。在下载之前,预览会显示检测到的各行,以便核对结果。

我可以得到 CSV 文件,而不是 Excel 文件吗?

可以,您可以在 Excel 工作簿(.xlsx,PDF 的每一页对应一个工作表)和使用瑞士的 Excel 所期望的分号的 CSV 文件之间选择。按瑞士写法书写的金额,例如 1’234.50,会被识别为数字。

如果我的 PDF 中没有真正的、对齐整齐的表格,会怎样?

没有规则网格的文档,可以逐行导出,而不是分成精确的列。无论得到什么结果,检测始终是在本地进行的,免费,不会把文件发送到服务器。

如果我想提取的表格来自扫描的 PDF,会怎样?

如果 PDF 不包含任何可选中的文字——由图像组成的扫描件——分析会停止,并给出一条消息指出这一点:没有文字层,就无法提取任何数据。需要先对文档进行文字识别(OCR),然后带着已经可以搜索的 PDF 回到这里。

合并单元格,或者写成两行的一行记录,会干扰结果吗?

会的:当同一种对齐方式,在页面至少 30% 的行上重复出现,且容差为几个点时,各列才会被识别出来。合并单元格会打破这种重复,而跨了两行文字的一条记录,在导出中会变成两个独立的行——下载之前的预览,正是用来发现这类切分的。

我可以在导出中,包含没有检测到表格的页面吗?

当某些页面含有被识别的表格,而另一些没有时,会出现一个复选框,用来把后者也加入导出,它们会逐行取用,而不是分成列。如果不勾选这个复选框,只有检测到表格的页面才会被导出。