PDF 转 Excel
PDF 中的表格,重新变回可用的数据。
您的文件始终不会离开您的设备请把您的 PDF 放到这里
或点击浏览您的文件
如何把 PDF 转换为 Excel,一步一步来
VellumPDF 根据文字在页面上的位置来识别表格:规则的网格转换得很好,没有对齐的文档,则逐行取回。
放入 PDF
如有需要,可以指定要分析的页码范围;受密码保护的文件会被拒绝。
阅读所显示的警告
表格是根据逐行重复出现的空白重建的:合并单元格、跨两行的行,或者间距不规则的表格,可能会被错误地切分。
点击“检测表格”
如果无法提取任何文字——扫描 PDF 的情形——工具会停止,并给出错误消息。
逐页核对预览
每一页都会显示检测到的行数和列数;如果空白不够规则,则显示“没有检测到表格”。
如有需要,勾选“包含没有表格的页面”
只有当部分页面含有表格时,这个选项才会出现;它会把其他页面的文字,逐行添加进来。
选择格式并下载
Excel(.xlsx)或 CSV;对于 CSV,分隔符可选分号或逗号。
生成的文件中不会重建任何公式,只有数值。对于扫描的 PDF,请先做 OCR:与“PDF 转 Word”工具不同,这里的错误消息不会给出直接的链接,但同样的办法同样适用。
常见问题
VellumPDF 如何检测 PDF 中的表格?
工具根据文字在页面上的位置来识别各列,尤其是逐行重复出现的空白间隙。在下载之前,预览会显示检测到的各行,以便核对结果。
我可以得到 CSV 文件,而不是 Excel 文件吗?
可以,您可以在 Excel 工作簿(.xlsx,PDF 的每一页对应一个工作表)和使用瑞士的 Excel 所期望的分号的 CSV 文件之间选择。按瑞士写法书写的金额,例如 1’234.50,会被识别为数字。
如果我的 PDF 中没有真正的、对齐整齐的表格,会怎样?
没有规则网格的文档,可以逐行导出,而不是分成精确的列。无论得到什么结果,检测始终是在本地进行的,免费,不会把文件发送到服务器。
如果我想提取的表格来自扫描的 PDF,会怎样?
如果 PDF 不包含任何可选中的文字——由图像组成的扫描件——分析会停止,并给出一条消息指出这一点:没有文字层,就无法提取任何数据。需要先对文档进行文字识别(OCR),然后带着已经可以搜索的 PDF 回到这里。
合并单元格,或者写成两行的一行记录,会干扰结果吗?
会的:当同一种对齐方式,在页面至少 30% 的行上重复出现,且容差为几个点时,各列才会被识别出来。合并单元格会打破这种重复,而跨了两行文字的一条记录,在导出中会变成两个独立的行——下载之前的预览,正是用来发现这类切分的。
我可以在导出中,包含没有检测到表格的页面吗?
当某些页面含有被识别的表格,而另一些没有时,会出现一个复选框,用来把后者也加入导出,它们会逐行取用,而不是分成列。如果不勾选这个复选框,只有检测到表格的页面才会被导出。