跳转到主要内容

文字识别(OCR)

您的扫描件变成文字——分析全程留在您的设备上。

您的文件始终不会离开您的设备

请把 PDF 或图片放到这里

扫描的 PDF 或照片——JPG、PNG

如何识别扫描 PDF 中的文字,一步一步来

OCR 会把扫描件变成可用的文字,识别引擎直接加载到您的浏览器中:文档绝不会被发送到网上。

  1. 放入扫描的 PDF 或照片

    把 PDF 或 JPG/PNG 图片拖入放置区,或点击浏览。

  2. 选择文档的语言

    请在“文档语言”中选择:本站提供的语言排在最前,随后是一百多种其他语言,其模型在首次使用时下载。如果所选语言与实际文字不符,识别的可靠性会大幅下降;“第二语言”用于双语文档。

  3. 如果文件是 PDF,可以限定页码范围

    输入框接受例如“1-3, 5, 8-10”的范围;留空则分析所有页面。

  4. 点击“开始识别”

    识别引擎(约 4 MB)只会从我们的服务器下载一次,连同该语言的模型;对于未内置的语言,在开始之前,会先告知模型的大小。之后,分析本身完全在您的设备上进行。

  5. 查看结果及其置信度

    识别出的文字会连同词数和平均置信度一起显示;置信度较低,说明扫描件可能有倾斜,或质量较差。

  6. 下载文字或可搜索的 PDF

    .txt 文件包含纯文本;可搜索的 PDF 保留原有的版式,并在其上叠加一层不可见的文字层,使文档可以选中,也可以按关键词搜索。

在可搜索的 PDF 中,扫描的页面保留其原有的图像,并获得一层适用于所有文字(包括希腊文、西里尔文、阿拉伯文或中文)的不可见文字层;已经包含文字的页面,则会被重新生成为图像,以免带有两层文字。

常见问题

VellumPDF 的 OCR 既接受 PDF,也接受照片吗?

是的,您可以放入扫描的 PDF,或者直接放入 JPG 或 PNG 格式的图片。无论哪种情况,工具都会生成可搜索的 PDF,其中的文字可以选中和复制。

文字识别支持哪些语言?

一百多种语言。本站提供的语言已包含在内,由 VellumPDF 提供;其他语言(捷克语、希腊语、希伯来语、波斯语……)可以在同一个“文档语言”列表中选择,其模型在首次使用时下载一次。“第二语言”用于处理双语文档。选对语言,能显著提高结果的可靠性。

我扫描的文档会被发送到在线人工智能服务吗?

不会。识别引擎在您的浏览器中运行。对于本站提供的语言,其文件来自 VellumPDF 的域名;对于其他语言,只有它的模型,在屏幕上给出提示之后,才会从 Tesseract 项目的公共仓库 raw.githubusercontent.com 下载。这次下载只有一个方向:文档不会离开您的设备,也不会调用任何人工智能服务。

识别模型是每次使用时都要下载吗?它有多大?

每种语言都有自己的模型。对于由 VellumPDF 托管的本站语言:压缩后为 0.4 到 3 MB,视语言而定(法语约 700 KB,英语近 3 MB);浏览器常规的缓存,可以避免重复下载。对于其他语言,在 0.4 到 12 MB 之间,视语言而定,大小会在开始之前显示;模型下载之后,浏览器会保留它,第二次使用时就不再下载任何内容。

如何判断结果是否可靠,例如对于歪斜或质量较差的扫描件?

结果旁会显示一个平均置信度百分比,根据所有被识别的词计算得出。低于 70% 时,会有警告提示识别结果不确定,扫描件可能有倾斜或质量较低——这就是该重新扫描的信号,而不是去相信所得到的文字。

如果我放入一个受密码保护的 PDF,会怎样?

识别会被直接拒绝,并给出一条消息,说明已加密的 PDF 无法进行 OCR。需要先移除文档的保护,再放到这里。

可以一次对多个文档进行 OCR 吗?

不可以,工具一次只处理一个文件——一个扫描的 PDF 或一张图片。对于多个文档,需要对每一个重新操作一次。