OCR — biến thành văn bản có thể tìm kiếm
Bản quét của bạn trở thành văn bản — quá trình xử lý diễn ra ngay trên máy của bạn.
Tệp của bạn không bao giờ rời khỏi thiết bị của bạnThả một tệp PDF hoặc hình ảnh vào đây
PDF đã quét hoặc ảnh chụp — JPG, PNG
Cách nhận dạng văn bản trong PDF đã scan, từng bước một
OCR biến một bản scan thành văn bản có thể sử dụng được, bằng cách tải một bộ máy nhận dạng ngay trong trình duyệt của bạn: tài liệu không bao giờ được gửi lên mạng.
Thả một PDF đã scan hoặc một ảnh chụp vào
Kéo một PDF hoặc một hình ảnh JPG/PNG vào khu vực thả, hoặc nhấp để duyệt.
Chọn ngôn ngữ của tài liệu
Chọn trong mục «Ngôn ngữ tài liệu»: các ngôn ngữ của trang đứng đầu danh sách, sau đó là hơn một trăm ngôn ngữ khác, có mô hình được tải xuống khi dùng lần đầu. Việc nhận dạng sẽ kém tin cậy hơn hẳn nếu ngôn ngữ chọn không khớp với văn bản thật; «Ngôn ngữ thứ hai» dùng cho tài liệu song ngữ.
Giới hạn khoảng trang, nếu tệp là PDF
Ô nhập chấp nhận một khoảng như «1-3, 5, 8-10»; để trống thì tất cả các trang đều được phân tích.
Nhấp «Bắt đầu nhận dạng»
Bộ máy nhận dạng (khoảng 4 MB) được tải xuống từ máy chủ của chúng tôi đúng một lần, cùng với mô hình ngôn ngữ; với một ngôn ngữ chưa có sẵn, dung lượng của mô hình được thông báo trước khi bắt đầu. Việc phân tích sau đó diễn ra hoàn toàn trên thiết bị của bạn.
Đọc kết quả và mức độ tin cậy của nó
Văn bản nhận dạng được hiển thị cùng số từ và một độ tin cậy trung bình; độ tin cậy thấp cho thấy bản scan có thể bị nghiêng hoặc chất lượng kém.
Tải xuống văn bản hoặc PDF có thể tìm kiếm
Tệp .txt chứa văn bản thuần; PDF có thể tìm kiếm giữ nguyên bố cục gốc với một lớp văn bản vô hình phủ lên trên, giúp tài liệu có thể chọn và tìm kiếm theo từ khóa.
Trong PDF có thể tìm kiếm, một trang đã scan giữ nguyên hình ảnh gốc và nhận một lớp văn bản vô hình phù hợp với mọi hệ chữ viết, kể cả Hy Lạp, Kirin, Ả Rập hay Trung Quốc; một trang vốn đã có văn bản sẽ được dựng lại thành hình ảnh để không mang hai lớp cùng lúc.
Câu hỏi thường gặp
OCR của VellumPDF có nhận cả PDF lẫn ảnh chụp không?
Có, bạn có thể thả vào một PDF đã quét hoặc trực tiếp một ảnh định dạng JPG hay PNG. Trong cả hai trường hợp, công cụ tạo ra một PDF có thể tìm kiếm, với phần văn bản có thể chọn và sao chép.
Tính năng nhận dạng văn bản hoạt động với những ngôn ngữ nào?
Hơn một trăm ngôn ngữ. Các ngôn ngữ của trang được tích hợp sẵn và do VellumPDF cung cấp; các ngôn ngữ khác (Séc, Hy Lạp, Nga, Ukraina, Ả Rập, Do Thái, Trung, Nhật, Hàn…) được chọn trong cùng danh sách « Ngôn ngữ tài liệu », và mô hình của chúng được tải về một lần, ở lần dùng đầu tiên. « Ngôn ngữ thứ hai » xử lý một tài liệu song ngữ. Chọn đúng ngôn ngữ giúp cải thiện rõ rệt độ tin cậy của kết quả.
Tài liệu đã quét của tôi có được gửi đến một dịch vụ trí tuệ nhân tạo trực tuyến không?
Không. Công cụ nhận dạng chạy ngay trên trình duyệt của bạn. Với các ngôn ngữ của trang, các tệp của chúng đến từ chính tên miền của VellumPDF; với một ngôn ngữ khác, chỉ mô hình của ngôn ngữ đó được tải về từ raw.githubusercontent.com, kho lưu trữ công khai của dự án Tesseract, sau một thông báo trên màn hình. Lượt tải này chỉ theo một chiều: tài liệu không bao giờ rời khỏi thiết bị của bạn và không có dịch vụ trí tuệ nhân tạo nào được gọi tới.
Mô hình nhận dạng có được tải lại mỗi lần sử dụng không, và dung lượng của nó là bao nhiêu?
Mỗi ngôn ngữ có mô hình riêng. Với các ngôn ngữ của trang, do VellumPDF lưu trữ: từ 0,4 đến 3 MB đã nén tùy ngôn ngữ (khoảng 700 KB cho tiếng Pháp, gần 3 MB cho tiếng Anh); bộ nhớ đệm thông thường của trình duyệt giúp tránh tải lại. Với các ngôn ngữ khác, từ 0,4 đến 12 MB tùy ngôn ngữ, dung lượng được hiển thị trước khi bắt đầu; một khi đã tải về, mô hình được trình duyệt lưu giữ và lần dùng thứ hai sẽ không tải gì thêm.
Làm sao biết được kết quả có đáng tin không, chẳng hạn với một bản quét bị lệch hoặc chất lượng kém?
Một tỷ lệ phần trăm độ tin cậy trung bình được hiển thị cùng kết quả, tính trên toàn bộ các từ đã nhận dạng được. Dưới 70%, một cảnh báo cho biết việc nhận dạng không chắc chắn và bản quét có thể bị lệch hoặc chất lượng thấp — đó là tín hiệu để quét lại thay vì tin tưởng vào văn bản thu được.
Điều gì xảy ra nếu tôi thả vào một PDF được bảo vệ bằng mật khẩu?
Việc nhận dạng bị từ chối ngay lập tức, kèm thông báo giải thích rằng một PDF đã mã hóa không thể xử lý OCR. Bạn cần gỡ bảo vệ của tài liệu trước khi thả nó vào đây.