PDF sang Excel
Các bảng biểu trong PDF của bạn trở lại thành dữ liệu có thể sử dụng được.
Tệp của bạn không bao giờ rời khỏi thiết bị của bạnThả tệp PDF của bạn vào đây
hoặc nhấp để duyệt tệp của bạn
Cách chuyển PDF sang Excel, từng bước
VellumPDF phát hiện các bảng dựa trên vị trí văn bản trên trang: một lưới đều chuyển đổi tốt, một tài liệu không có căn chỉnh sẽ được khôi phục theo từng dòng.
Tải lên PDF
Nếu cần, hãy chỉ định một phạm vi trang để phân tích; một tệp được bảo vệ bằng mật khẩu sẽ bị từ chối.
Đọc cảnh báo hiển thị
Các bảng được dựng lại dựa trên các khoảng trống lặp lại từ dòng này sang dòng khác: ô gộp, hàng trải trên hai dòng hoặc bảng không có khoảng cách đều có thể bị tách sai.
Nhấp vào "Phát hiện bảng"
Nếu không thể trích xuất được văn bản nào — trường hợp một PDF đã scan — công cụ sẽ dừng lại với một thông báo lỗi.
Kiểm tra bản xem trước từng trang
Mỗi trang hiển thị số hàng và cột được phát hiện, hoặc "không phát hiện bảng nào" nếu các khoảng trắng không đủ đều.
Chọn "Bao gồm các trang không có bảng", nếu hữu ích
Tùy chọn này chỉ xuất hiện khi chỉ một số trang có bảng; nó thêm văn bản của các trang còn lại, theo từng dòng.
Chọn định dạng và tải xuống
Excel (.xlsx) hoặc CSV, với dấu phân cách chấm phẩy hoặc dấu phẩy cho CSV.
Không công thức nào được tạo lại trong tệp kết quả, chỉ có các giá trị. Với một PDF đã scan, hãy chạy OCR trước: khác với công cụ PDF sang Word, thông báo lỗi ở đây không đưa ra liên kết trực tiếp, nhưng cách khắc phục vẫn giống nhau.
Câu hỏi thường gặp
VellumPDF phát hiện các bảng trong một PDF như thế nào?
Công cụ xác định các cột dựa trên vị trí của văn bản trên trang, đặc biệt là các khoảng trống lặp lại từ dòng này sang dòng khác. Một bản xem trước hiển thị các hàng đã phát hiện trước khi tải xuống, để bạn kiểm tra kết quả.
Tôi có thể nhận một tệp CSV thay vì tệp Excel không?
Có, bạn có thể chọn giữa một sổ làm việc Excel (.xlsx), với một trang tính cho mỗi trang PDF, hoặc một tệp CSV dùng dấu chấm phẩy mà Excel ở Thụy Sĩ yêu cầu. Các số tiền viết theo kiểu Thụy Sĩ, như 1’234.50, được nhận dạng là số.
Điều gì xảy ra nếu PDF của tôi không chứa một bảng thực sự với các hàng được canh chỉnh gọn gàng?
Một tài liệu không có lưới đều đặn có thể được xuất theo từng dòng thay vì theo các cột chính xác. Việc phát hiện luôn diễn ra cục bộ, miễn phí và không gửi tệp đến máy chủ nào, dù kết quả ra sao.
Điều gì xảy ra nếu bảng tôi muốn trích xuất đến từ một PDF đã quét?
Nếu PDF không chứa văn bản nào có thể chọn được — một bản quét được tạo từ các ảnh —, việc phân tích dừng lại với một thông báo cho biết điều đó: không thể trích xuất dữ liệu nào nếu thiếu lớp văn bản. Bạn cần cho tài liệu qua nhận dạng văn bản (OCR) trước, rồi quay lại đây với PDF đã có thể tìm kiếm được.
Một ô đã gộp hay một dòng dữ liệu viết trên hai dòng có thể làm sai lệch kết quả không?
Có: các cột được nhận ra khi cùng một cách canh chỉnh lặp lại trên ít nhất 30% số dòng của trang, với dung sai vài điểm. Một ô đã gộp phá vỡ sự lặp lại đó, và một mục dữ liệu trải trên hai dòng văn bản trở thành hai hàng riêng biệt trong bản xuất — bản xem trước trước khi tải xuống chính là để phát hiện kiểu chia sai này.
Tôi có thể đưa vào bản xuất những trang không phát hiện được bảng nào không?
Khi một số trang chứa bảng được nhận dạng còn số khác thì không, một ô đánh dấu xuất hiện để thêm những trang đó vào bản xuất, lấy theo từng dòng thay vì theo cột. Nếu không đánh dấu ô này, chỉ những trang có bảng được phát hiện mới được xuất.