Перейти к основному содержимому

PDF в Excel

Таблицы из ваших PDF снова становятся данными, с которыми можно работать.

ваши файлы никогда не покидают ваше устройство

Перетащите сюда ваш PDF

или нажмите, чтобы выбрать файлы

Как преобразовать PDF в Excel, шаг за шагом

VellumPDF находит таблицы по положению текста на странице: регулярная сетка преобразуется хорошо, а документ без выравнивания извлекается построчно.

  1. Перетащите PDF

    При необходимости укажите диапазон страниц для анализа; файл, защищённый паролем, отклоняется.

  2. Прочтите показанное предупреждение

    Таблицы восстанавливаются по пробелам, повторяющимся от строки к строке: объединённые ячейки, строки, занимающие две линии, или таблицы с нерегулярными интервалами могут быть разбиты неверно.

  3. Нажмите «Найти таблицы»

    Если текст извлечь не удалось — случай отсканированного PDF, — инструмент останавливается с сообщением об ошибке.

  4. Проверьте предварительный просмотр постранично

    Каждая страница показывает число обнаруженных строк и столбцов или «Таблица не обнаружена», если пробелы недостаточно регулярны.

  5. Отметьте «Включить страницы без таблицы», если нужно

    Этот параметр появляется, только если таблица есть лишь на некоторых страницах; он добавляет текст остальных построчно.

  6. Выберите формат и скачайте

    Excel (.xlsx) или CSV, с разделителем «точка с запятой» или «запятая» для CSV.

В созданном файле не воссоздаётся ни одной формулы, только значения. На отсканированном PDF сначала выполните OCR: в отличие от инструмента «PDF в Word», сообщение об ошибке здесь не предлагает прямой ссылки, но то же решение применимо.

Частые вопросы

Как VellumPDF находит таблицы в PDF?

Инструмент определяет столбцы по положению текста на странице, в частности по промежуткам, повторяющимся от строки к строке. Предварительный просмотр показывает найденные строки до скачивания, чтобы проверить результат.

Можно ли получить файл CSV вместо файла Excel?

Да, вы выбираете между книгой Excel (.xlsx), с листом на каждую страницу PDF, и файлом CSV с точкой с запятой, которую ждёт Excel в Швейцарии. Суммы, записанные по-швейцарски, например 1’234.50, распознаются как числа.

Что будет, если в моём PDF нет настоящей таблицы с хорошо выровненными линиями?

Документ без регулярной сетки можно экспортировать построчно, а не в точные столбцы. Обнаружение остаётся локальным, бесплатным и без отправки файла на сервер, каким бы ни был результат.

Что будет, если таблица, которую я хочу извлечь, находится в отсканированном PDF?

Если в PDF нет выделяемого текста — скан, состоящий из изображений, — анализ останавливается с сообщением об этом: без текстового слоя никакие данные извлечь нельзя. Сначала нужно пропустить документ через распознавание текста (OCR), а затем вернуться сюда с PDF, в котором работает поиск.

Может ли объединённая ячейка или строка, записанная на двух линиях, испортить результат?

Да: столбцы распознаются, когда одно и то же выравнивание повторяется как минимум на 30 % строк страницы, с допуском в несколько пунктов. Объединённая ячейка нарушает это повторение, а запись, переходящая на две строки текста, становится двумя отдельными строками экспорта — предварительный просмотр перед скачиванием как раз служит для того, чтобы заметить такое разбиение.

Можно ли включить в экспорт страницы, на которых таблица не найдена?

Когда на одних страницах есть распознанная таблица, а на других нет, появляется флажок для добавления последних в экспорт — построчно, а не в столбцах. Если этот флажок не отмечен, экспортируются только страницы с обнаруженной таблицей.