PDF в Excel
Таблицы из ваших PDF снова становятся данными, с которыми можно работать.
ваши файлы никогда не покидают ваше устройствоПеретащите сюда ваш PDF
или нажмите, чтобы выбрать файлы
Как преобразовать PDF в Excel, шаг за шагом
VellumPDF находит таблицы по положению текста на странице: регулярная сетка преобразуется хорошо, а документ без выравнивания извлекается построчно.
Перетащите PDF
При необходимости укажите диапазон страниц для анализа; файл, защищённый паролем, отклоняется.
Прочтите показанное предупреждение
Таблицы восстанавливаются по пробелам, повторяющимся от строки к строке: объединённые ячейки, строки, занимающие две линии, или таблицы с нерегулярными интервалами могут быть разбиты неверно.
Нажмите «Найти таблицы»
Если текст извлечь не удалось — случай отсканированного PDF, — инструмент останавливается с сообщением об ошибке.
Проверьте предварительный просмотр постранично
Каждая страница показывает число обнаруженных строк и столбцов или «Таблица не обнаружена», если пробелы недостаточно регулярны.
Отметьте «Включить страницы без таблицы», если нужно
Этот параметр появляется, только если таблица есть лишь на некоторых страницах; он добавляет текст остальных построчно.
Выберите формат и скачайте
Excel (.xlsx) или CSV, с разделителем «точка с запятой» или «запятая» для CSV.
В созданном файле не воссоздаётся ни одной формулы, только значения. На отсканированном PDF сначала выполните OCR: в отличие от инструмента «PDF в Word», сообщение об ошибке здесь не предлагает прямой ссылки, но то же решение применимо.
Частые вопросы
Как VellumPDF находит таблицы в PDF?
Инструмент определяет столбцы по положению текста на странице, в частности по промежуткам, повторяющимся от строки к строке. Предварительный просмотр показывает найденные строки до скачивания, чтобы проверить результат.
Можно ли получить файл CSV вместо файла Excel?
Да, вы выбираете между книгой Excel (.xlsx), с листом на каждую страницу PDF, и файлом CSV с точкой с запятой, которую ждёт Excel в Швейцарии. Суммы, записанные по-швейцарски, например 1’234.50, распознаются как числа.
Что будет, если в моём PDF нет настоящей таблицы с хорошо выровненными линиями?
Документ без регулярной сетки можно экспортировать построчно, а не в точные столбцы. Обнаружение остаётся локальным, бесплатным и без отправки файла на сервер, каким бы ни был результат.
Что будет, если таблица, которую я хочу извлечь, находится в отсканированном PDF?
Если в PDF нет выделяемого текста — скан, состоящий из изображений, — анализ останавливается с сообщением об этом: без текстового слоя никакие данные извлечь нельзя. Сначала нужно пропустить документ через распознавание текста (OCR), а затем вернуться сюда с PDF, в котором работает поиск.
Может ли объединённая ячейка или строка, записанная на двух линиях, испортить результат?
Да: столбцы распознаются, когда одно и то же выравнивание повторяется как минимум на 30 % строк страницы, с допуском в несколько пунктов. Объединённая ячейка нарушает это повторение, а запись, переходящая на две строки текста, становится двумя отдельными строками экспорта — предварительный просмотр перед скачиванием как раз служит для того, чтобы заметить такое разбиение.
Можно ли включить в экспорт страницы, на которых таблица не найдена?
Когда на одних страницах есть распознанная таблица, а на других нет, появляется флажок для добавления последних в экспорт — построчно, а не в столбцах. Если этот флажок не отмечен, экспортируются только страницы с обнаруженной таблицей.