Перейти к основному содержимому

PDF в текст

Содержимое вашего PDF в виде простого текста, пригодного для повторного использования.

ваши файлы никогда не покидают ваше устройство

Перетащите сюда ваш PDF

Текст извлекается автоматически, сразу после загрузки

Как извлечь текст из PDF, шаг за шагом

Инструмент достаёт текст, реально имеющийся в файле, страница за страницей, чтобы перечитать его или использовать в другом месте. Ничего не отправляется за пределы вашего браузера.

  1. Перетащите PDF

    Перетащите файл в область загрузки или нажмите, чтобы выбрать файлы. Извлечение начинается сразу, без нажатия кнопки.

  2. Позвольте VellumPDF пройти по каждой странице

    Текст каждой страницы извлекается, а затем соединяется со следующим меткой «———— Страница n ————», в порядке, в котором он идёт в файле.

  3. Перечитайте показанный результат

    Полный текст появляется в прокручиваемой рамке, а чуть выше показано число символов и слов.

  4. Скачайте или скопируйте текст

    «Скачать .txt» сохраняет текстовый файл с тем же именем, что и исходный PDF; «Копировать» помещает результат в буфер обмена, чтобы вставить его в другом месте.

PDF, защищённый паролем, сразу отклоняется с отдельным сообщением: сначала нужно снять защиту инструментом снятия пароля, а затем вернуться сюда.

Частые вопросы

В каком виде представляется текст, извлечённый из PDF?

Текст выдаётся в файле .txt, организованном постранично, пригодном для текстового редактора или любого другого инструмента. Извлекается текст, реально имеющийся в файле, без оформления.

Работает ли инструмент на отсканированном PDF?

Нет, извлечение опирается только на текст, уже имеющийся в файле PDF, а не на распознавание изображения. Если документ — скан без нижележащего текста, никакого текста не получится: сначала пропустите его через инструмент OCR VellumPDF.

Эта служба бесплатная, и отправляется ли документ в сеть?

Да, инструмент бесплатный и без ограничений на использование. Извлечение полностью происходит в вашем браузере, без отправки PDF на сервер.

Сохраняет ли извлечённый текст вёрстку?

Нет, и это свойство самого формата: вы получаете текст, а не вёрстку. Колонки идут одна за другой, таблицы теряют сетку. Если важна структура, экспорт в Markdown сохраняет хотя бы заголовки; если важна вёрстка, нужен экспорт в Word.

В каком порядке выходит текст со страницы с двумя колонками?

В том порядке, в каком он объявлен в файле, который обычно следует естественному чтению, но не всегда. В брошюре или газете случается, что врезка вклинивается посреди абзаца. Быстрой вычитки достаточно, чтобы это заметить.

Почему извлечение ничего не даёт на некоторых файлах?

Потому что у документа нет текстового слоя: это изображение страницы, как правило, скан или фотография. Тогда извлекать буквально нечего. Сначала пропустите файл через распознавание символов, которое добавляет этот слой, а затем снова запустите извлечение.