Перейти к основному содержимому

PDF в Markdown

Ваш PDF становится структурированным текстом, готовым для редактора Markdown.

ваши файлы никогда не покидают ваше устройство

Перетащите сюда ваш PDF

Преобразование начинается автоматически, сразу после загрузки

Как преобразовать PDF в Markdown, шаг за шагом

Текст PDF заново собирается в Markdown по его визуальному оформлению — размерам шрифтов, маркированным или нумерованным спискам — прямо в вашем браузере.

  1. Перетащите PDF

    Перетащите файл в область загрузки или нажмите, чтобы выбрать файлы. Преобразование начинается автоматически, страница за страницей.

  2. Следите за ходом выполнения

    Сообщение показывает обрабатываемую страницу («Страница n из total»), пока VellumPDF группирует текст в заголовки, списки и абзацы.

  3. Выберите, разделять ли страницы

    Флажок «Разделять страницы строкой ---», по умолчанию отмеченный, вставляет разделительную строку между страницами; снимите его для сплошного документа без отметок страниц.

  4. Перечитайте показанный Markdown

    Результат появляется в прокручиваемой рамке, а чуть выше показано число символов.

  5. Скачайте или скопируйте результат

    «Скачать .md» сохраняет файл Markdown; «Копировать» помещает его в буфер обмена.

Как и при простом извлечении текста, PDF, защищённый паролем, сразу отклоняется: сначала снимите защиту инструментом снятия пароля.

Частые вопросы

Как VellumPDF определяет заголовки в файле Markdown?

Инструмент анализирует размеры шрифтов PDF, чтобы найти визуальную иерархию и вывести из неё заголовки уровня 1, 2 или 3. В документе без чёткой типографской иерархии результат остаётся простым текстом.

Сохраняются ли таблицы и вёрстка в колонки?

Нет, таблицы не восстанавливаются в Markdown, а вёрстка в несколько колонок может читаться в непредвиденном порядке, поскольку анализ идёт построчно, а не по областям страницы. Результат лучше подходит для документа с простым потоком текста.

Что будет, если мой PDF — отсканированный документ?

Если текст извлечь не удаётся, вероятно, PDF состоит из изображений скана. Его нужно сначала пропустить через инструмент OCR VellumPDF, прежде чем преобразовывать в Markdown. Само преобразование бесплатное и выполняется в вашем браузере.

По каким признакам распознаются заголовки?

PDF никогда не объявляет «это заголовок»: приходится угадывать. Инструмент опирается лишь на один признак — размер шрифта, сравниваемый с преобладающим размером основного текста по всему документу. Размеры заметно крупнее (минимум на 15 % больше) образуют ступени заголовков: самый крупный становится заголовком уровня 1, следующий — уровня 2, все остальные — уровня 3. Инструмент не смотрит ни на насыщенность шрифта, ни на положение на странице, ни на слова вроде «Глава» или «Статья».

Можно ли исправить предложенную иерархию?

Не в самом инструменте: VellumPDF создаёт Markdown за один проход, без списка заголовков, который можно поправить перед экспортом. Обнаружение даёт отправную точку, а исправление выполняется затем в любом текстовом редакторе — в этом и смысл формата. Преобразование начинается автоматически сразу после загрузки файла; единственная настройка, показываемая, когда результат готов, — флажок, добавляющий или убирающий строку --- между страницами.

Зачем экспортировать PDF в Markdown?

Чтобы получить текст в форме, которая сохраняет структуру и читается везде: репозиторий кода, блокнот заметок, генератор сайтов, языковая модель. В отличие от экспорта в простой текст, заголовки остаются заголовками, поэтому план документа сохраняется.