PDF в Markdown
Ваш PDF становится структурированным текстом, готовым для редактора Markdown.
ваши файлы никогда не покидают ваше устройствоПеретащите сюда ваш PDF
Преобразование начинается автоматически, сразу после загрузки
Как преобразовать PDF в Markdown, шаг за шагом
Текст PDF заново собирается в Markdown по его визуальному оформлению — размерам шрифтов, маркированным или нумерованным спискам — прямо в вашем браузере.
Перетащите PDF
Перетащите файл в область загрузки или нажмите, чтобы выбрать файлы. Преобразование начинается автоматически, страница за страницей.
Следите за ходом выполнения
Сообщение показывает обрабатываемую страницу («Страница n из total»), пока VellumPDF группирует текст в заголовки, списки и абзацы.
Выберите, разделять ли страницы
Флажок «Разделять страницы строкой ---», по умолчанию отмеченный, вставляет разделительную строку между страницами; снимите его для сплошного документа без отметок страниц.
Перечитайте показанный Markdown
Результат появляется в прокручиваемой рамке, а чуть выше показано число символов.
Скачайте или скопируйте результат
«Скачать .md» сохраняет файл Markdown; «Копировать» помещает его в буфер обмена.
Как и при простом извлечении текста, PDF, защищённый паролем, сразу отклоняется: сначала снимите защиту инструментом снятия пароля.
Частые вопросы
Как VellumPDF определяет заголовки в файле Markdown?
Инструмент анализирует размеры шрифтов PDF, чтобы найти визуальную иерархию и вывести из неё заголовки уровня 1, 2 или 3. В документе без чёткой типографской иерархии результат остаётся простым текстом.
Сохраняются ли таблицы и вёрстка в колонки?
Нет, таблицы не восстанавливаются в Markdown, а вёрстка в несколько колонок может читаться в непредвиденном порядке, поскольку анализ идёт построчно, а не по областям страницы. Результат лучше подходит для документа с простым потоком текста.
Что будет, если мой PDF — отсканированный документ?
Если текст извлечь не удаётся, вероятно, PDF состоит из изображений скана. Его нужно сначала пропустить через инструмент OCR VellumPDF, прежде чем преобразовывать в Markdown. Само преобразование бесплатное и выполняется в вашем браузере.
По каким признакам распознаются заголовки?
PDF никогда не объявляет «это заголовок»: приходится угадывать. Инструмент опирается лишь на один признак — размер шрифта, сравниваемый с преобладающим размером основного текста по всему документу. Размеры заметно крупнее (минимум на 15 % больше) образуют ступени заголовков: самый крупный становится заголовком уровня 1, следующий — уровня 2, все остальные — уровня 3. Инструмент не смотрит ни на насыщенность шрифта, ни на положение на странице, ни на слова вроде «Глава» или «Статья».
Можно ли исправить предложенную иерархию?
Не в самом инструменте: VellumPDF создаёт Markdown за один проход, без списка заголовков, который можно поправить перед экспортом. Обнаружение даёт отправную точку, а исправление выполняется затем в любом текстовом редакторе — в этом и смысл формата. Преобразование начинается автоматически сразу после загрузки файла; единственная настройка, показываемая, когда результат готов, — флажок, добавляющий или убирающий строку --- между страницами.
Зачем экспортировать PDF в Markdown?
Чтобы получить текст в форме, которая сохраняет структуру и читается везде: репозиторий кода, блокнот заметок, генератор сайтов, языковая модель. В отличие от экспорта в простой текст, заголовки остаются заголовками, поэтому план документа сохраняется.