メインコンテンツへ移動

PDFをMarkdownに変換

PDFが構造化されたテキストになり、Markdownエディターですぐ使えます。

ファイルがお使いのデバイスの外に出ることはありません

ここにPDFをドラッグ

ファイルをドロップすると、変換が自動的に始まります

PDFをMarkdownに変換する手順

PDFのテキストは、見た目の書式(フォントサイズ、箇条書きや番号付きのリスト)から、お使いのブラウザー内で直接、Markdownに組み直されます。

  1. PDFを送る

    ファイルをドロップ領域にドラッグするか、クリックして、手持ちのファイルから選びます。変換は、ページごとに、自動で始まります。

  2. 進み具合を見る

    VellumPDFが、テキストを見出し、リスト、段落にまとめている間、処理中のページが、メッセージで示されます(「全ページ数中のnページ目」)。

  3. ページを区切るかどうかを決める

    「ページの区切りに --- の行を入れる」のチェックは、既定でオンになっており、各ページの間に区切りの行を入れます。ページの目印のない、つながったドキュメントにするには、チェックを外してください。

  4. 表示されたMarkdownを読み直す

    結果が、スクロールできる枠の中に表示され、そのすぐ上に、文字数が示されます。

  5. 結果をダウンロードまたはコピーする

    「.mdをダウンロード」は、Markdownファイルを保存します。「コピー」は、それをクリップボードに入れます。

プレーンテキストの取り出しと同じく、パスワードで保護されたPDFは、すぐに拒否されます。先に、ロック解除のツールで保護を外してください。

よくある質問

VellumPDFは、Markdownファイルの見出しを、どう判定しますか?

ツールは、PDFのフォントサイズを解析して、視覚的な階層を検出し、そこからレベル1、2、3の見出しを推定します。文字の大きさなどによる階層がはっきりしていないドキュメントでは、結果はプレーンテキストのままです。

表や、段組みのレイアウトは、保たれますか?

いいえ。表はMarkdownとして再構成されず、複数の段組みのレイアウトは、予想と違う順序で読まれることがあります。解析が、ページの領域ごとではなく、1行ずつ行われるためです。結果は、単純なテキストの流れでできたドキュメントのほうが向いています。

私のPDFがスキャンしたドキュメントだった場合は、どうなりますか?

テキストを取り出せなければ、そのPDFは、おそらくスキャンによる画像で構成されています。Markdownに変換する前に、VellumPDFのOCRツールに通す必要があります。変換そのものは無料で、お使いのブラウザー内で行われます。

見出しは、どんな手がかりで認識されますか?

PDFは、「これは見出しです」とは決して宣言しません。推測するしかありません。ツールが頼るのは、手がかり1つだけで、フォントサイズを、ドキュメント全体で支配的な本文のサイズと比べます。はっきり大きいサイズ(少なくとも15%大きい)が見出しの階層になります。最も大きいものがレベル1、次がレベル2、そのほかはすべてレベル3です。ツールは、フォントの太さも、ページ内の位置も、「章」や「条」のような言葉も、見ていません。

提案された階層を、直せますか?

ツールの中ではできません。VellumPDFは、1回の処理でMarkdownを作り、書き出す前に直すための見出しの一覧はありません。検出は出発点を与えるもので、修正は、あとで、どんなテキストエディターでもできます。それこそが、この形式の強みです。変換は、ファイルをドロップするとすぐに自動で始まります。結果が出たときに表示される、唯一の調整は、ページの間に --- の行を加えるか外すかのチェックボックスです。

PDFをMarkdownに書き出すと、何の役に立ちますか?

構造を保ち、どこでも読み直せる形で、テキストを取り戻すためです。コードのリポジトリ、ノート、サイトジェネレーター、言語モデルなどです。プレーンテキストの書き出しと違って、見出しが見出しのまま残るので、ドキュメントの構成が保たれます。