PDF vers texte
Le contenu de votre PDF, en texte brut réutilisable.
Vos fichiers ne quittent jamais votre appareilDéposez votre PDF ici
Le texte est extrait automatiquement, dès le dépôt
Questions fréquentes
Comment se présente le texte extrait d’un PDF ?
Le texte est restitué dans un fichier .txt, organisé page par page, réutilisable dans un traitement de texte ou tout autre outil. C’est le texte réellement présent dans le fichier qui est récupéré, sans mise en forme.
L’outil fonctionne-t-il sur un PDF scanné ?
Non, l’extraction repose uniquement sur le texte déjà présent dans le fichier PDF, pas sur une reconnaissance d’image. Si le document est un scan sans texte sous-jacent, aucun texte n’en ressortira : passez-le d’abord par l’outil OCR de Vellum.
Ce service est-il gratuit et le document est-il envoyé en ligne ?
Oui, l’outil est gratuit et sans limite d’usage. L’extraction se déroule entièrement dans votre navigateur, sans envoi du PDF à un serveur.
Le texte extrait garde-t-il la mise en page ?
Non, et c’est le propre du format : vous récupérez le texte, pas la mise en page. Les colonnes se déroulent l’une après l’autre, les tableaux perdent leur grille. Si la structure compte, l’export en Markdown conserve au moins les titres ; si c’est la mise en page qui compte, c’est l’export vers Word qu’il faut.
Dans quel ordre le texte sort-il d’une page à deux colonnes ?
Dans l’ordre où il est déclaré dans le fichier, qui suit en général la lecture naturelle mais pas toujours. Sur une brochure ou un journal, il arrive qu’un encadré s’intercale au milieu d’un paragraphe. Une relecture rapide suffit à le repérer.
Pourquoi l’extraction ne rend-elle rien sur certains fichiers ?
Parce que le document n’a pas de couche de texte : c’est une image de page, typiquement un scan ou une photo. Il n’y a alors rien à extraire, littéralement. Passez d’abord le fichier à la reconnaissance de caractères, qui ajoute cette couche, puis relancez l’extraction.