Ir para o conteúdo principal

PDF para texto

O conteúdo do seu PDF, em texto simples reutilizável.

Seus arquivos nunca saem do seu dispositivo

Arraste o seu PDF para cá

O texto é extraído automaticamente ao soltar o arquivo

Como extrair o texto de um PDF, passo a passo

A ferramenta recupera o texto realmente presente no arquivo, página por página, para relê-lo ou reutilizá-lo em outro lugar. Nada sai do seu navegador.

  1. Envie o PDF

    Arraste o arquivo para a zona de depósito, ou clique para procurar nos seus arquivos. A extração começa na hora, sem precisar clicar em nenhum botão.

  2. Deixe o Vellum percorrer cada página

    O texto de cada página é recuperado e ligado ao seguinte por uma marca «———— Página n ————», na ordem em que aparece no arquivo.

  3. Releia o resultado exibido

    O texto completo aparece em um quadro com rolagem, com o número de caracteres e de palavras logo acima.

  4. Baixe ou copie o texto

    «Baixar .txt» salva um arquivo de texto com o mesmo nome do PDF original; «Copiar» coloca o resultado na área de transferência para colá-lo em outro lugar.

Um PDF protegido por senha é recusado na hora, com uma mensagem própria: primeiro remova a proteção com a ferramenta de desbloqueio antes de voltar aqui.

Perguntas frequentes

Como o texto extraído de um PDF é apresentado?

O texto é entregue em um arquivo .txt, organizado página por página, reutilizável em um editor de texto ou em qualquer outra ferramenta. É o texto realmente presente no arquivo que é recuperado, sem formatação.

A ferramenta funciona com um PDF digitalizado?

Não, a extração se baseia apenas no texto já presente no arquivo PDF, não em um reconhecimento de imagem. Se o documento for uma digitalização sem texto subjacente, nenhum texto sairá: passe-o antes pela ferramenta de OCR do Vellum.

Este serviço é gratuito e o documento é enviado on-line?

Sim, a ferramenta é gratuita e sem limite de uso. A extração acontece inteiramente no seu navegador, sem enviar o PDF a um servidor.

O texto extraído mantém a diagramação?

Não, e isso é próprio do formato: você recupera o texto, não a diagramação. As colunas se desdobram uma após a outra, as tabelas perdem a grade. Se a estrutura importar, a exportação para Markdown mantém pelo menos os títulos; se o que importa é a diagramação, é preciso usar a exportação para Word.

Em que ordem sai o texto de uma página em duas colunas?

Na ordem em que está declarado no arquivo, que em geral segue a leitura natural, mas nem sempre. Em um folheto ou um jornal, às vezes um quadro se intercala no meio de um parágrafo. Uma releitura rápida basta para perceber.

Por que a extração não retorna nada em alguns arquivos?

Porque o documento não tem camada de texto: é uma imagem de página, tipicamente uma digitalização ou uma foto. Então não há literalmente nada a extrair. Passe antes o arquivo pelo reconhecimento de caracteres, que acrescenta essa camada, e depois execute a extração de novo.