PDF para texto
O conteúdo do seu PDF, em texto simples reutilizável.
Seus arquivos nunca saem do seu dispositivoArraste o seu PDF para cá
O texto é extraído automaticamente ao soltar o arquivo
Como extrair o texto de um PDF, passo a passo
A ferramenta recupera o texto realmente presente no arquivo, página por página, para relê-lo ou reutilizá-lo em outro lugar. Nada sai do seu navegador.
Envie o PDF
Arraste o arquivo para a zona de depósito, ou clique para procurar nos seus arquivos. A extração começa na hora, sem precisar clicar em nenhum botão.
Deixe o Vellum percorrer cada página
O texto de cada página é recuperado e ligado ao seguinte por uma marca «———— Página n ————», na ordem em que aparece no arquivo.
Releia o resultado exibido
O texto completo aparece em um quadro com rolagem, com o número de caracteres e de palavras logo acima.
Baixe ou copie o texto
«Baixar .txt» salva um arquivo de texto com o mesmo nome do PDF original; «Copiar» coloca o resultado na área de transferência para colá-lo em outro lugar.
Um PDF protegido por senha é recusado na hora, com uma mensagem própria: primeiro remova a proteção com a ferramenta de desbloqueio antes de voltar aqui.
Perguntas frequentes
Como o texto extraído de um PDF é apresentado?
O texto é entregue em um arquivo .txt, organizado página por página, reutilizável em um editor de texto ou em qualquer outra ferramenta. É o texto realmente presente no arquivo que é recuperado, sem formatação.
A ferramenta funciona com um PDF digitalizado?
Não, a extração se baseia apenas no texto já presente no arquivo PDF, não em um reconhecimento de imagem. Se o documento for uma digitalização sem texto subjacente, nenhum texto sairá: passe-o antes pela ferramenta de OCR do Vellum.
Este serviço é gratuito e o documento é enviado on-line?
Sim, a ferramenta é gratuita e sem limite de uso. A extração acontece inteiramente no seu navegador, sem enviar o PDF a um servidor.
O texto extraído mantém a diagramação?
Não, e isso é próprio do formato: você recupera o texto, não a diagramação. As colunas se desdobram uma após a outra, as tabelas perdem a grade. Se a estrutura importar, a exportação para Markdown mantém pelo menos os títulos; se o que importa é a diagramação, é preciso usar a exportação para Word.
Em que ordem sai o texto de uma página em duas colunas?
Na ordem em que está declarado no arquivo, que em geral segue a leitura natural, mas nem sempre. Em um folheto ou um jornal, às vezes um quadro se intercala no meio de um parágrafo. Uma releitura rápida basta para perceber.
Por que a extração não retorna nada em alguns arquivos?
Porque o documento não tem camada de texto: é uma imagem de página, tipicamente uma digitalização ou uma foto. Então não há literalmente nada a extrair. Passe antes o arquivo pelo reconhecimento de caracteres, que acrescenta essa camada, e depois execute a extração de novo.