Ir para o conteúdo principal

Reconhecimento de texto (OCR)

As suas digitalizações viram texto — a análise fica no seu computador.

Seus arquivos nunca saem do seu dispositivo

Solte aqui um PDF ou uma imagem

PDF digitalizado ou foto — JPG, PNG

Como reconhecer o texto de um PDF digitalizado (OCR), passo a passo

O OCR transforma uma digitalização em texto utilizável, carregando um motor de reconhecimento diretamente no seu navegador: o documento nunca é enviado on-line.

  1. Solte um PDF digitalizado ou uma foto

    Arraste um PDF ou uma imagem JPG/PNG para a zona de depósito, ou clique para procurá-la.

  2. Escolha o idioma do documento

    Selecione francês, alemão, italiano, inglês, espanhol ou português: o reconhecimento é bem menos confiável se o idioma escolhido não corresponder ao texto real.

  3. Limite o intervalo de páginas, se o arquivo for um PDF

    O campo aceita um intervalo como «1-3, 5, 8-10»; em branco, todas as páginas são analisadas.

  4. Clique em «Iniciar o reconhecimento»

    O motor de reconhecimento (cerca de 4 MB) é baixado uma única vez dos nossos servidores; a análise em si acontece depois inteiramente no seu dispositivo.

  5. Leia o resultado e o nível de confiança

    O texto reconhecido é exibido com o número de palavras e uma confiança média; uma confiança baixa indica uma digitalização provavelmente torta ou de má qualidade.

  6. Baixe o texto ou o PDF com texto pesquisável

    O arquivo .txt contém o texto puro; o PDF com texto pesquisável mantém a diagramação original com uma camada de texto invisível por cima, que torna o documento selecionável e pesquisável por palavras-chave.

No PDF com texto pesquisável, só entram na camada de texto invisível os caracteres que a fonte padrão consegue representar; um caractere raro fora desse conjunto continua presente no arquivo .txt baixado.

Perguntas frequentes

O OCR do Vellum aceita tanto PDF quanto fotos?

Sim, você pode depositar um PDF digitalizado ou diretamente uma imagem em formato JPG ou PNG. Nos dois casos, a ferramenta produz um PDF pesquisável cujo texto pode ser selecionado e copiado.

Em que idiomas o reconhecimento de texto funciona?

Você escolhe o idioma do documento entre francês, alemão, italiano, inglês, espanhol e português antes de iniciar o reconhecimento. Selecionar o idioma certo melhora bastante a confiabilidade do resultado.

O meu documento digitalizado é enviado a um serviço de inteligência artificial on-line?

Não, o motor de reconhecimento é executado no seu navegador, com os seus arquivos hospedados no domínio do Vellum. Nenhum serviço externo é chamado e o documento não sai do seu dispositivo.

O modelo de reconhecimento é baixado a cada uso, e quanto ele pesa?

Cada idioma tem o seu próprio modelo, hospedado nos servidores do Vellum em vez de em um CDN externo: cerca de 700 KB comprimidos para o francês, 850 KB para o alemão, 1,3 MB para o italiano, 2,1 MB para o espanhol, 1,4 MB para o português e quase 3 MB para o inglês. Um novo motor de reconhecimento é criado a cada execução, sem cache interno dedicado: só o cache habitual do seu navegador evita um novo download completo de um uso para outro.

Como saber se o resultado é confiável, por exemplo em uma digitalização torta ou de má qualidade?

Uma porcentagem de confiança média é exibida junto com o resultado, calculada sobre o conjunto das palavras reconhecidas. Abaixo de 70 %, um aviso indica que o reconhecimento é incerto e que a digitalização talvez esteja inclinada ou seja de baixa qualidade — é o sinal para digitalizar de novo em vez de confiar no texto obtido.

O que acontece se eu depositar um PDF protegido por senha?

O reconhecimento é recusado imediatamente, com uma mensagem que explica que um PDF criptografado não pode passar por OCR. Primeiro é preciso remover a proteção do documento antes de depositá-lo aqui.