Reconhecimento de texto (OCR)
As suas digitalizações viram texto — a análise fica no seu computador.
Seus arquivos nunca saem do seu dispositivoSolte aqui um PDF ou uma imagem
PDF digitalizado ou foto — JPG, PNG
Como reconhecer o texto de um PDF digitalizado (OCR), passo a passo
O OCR transforma uma digitalização em texto utilizável, carregando um motor de reconhecimento diretamente no seu navegador: o documento nunca é enviado on-line.
Solte um PDF digitalizado ou uma foto
Arraste um PDF ou uma imagem JPG/PNG para a zona de depósito, ou clique para procurá-la.
Escolha o idioma do documento
Selecione francês, alemão, italiano, inglês, espanhol ou português: o reconhecimento é bem menos confiável se o idioma escolhido não corresponder ao texto real.
Limite o intervalo de páginas, se o arquivo for um PDF
O campo aceita um intervalo como «1-3, 5, 8-10»; em branco, todas as páginas são analisadas.
Clique em «Iniciar o reconhecimento»
O motor de reconhecimento (cerca de 4 MB) é baixado uma única vez dos nossos servidores; a análise em si acontece depois inteiramente no seu dispositivo.
Leia o resultado e o nível de confiança
O texto reconhecido é exibido com o número de palavras e uma confiança média; uma confiança baixa indica uma digitalização provavelmente torta ou de má qualidade.
Baixe o texto ou o PDF com texto pesquisável
O arquivo .txt contém o texto puro; o PDF com texto pesquisável mantém a diagramação original com uma camada de texto invisível por cima, que torna o documento selecionável e pesquisável por palavras-chave.
No PDF com texto pesquisável, só entram na camada de texto invisível os caracteres que a fonte padrão consegue representar; um caractere raro fora desse conjunto continua presente no arquivo .txt baixado.
Perguntas frequentes
O OCR do Vellum aceita tanto PDF quanto fotos?
Sim, você pode depositar um PDF digitalizado ou diretamente uma imagem em formato JPG ou PNG. Nos dois casos, a ferramenta produz um PDF pesquisável cujo texto pode ser selecionado e copiado.
Em que idiomas o reconhecimento de texto funciona?
Você escolhe o idioma do documento entre francês, alemão, italiano, inglês, espanhol e português antes de iniciar o reconhecimento. Selecionar o idioma certo melhora bastante a confiabilidade do resultado.
O meu documento digitalizado é enviado a um serviço de inteligência artificial on-line?
Não, o motor de reconhecimento é executado no seu navegador, com os seus arquivos hospedados no domínio do Vellum. Nenhum serviço externo é chamado e o documento não sai do seu dispositivo.
O modelo de reconhecimento é baixado a cada uso, e quanto ele pesa?
Cada idioma tem o seu próprio modelo, hospedado nos servidores do Vellum em vez de em um CDN externo: cerca de 700 KB comprimidos para o francês, 850 KB para o alemão, 1,3 MB para o italiano, 2,1 MB para o espanhol, 1,4 MB para o português e quase 3 MB para o inglês. Um novo motor de reconhecimento é criado a cada execução, sem cache interno dedicado: só o cache habitual do seu navegador evita um novo download completo de um uso para outro.
Como saber se o resultado é confiável, por exemplo em uma digitalização torta ou de má qualidade?
Uma porcentagem de confiança média é exibida junto com o resultado, calculada sobre o conjunto das palavras reconhecidas. Abaixo de 70 %, um aviso indica que o reconhecimento é incerto e que a digitalização talvez esteja inclinada ou seja de baixa qualidade — é o sinal para digitalizar de novo em vez de confiar no texto obtido.
O que acontece se eu depositar um PDF protegido por senha?
O reconhecimento é recusado imediatamente, com uma mensagem que explica que um PDF criptografado não pode passar por OCR. Primeiro é preciso remover a proteção do documento antes de depositá-lo aqui.