Naar de hoofdinhoud

OCR — doorzoekbaar maken

Uw scans worden tekst — de analyse blijft op uw eigen computer.

Uw bestanden verlaten nooit uw apparaat

Sleep hier een PDF of een afbeelding

Gescande PDF of foto — JPG, PNG

Hoe u de tekst van een gescande PDF herkent (OCR), stap voor stap

OCR zet een scan om in bruikbare tekst door een herkenningsmotor rechtstreeks in uw browser te laden: het document wordt nooit online verzonden.

  1. Sleep een gescande PDF of een foto hierheen

    Sleep een PDF of een JPG/PNG-afbeelding naar het invoervak, of klik om het te doorzoeken.

  2. Kies de taal van het document

    Kies deze bij «Taal van het document»: eerst de talen van de site, daarna meer dan honderd andere, waarvan het model bij het eerste gebruik wordt gedownload. De herkenning is aanzienlijk minder betrouwbaar als de gekozen taal niet overeenkomt met de werkelijke tekst; «Tweede taal» is bedoeld voor tweetalige documenten.

  3. Beperk het paginabereik, als het bestand een PDF is

    Het veld accepteert een bereik zoals «1-3, 5, 8-10»; leeg gelaten, worden alle pagina’s geanalyseerd.

  4. Klik op «Herkenning starten»

    De herkenningsmotor (ongeveer 4 MB) wordt eenmalig van onze servers gedownload, samen met het taalmodel; voor een niet-meegeleverde taal wordt de omvang van het model vooraf gemeld. De eigenlijke analyse gebeurt daarna volledig op uw apparaat.

  5. Lees het resultaat en het betrouwbaarheidsniveau

    De herkende tekst wordt weergegeven met het aantal woorden en een gemiddelde betrouwbaarheid; een lage betrouwbaarheid wijst op een waarschijnlijk scheve of slecht gescande pagina.

  6. Download de tekst of de doorzoekbare PDF

    Het .txt-bestand bevat de pure tekst; de doorzoekbare PDF behoudt de oorspronkelijke opmaak met daaroverheen een onzichtbare tekstlaag, waardoor het document selecteerbaar en doorzoekbaar wordt op trefwoorden.

In de doorzoekbare PDF behoudt een gescande pagina de originele afbeelding en krijgt een onzichtbare tekstlaag die geldig is voor alle schriften, Grieks, Cyrillisch, Arabisch of Chinees inbegrepen; een pagina die al tekst bevatte, wordt herschreven als afbeelding om niet met twee lagen te blijven zitten.

Veelgestelde vragen

Accepteert de OCR van VellumPDF zowel PDF’s als foto’s?

Ja, u kunt een gescande PDF of rechtstreeks een afbeelding in JPG- of PNG-formaat plaatsen. In beide gevallen levert de tool een doorzoekbare PDF op waarvan de tekst kan worden geselecteerd en gekopieerd.

In welke talen werkt de tekstherkenning?

In meer dan honderd talen. De talen van de site zijn inbegrepen en worden door VellumPDF geleverd; de overige talen (Tsjechisch, Grieks, Russisch, Oekraïens, Arabisch, Hebreeuws, Chinees, Japans, Koreaans…) worden gekozen uit dezelfde lijst “Documenttaal”, en het bijbehorende model wordt bij het eerste gebruik eenmalig gedownload. “Tweede taal” behandelt een tweetalig document. De juiste taal kiezen verbetert de betrouwbaarheid van het resultaat aanzienlijk.

Wordt mijn gescand document naar een online AI-dienst verzonden?

Nee. De herkenningsmotor draait in uw browser. Voor de talen van de site komen de bestanden van het domein van VellumPDF; voor een andere taal wordt alleen het bijbehorende model gedownload van raw.githubusercontent.com, de openbare repository van het Tesseract-project, na een melding op het scherm. Deze download gaat maar één kant op: het document verlaat uw apparaat niet en er wordt geen enkele AI-dienst aangeroepen.

Wordt het herkenningsmodel bij elk gebruik gedownload, en hoe groot is het?

Elke taal heeft zijn eigen model. Voor de talen van de site, gehost door VellumPDF: 0,4 tot 3 MB gecomprimeerd, afhankelijk van de taal (ongeveer 700 kB voor het Frans, bijna 3 MB voor het Engels); de gebruikelijke browsercache voorkomt dat ze opnieuw worden gedownload. Voor de overige talen tussen 0,4 en 12 MB naargelang de taal, met de bestandsgrootte getoond vóór het starten; na het downloaden blijft het model in de browser bewaard en wordt er bij het tweede gebruik niets meer gedownload.

Hoe weet u of het resultaat betrouwbaar is, bijvoorbeeld bij een scheve of slechte scan?

Een gemiddeld betrouwbaarheidspercentage wordt samen met het resultaat getoond, berekend over alle herkende woorden. Onder 70% geeft een melding aan dat de herkenning onzeker is en dat de scan mogelijk scheef of van lage kwaliteit is — dat is het signaal om opnieuw te scannen in plaats van op de verkregen tekst te vertrouwen.

Wat gebeurt er als ik een met wachtwoord beveiligde PDF plaats?

De herkenning wordt meteen geweigerd, met een bericht dat uitlegt dat een versleutelde PDF niet door OCR kan gaan. U moet eerst de beveiliging van het document verwijderen voordat u het hier plaatst.