Розпізнавання тексту (OCR)
Ваші скани стають текстом, а аналіз залишається на Вашому компʼютері.
Ваші файли ніколи не залишають Вашого пристроюПеретягніть сюди PDF чи зображення
Відсканований PDF чи фото: JPG, PNG
Як розпізнати текст відсканованого PDF, крок за кроком
OCR перетворює скан на текст, придатний до використання, завантажуючи рушій розпізнавання безпосередньо у Ваш браузер: документ ніколи не йде в інтернет.
Перетягніть відсканований PDF чи фото
Перетягніть PDF чи зображення JPG/PNG у зону перетягування або натисніть, щоб вибрати його.
Оберіть мову документа
Оберіть її в «Мова документа»: спершу мови сайту, потім понад сотня інших, модель яких завантажується під час першого використання. Розпізнавання помітно менш надійне, якщо обрана мова не відповідає справжньому тексту; «Друга мова» слугує для двомовних документів.
Обмежте діапазон сторінок, якщо файл є PDF
Поле приймає діапазон на кшталт «1-3, 5, 8-10»; якщо залишити його порожнім, аналізуються всі сторінки.
Натисніть «Почати розпізнавання»
Рушій розпізнавання (близько 4 МБ) завантажується лише один раз із наших серверів, разом із моделлю мови; для мови, яку не включено, вагу моделі повідомляють перед запуском. Сам аналіз потім відбувається цілком на Вашому пристрої.
Прочитайте результат і рівень упевненості
Розпізнаний текст зʼявляється з кількістю слів і середньою впевненістю; низька впевненість указує на скан, імовірно, нахилений чи поганої якості.
Завантажте текст або PDF, придатний для пошуку
Файл .txt містить простий текст; PDF, придатний для пошуку, зберігає початкову верстку з невидимим текстовим шаром поверх, який робить документ придатним для виділення й пошуку за ключовими словами.
У PDF, придатному для пошуку, відсканована сторінка зберігає своє початкове зображення й отримує невидимий текстовий шар, чинний для всіх писемностей, зокрема грецької, кирилиці, арабської чи китайської; сторінка, що вже містила текст, перескладається як зображення, щоб не мати двох шарів.
Поширені запитання
Чи OCR VellumPDF приймає і PDF, і фото?
Так, можна перетягнути відсканований PDF або безпосередньо зображення у форматі JPG чи PNG. В обох випадках інструмент створює PDF, придатний для пошуку, текст якого можна виділяти й копіювати.
Якими мовами працює розпізнавання тексту?
Понад сотнею мов. Мови сайту включено й обслуговуються VellumPDF; інші (чеська, грецька, іврит, перська…) обираються в тому самому списку «Мова документа», а їхня модель завантажується один раз, під час першого використання. «Друга мова» обробляє двомовний документ. Вибір правильної мови помітно підвищує надійність результату.
Чи мій відсканований документ надсилається до онлайн-сервісу штучного інтелекту?
Ні. Рушій розпізнавання виконується у Вашому браузері. Для мов сайту його файли надходять з домену VellumPDF; для іншої мови завантажується лише її модель із raw.githubusercontent.com, публічного репозиторію проєкту Tesseract, після повідомлення на екрані. Це завантаження відбувається лише в один бік: документ не залишає Вашого пристрою, і жоден сервіс штучного інтелекту не викликається.
Чи модель розпізнавання завантажується під час кожного використання і яку вагу це становить?
Кожна мова має власну модель. Для мов сайту, розміщених VellumPDF: від 0,4 до 3 МБ у стиснутому вигляді залежно від мови (близько 700 КБ для французької, майже 3 МБ для англійської); звичайний кеш браузера уникає повторного завантаження. Для інших мов від 0,4 до 12 МБ залежно від мови, вага показується перед запуском; після завантаження модель зберігається браузером, і друге використання вже нічого не завантажує.
Як дізнатися, чи результат надійний, наприклад, на кривому чи низькоякісному скані?
Разом з результатом показується відсоток середньої впевненості, обчислений за всіма розпізнаними словами. Нижче 70 % попередження вказує, що розпізнавання непевне, а скан, можливо, нахилений чи низької якості: це сигнал перескантувати, а не довіряти отриманому тексту.
Що буде, якщо я перетягну PDF, захищений паролем?
Розпізнавання відхиляють одразу, із повідомленням, що зашифрований PDF не можна обробити OCR. Спершу треба зняти захист із документа, перш ніж перетягувати його сюди.
Чи можна виконати OCR кількох документів за один раз?
Ні, інструмент обробляє один файл за раз: відсканований PDF чи зображення. Для кількох документів операцію треба повторити для кожного з них.