انتقل إلى المحتوى الرئيسي

التعرف على النص (OCR)

تتحول مسوحاتك الضوئية إلى نص — ويبقى التحليل على جهازك.

لا تغادر ملفاتك جهازك أبدًا

أفلت ملف PDF أو صورة هنا

ملف PDF ممسوح ضوئيًا أو صورة — JPG أو PNG

كيف تتعرّف على نص ملف PDF ممسوح ضوئيًا، خطوة بخطوة

يحوّل OCR مسحًا ضوئيًا إلى نص قابل للاستغلال، بتحميل محرك تعرّف مباشرة داخل متصفحك: فلا يغادر المستند جهازك إلى الإنترنت أبدًا.

  1. أفلت ملف PDF ممسوحًا ضوئيًا أو صورة

    اسحب ملف PDF أو صورة JPG/PNG إلى منطقة الإفلات، أو انقر لاستعراضها.

  2. اختر لغة المستند

    اخترها من «لغة المستند»: لغات الموقع في المقدمة، ثم أكثر من مئة لغة أخرى يُنزَّل نموذجها عند أول استخدام. ويقل التعرّف موثوقية بوضوح إذا لم تطابق اللغة المختارة النص الفعلي؛ ويُستخدم «اللغة الثانية» للمستندات ثنائية اللغة.

  3. حدّد نطاق الصفحات، إذا كان الملف PDF

    يقبل الحقل نطاقًا مثل «1-3, 5, 8-10»؛ وإذا تُرك فارغًا حُلِّلت كل الصفحات.

  4. انقر على «بدء التعرّف»

    يُنزَّل محرك التعرّف (نحو 4 م.ب) مرة واحدة فقط من خوادمنا، مع نموذج اللغة؛ وفي لغة غير مضمّنة، يُعلَن حجم النموذج قبل البدء. ثم يجري التحليل نفسه بالكامل على جهازك.

  5. اقرأ النتيجة ومستوى الثقة فيها

    يظهر النص المتعرَّف عليه مع عدد الكلمات ومتوسط الثقة؛ وتدل ثقة منخفضة على مسح ضوئي مائل غالبًا أو رديء الجودة.

  6. نزّل النص أو ملف PDF القابل للبحث

    يحتوي ملف .txt على النص الخام؛ أما ملف PDF القابل للبحث فيحتفظ بالتنسيق الأصلي مع طبقة نص غير مرئية فوقه، تجعل المستند قابلًا للتحديد والبحث بالكلمات المفتاحية.

في ملف PDF القابل للبحث، تحتفظ الصفحة الممسوحة ضوئيًا بصورتها الأصلية وتتلقى طبقة نص غير مرئية صالحة لكل الكتابات، بما فيها اليونانية والسيريلية والعربية والصينية؛ أما الصفحة التي كانت تحتوي على نص أصلًا فتُعاد تركيبها كصورة حتى لا تحمل طبقتين.

أسئلة شائعة

هل يقبل OCR في VellumPDF ملفات PDF والصور الفوتوغرافية على حد سواء؟

نعم، يمكنك إفلات ملف PDF ممسوح ضوئيًا أو صورة مباشرة بصيغة JPG أو PNG. وفي الحالتين، تنتج الأداة ملف PDF قابلًا للبحث يمكن تحديد نصه ونسخه.

بأي لغات يعمل التعرّف على النص؟

أكثر من مئة لغة. فلغات الموقع مضمّنة ويقدّمها VellumPDF؛ أما الأخرى (التشيكية واليونانية والعبرية والفارسية…) فتُختار من القائمة نفسها «لغة المستند»، ويُنزَّل نموذجها مرة واحدة، عند أول استخدام. وتعالج «اللغة الثانية» مستندًا ثنائي اللغة. واختيار اللغة الصحيحة يحسّن موثوقية النتيجة بوضوح.

هل يُرسل مستندي الممسوح ضوئيًا إلى خدمة ذكاء اصطناعي عبر الإنترنت؟

لا. يعمل محرك التعرّف داخل متصفحك. فبالنسبة إلى لغات الموقع، تأتي ملفاته من نطاق VellumPDF؛ وبالنسبة إلى لغة أخرى، لا يُنزَّل سوى نموذجها من raw.githubusercontent.com، المستودع العام لمشروع Tesseract، بعد إعلان على الشاشة. ويسير هذا التنزيل في اتجاه واحد: فلا يغادر المستند جهازك ولا يُستدعى أي خدمة ذكاء اصطناعي.

هل يُنزَّل نموذج التعرّف عند كل استخدام، وكم يزن؟

لكل لغة نموذجها الخاص. فبالنسبة إلى لغات الموقع، التي يستضيفها VellumPDF: من 0.4 إلى 3 م.ب مضغوطة بحسب اللغة (نحو 700 ك.ب للفرنسية، ونحو 3 م.ب للإنجليزية)؛ وتجنّب ذاكرة التخزين المؤقت المعتادة في المتصفح إعادة تنزيلها. وبالنسبة إلى اللغات الأخرى، بين 0.4 و12 م.ب بحسب اللغة، ويُعرض الوزن قبل البدء؛ وبعد التنزيل، يحتفظ المتصفح بالنموذج ولا ينزّل الاستخدام الثاني أي شيء.

كيف أعرف هل النتيجة موثوقة، مثلًا في مسح ضوئي مائل أو رديء الجودة؟

تظهر نسبة ثقة متوسطة مع النتيجة، تُحسب على مجموع الكلمات المتعرَّف عليها. وتحت 70%، ينبّه تحذير إلى أن التعرّف غير مؤكد وأن المسح الضوئي ربما كان مائلًا أو منخفض الجودة — وهذه إشارة لإعادة المسح بدل الوثوق بالنص المحصَّل.

ماذا يحدث إذا أفلتّ ملف PDF محميًا بكلمة مرور؟

يُرفض التعرّف فورًا، برسالة تشرح أن ملف PDF المشفّر لا يمكن تطبيق OCR عليه. فيجب أولًا إزالة الحماية عن المستند قبل إفلاته هنا.

هل يمكن إجراء OCR على عدة مستندات دفعة واحدة؟

لا، تعالج الأداة ملفًا واحدًا في كل مرة — ملف PDF ممسوحًا ضوئيًا أو صورة. ولعدة مستندات، يجب إعادة العملية لكل منها.