التعرف الضوئي على الحروف (OCR) لملفات PDF الممسوحة
اجعل ملفات PDF الممسوحة قابلة للبحث: يقرأ Tesseract النص العربي والإنجليزي ويضيف طبقة نص غير مرئية.
جارٍ تحميل الأداة…
يقرأ Tesseract، وهو محرك مفتوح المصدر للتعرّف الضوئي على الحروف، النص في كل صفحة. والنتيجة ملف PDF قابل للبحث (صفحاتك كما هي مع طبقة نص غير مرئية يمكنك تحديدها والبحث فيها) وملف .txt.
تجري المعالجة على هذا الجهاز داخل متصفحك، ولا يُرفع أي ملف.
ملف PDF الممسوح ضوئياً مجرد مجموعة صور: لا يمكنك البحث فيه ولا تحديد جملة ولا نسخ رقم. أما التعرف الضوئي على الحروف (OCR) فيقرأ النص داخل هذه الصور. تُرسم كل صفحة بدقة 200 أو 300 نقطة في البوصة، ويقرؤها Tesseract، محرك التعرف الضوئي مفتوح المصدر، داخل متصفحك. وتوضع الكلمات التي يجدها فوق الصفحة في طبقة نص غير مرئية، فيبدو الملف كما كان تماماً لكنه يصبح قابلاً للبحث والتحديد والنسخ، ويُحفظ النص أيضاً في ملف .txt.
تُدعم العربية والإنجليزية، كلٌّ على حدة أو معاً، واللغة الافتراضية في هذه الصفحة هي العربية. ويمكن تخطي الصفحات التي تحتوي نصاً أصلاً، فتُعالج المستندات المختلطة بشكل صحيح. ويظهر التقدم صفحةً صفحة، ويمكنك الإلغاء في أي وقت.
التعرف الضوئي لا يكون مثالياً أبداً. المسح النظيف المستقيم لنص مطبوع بدقة 300 نقطة يعطي نتائج ممتازة، أما خط اليد والدقة المنخفضة وصور الهاتف المائلة والأختام والخطوط الزخرفية فنتائجها ضعيفة. قارن الأسماء والأرقام المهمة بالصفحة الأصلية. والتشغيل الأول ينزّل المحرك وبيانات اللغة (نحو 5.6 ميغابايت للعربية و8.5 ميغابايت للغتين) من هذا الموقع مرة واحدة.
طريقة الاستخدام
- اختر ملف PDF ممسوحاً ضوئياً.
- اختر لغة المستند (العربية، أو الإنجليزية، أو كلتيهما للمستندات المختلطة) والدقة.
- اضغط «تشغيل التعرف الضوئي» وتابع التقدم صفحةً صفحة.
- نزّل ملف PDF القابل للبحث وملف .txt.
أسئلة شائعة
هل يُرفع ملفي، وهل يُنزَّل المحرك من موقع آخر؟
لا يُرفع ملفك. يُنزَّل محرك Tesseract وبيانات اللغة من هذا الموقع نفسه إلى متصفحك مرة واحدة، ثم يجري التعرف على جهازك.
هل يغيّر التعرف الضوئي شكل ملف PDF؟
لا. تبقى صفحاتك كما هي تماماً، وتُضاف فوقها طبقة نص غير مرئية مطابقة لمواضع الكلمات، فيعمل التحديد والبحث.
ما دقة التعرف على العربية؟
في المسح النظيف لنص مطبوع بخطوط شائعة تكون الكلمات صحيحة في أغلب الحالات. أما التشكيل فكثيراً ما يسقط، وخط اليد والخط العربي الزخرفي نادراً ما يُقرآن جيداً. وقد يختلف ترتيب الكلمات العربية عند لصق النص المنسوخ من قارئ PDF إلى آخر.
كم يستغرق التعرف؟
نحو 2 إلى 10 ثوانٍ للصفحة على حاسوب حديث بدقة 300 نقطة، وأطول على الهواتف. استخدم 200 نقطة لنتيجة أسرع بدقة أقل قليلاً.
ما الفرق بين هذه الأداة وأداة تحويل الصورة إلى نص؟
هذه الأداة لملفات PDF متعددة الصفحات، وتنتج ملف PDF قابلاً للبحث مع ملف نصي. أما تحويل الصورة إلى نص فلصورة واحدة أو لقطة شاشة، وتعطيك النص فقط لتنسخه.
ماذا لو كان ملف PDF محمياً بكلمة مرور؟
الملفات المحمية أو المقيدة لا يمكن فتحها هنا. إن كان الملف لك وتعرف كلمة المرور، فأزل الحماية أولاً بأداة Unlock PDF (بالإنجليزية)، ثم عد إلى هذه الأداة.
أدوات ذات صلة
- تحويل PDF إلى Wordحوّل ملف PDF نصياً إلى مستند Word قابل للتعديل، مع إعادة بناء الفقرات والعناوين.
- ضغط ملف PDF: تصغير الحجم ليناسب حد الرفعصغّر حجم ملف PDF على جهازك مع إبقاء النص قابلاً للتحديد، أو أوصله إلى حد تختاره مثل 200 كيلوبايت لنموذج رفع.
- تحويل الصورة إلى نص: استخراج الكتابة من صورة أو لقطة شاشةانسخ النص من صورة أو لقطة شاشة بالتعرّف الضوئي على الحروف على جهازك، بالعربية والإنجليزية، مع تحسين الصور الباهتة أو الصغيرة.
- دمج ملفات PDF في ملف واحداجمع عدة ملفات PDF في ملف واحد بالترتيب الذي تختاره. يعمل في متصفحك ولا يُرفع أي ملف.
- Extract text from a PDFExtract the text of a PDF in reading order and download it as a .txt file or copy it.
- Scan documents to PDFPhotograph pages with your camera, clean them up to look like scans and save them as one PDF.