مقالات متنوعة

لماذا تفشل أدوات OCR العالمية مع النصوص العربية؟ الأسباب التقنية الحقيقية، وكيف تجاوزها بصير؟؟

الأدمن
7 دقائق للقراءة
لماذا تفشل أدوات OCR العالمية مع النصوص العربية؟

حاولنا نسخ محتوى من ملف PDF للاستفادة منه في أحد المشاريع، لنُفاجأ بحروف مقلوبة ورموز غريبة ومسافات شاذة، بل إن الجداول اختفت كلياً. وحين لجأنا إلى أداة OCR " والمعروفة باسم: النماذج الرؤيوية اللغوية" لاستخراج النص رقمياً، نجحت في سحب المحتوى، غير أن الجداول تحولت إلى صفوف متناثرة بلا ترابط، وانقلب ترتيب الكلمات رأساً على عقب.

هذه كانت تجربة أحد عملائنا.التي توضح مدى بأهمية وجود OCR دقيق يحول محتوى هذا المستند إلى نص رقمي قابل للتحرير والفهرسة والمعالجة الآلية، لكن الأدوات التي بنيت لهذا الغرض أغلبها لم يبنَ لأجل العربية، وذلك لأن معظم أدوات ocr أسست للغات ذات حروف منفصلة، تُكتب من اليسار إلى اليمين، وتعتمد على مئات الملايين من الصفحات في التدريب. لكن اللغة العربية، بكل تعقيداتها البصرية والبنيوية، كانت في أحيان كثيرة فكرة لاحقة، لا هدفا أصيلاً، يدعم العربية ولم يبن من أجل العربية، كما أن الأداء في مجمله غير مرض خاصة في حالات الملفات ذات البنية المعقدة أو الملفات ذات الجودة الضعيفة سواء ضمن النصوص أو الصور التي تتضمنها الملفات، مما يؤدي إلى خسران بنية الملفات، وغيرها من المشاكل! هذا المقال يشرح الأسباب التقنية الحقيقية والدواعي لبناء ocr منطلق من العربية لخدمتها!

1 العربية باعتبارها نظام كتابة مختلف

قبل أن نفهم لماذا تفشل الأدوات، يجب أن نفهم ما الذي يجعل العربية مختلفة بصرياً وبنيوياً عن اللغات التي صُممت لها أغلب أنظمة OCR.

1-1 الكتابة المتصلة: كل حرف يتغير شكله

في اللغة الانجليزية، الحرف A هو A دائماً في بداية الكلمة أو نهايتها أو وسطها. ليس كذلك في العربية. الحرف العربي الواحد يأخذ حتى أربعة أشكال مختلفة تبعاً لموقعه في الكلمة: شكل في البداية، وآخر في الوسط، وثالث في النهاية، ورابع إذا جاء منفرداً. وتُفيد دراسات OCR المتخصصة بأن منظومة الكتابة العربية تحتوي على ما لا يقل عن 81 شكلاً مختلفاً للحروف في مجموعها. الحرف «ب» في «بدر» يختلف شكله عن «ب» في «عرب» وعن «ب» في «كتب» ثلاثة مواضع، ثلاثة أشكال. خوارزمية OCR لم تُدرَّب على هذا ترى ثلاثة حروف مختلفة لا حرفاً واحداً.

المصدر: ACM Computing Surveys, Advancements and Challenges in Arabic OCR, 2025

المصدر: Contour-based character segmentation for printed Arabic text with diacritics

1-2 الكتابة المنسابة لا مسافات بين الحروف

اللغة الإنجليزية واللغات اللاتينية، تُكتب بحروف منفصلة، حتى وإن بدت متصلة في بعض الخطوط. لكن العربية من خواصها الظاهرية أن تكتب بخط مُنساب cursive، فكلمة كـ"مستشفى" التي تتألف من ستة حروف تبدو للخوارزمية كشريط بصري واحد متواصل لا فواصل فيه، بينما نظيرتها الإنجليزية hospital يرى فيها النظام ثمانية حروف مستقلة بصرياً منذ البداية، مما يجعل مهمة «تجزئة الحروف» segmentation وهي الخطوة الأساسية في أنظمة الـ ocr التقليدية تصبح أصعب بكثير. وذلك لأن الخوارزمية تحاول أن تجد حدود الحروف في شريط نصي متواصل، بدل نقاط فصل واضحة

المصدر: Novel deep convolutional neural network-based contextual recognition of Arabic handwritten scripts

1-3 النقاط والتشكيل فوق الحروف وتحتها

كثير من الحروف العربية تتشابه في شكلها الأساسي وتختلف فقط بعدد النقاط وموقعها: (ب) و(ت) و(ث) و(ي) و(ن) خمسة حروف مختلفة، شكلٌ واحدٌ مشترك مع نقاطٍ مختلفة. أما التشكيل؛ الفتحة والضمة والكسرة والتنوين والسكون؛ فيحمل فارقاً دلالياً حاسماً. كلمة «بَيْتٌ» تختلف عن «بَيَّت» اختلافاً جوهرياً. وحين تُهمل أدوات OCR التشكيل أو تحوّله رموزاً غريبة، يتغير المعنى ويصبح النص غير قابل للفهم في الغالب والاستخدام في سياقات عديدة. في مراجعة بحثية شاملة نُشرت في MDPI Applied Sciences، صُنّف التشكيل والاتصال ضمن أكبر التحديات التي تواجه أنظمة OCR عند معالجة النصوص العربية.

المصدر: MDPI Applied Sciences, A Survey of OCR in Arabic Language, 2023

المصدر: Contour-based character segmentation for printed Arabic text with diacritics

1-4 لاتجاه ثنائي الطرفين RTL مع LTR في نفس السطر

العربية تُكتب من اليمين إلى اليسار. لكن الأرقام الموجودة داخل النص العربي تُكتب من اليسار إلى اليمين. هذا التناوب بين الاتجاهين يُسمى النص ثنائي الاتجاه bidirectional text. أنظمة OCR التي صُممت أصلاً لمعالجة النص من اليسار إلى اليمين (LTR) تنقل هذا النص مقلوباً فترى التواريخ مكتوبة بشكل معكوس، والأرقام في غير مواضعها، وترتيب الكلمات مختلاً.

1-5 الكتابة المختلطة العربية والإنكليزية، وَورود نص إنجليزي داخل النص العربي

تزداد المهمة تعقيداً عندما يحتوي السطر الواحد على مزيج من الكلمات العربية والإنجليزية (مثل المصطلحات التقنية أو الأسماء الأجنبية). وبما أن العربية تُكتب من اليمين والإنجليزية من اليسار، فإن خوارزميات OCR التي لم تُصمم لهذا التداخل تفقد "البوصلة" تماماً؛ فتبدأ بقراءة الكلمة الإنجليزية من نهايتها، أو تقحمها في مكان خاطئ داخل الجملة، مما يحول النص إلى فوضى. مما يؤدي لإفساد المعنى والإخلال بانسيابية النص مما يجعل عملية الفهرسة والبحث الآلي داخل المستندات الرقمية شبه مستحيلة.

2 تنوع الخطوط كل خط «لغة» مختلفة للخوارزمية

اللغة العربية غنية بتنوع خطوطها الطباعية والخطية بشكل لا مثيل له في معظم اللغات الأخرى. وما يبدو للقارئ البشري تفاوتاً في الأسلوب الجمالي، يمثل لخوارزمية OCR غير المدرَّبة جيداً تبايناً حاداً يصعب التعرف عليه.

هذا التعدد يفرض تحدياً مزدوجاً؛ فالخطوط الليّنة كالديواني والثلث تعتمد على التراكب الرأسي (حروف فوق حروف)، مما يربك أنظمة المسح التي تبحث عن مسار أفقي مستقيم. بينما تظهر الخطوط الحديثة بتبسيط هندسي قد يمحو بعض الملامح التقليدية التي تدربت عليها النماذج القديمة. إن غياب "المعيارية البصرية" في الخط العربي جعل من المستحيل على أداة لم تُبنَ خصيصاً لهذه البيئة أن تفهم أن "الميم" المكتوبة بلمسة فنية هي ذاتها "الميم" المطبوعة في كتاب مدرسي، مما يؤدي في النهاية إلى انهيار دقة التعرف عند أول تغيير في نمط الخط.

نمط الخط: عريضنمط الخط: مائلنمط الخط: عادينوع الخط
<span style="font-family: 'Noto Naskh Arabic', serif;">نموذج بصير من مسراج</span><span style="font-family: 'Noto Naskh Arabic', serif;">*نموذج بصير من مسراج*</span><span style="font-family: 'Noto Naskh Arabic', serif;">نموذج بصير من مسراج</span>خط النسخ
<span style="font-family: 'Noto Kufi Arabic', sans-serif;">نموذج بصير من مسراج</span><span style="font-family: 'Noto Kufi Arabic', sans-serif;">*نموذج بصير من مسراج*</span><span style="font-family: 'Noto Kufi Arabic', sans-serif;">نموذج بصير من مسراج</span>خط كوفي
<span style="font-family: 'Noto Nastaliq Urdu', serif;">نموذج بصير من مسراج</span><span style="font-family: 'Noto Nastaliq Urdu', serif;">*نموذج بصير من مسراج*</span><span style="font-family: 'Noto Nastaliq Urdu', serif;">نموذج بصير من مسراج</span>خط النستعليق

3 تخطيط الصفحة وخصوصية المستند العربي

حتى لو افترضنا أن أداة OCR تعرفت على الحروف العربية بشكل معقول، تبقى مشكلة جوهرية: فهم تخطيط الصفحة.

3-1 أدوات OCR تقرأ «سطوراً» لا «صفحات»

نماذج OCR التقليدية تتعامل مع المستند كمجموعة سطور نصية مرتبة من الأعلى إلى الأسفل. لكن المستندات الحقيقية ليست كذلك: فيها جداول ذات خلايا وصفوف وأعمدة، وعناوين بأحجام مختلفة، وقوائم مرقمة ونقطية، وحواشٍ سفلية، وعناصر متعددة الأعمدة. حين تقرأه أداة OCR مبنية على نموذج سطر بسطر هذا النوعَ من المستندات، تخرج النتيجة كفقرة واحدة طويلة مشوهة بيانات الجدول مختلطة، وترتيب المعلومات مقلوب.

3-2 خصوصية المستند العربي

في المستند العربي، التخطيط يحمل معنى قانونياً وأكاديمياً ومهنياً. جدول عقد إيجار يتضمن: اسم الطرف الأول، اسم الطرف الثاني، قيمة الإيجار، تاريخ البداية، تاريخ النهاية. إذا تفككت خلايا هذا الجدول واختلطت بياناتها، أصبح المستند غير قابل للاستخدام قانونياً، بل خطراً. الباحثون في مشروع REJD (مجموعة بيانات وثائق عقارية وقضائية) الذي نُشر في مجلة Electronics التابعة لـ MDPI عام 2025، أكدوا أن الحكومات تحتاج لرقمنة الوثائق الرسمية كسجلات الملكية وقرارات المحاكم وأن فشل تحليل التخطيط يمثل العقبة الأولى.

المصدر: MDPI Electronics, Toward Building a Domain-Based Dataset for Arabic Handwritten Text Recognition, 2025

4 معضلة جودة الصفحة: هل الأداة مرنة بما يكفي (Robust)؟

غالبا ما تكون المستندات بجودة غير مثالية؛ خاصة تلك المعدة من الأوراق الممسوحة ضوئياً بهواتف محمولة، أو التي تعاني من ضعف الإضاءة، أو بهتان الحبر، أو حتى "الضجيج" البصري الناتج عن طيات الورق. مما يجعل أغلب أدوات OCR تفقد دقتها بمجرد انخفاض جودة الصورة، وذلك لاعتمادها على مطابقة الأنماط (Pattern Matching) التي تتطلب وضوحاً عالياً للحواف.

أما التحدي الأكبر في العربية، فهو "تآكل الحروف"؛ فحين تبهت نقطة حرف "القاف" أو تتصل "السين" بما بعدها بسبب رداءة المسح، تفقد أدوات OCR الحالية قدرتها على التمييز تماماً. هنا تظهر بجلاء أهمية الأنظمة التي تتمتع بمرونة عالية (Robustness)، والتي تقرأ الحرف وتفهمه ضمن سياقه اللغوي والبصري لتعويض النقص في جودة الصفحة.

5 أزمة البيانات ملايين الصفحات مقابل آلاف

يستلزم تدريب نموذج OCR عالي الدقة كميات ضخمة من البيانات: صور مستندات تحمل نصاً، إلى جانب النص الصحيح المقابل كمرجع. الفجوة بين اللغة الإنجليزية واللغة العربية في هذه النقطة واسعة جداً.

المعيارالإنجليزيةالعربية
الحجممئات الملايين من الصفحاتآلاف إلى مئات الآلاف من الصفحات
التنوعمجموعات بيانات متنوعة لكل الخطوط والأحجاممجموعات بيانات شحيحة خاصة للخطوط القديمة وخط اليد
النضجنماذج مفتوحة المصدر ناضجة ومتاحة منذ عقودنماذج مفتوحة المصدر حديثة ومحدودة الدقة
البنية التحتيةبنية تحتية بحثية ضخمة وتاريخ طويلمجال بحثي ناشئ يحتاج إلى استثمارات أكبر

هذه الفجوة تعني أن نماذج مثل Tesseract وهو مفتوح المصدر ويُستخدم على نطاق واسع تعتمد على بيانات تدريب عربية أقل كثافة وأقل تنوعاً. المجتمعات التقنية مثل Reddit r/OCR وr/computervision تمتلئ بالشكاوى من الأداء المتواضع لـ Tesseract مع العربية، مع توصيات بـ EasyOCR كبديل أفضل نسبياً لكن حتى هذا البديل يعاني في الجداول والتخطيطات المعقدة.

«جربنا Tesseract للعربي النتائج محبطة حتى مع كل الـ preprocessing. EasyOCR أفضل قليلاً لكن الجداول تضيع تماماً.» نقاش في Reddit r/computervision

6 أزمة البيانات, ملايين الصفحات مقابل آلاف

حتى الأدوات الأكثر شيوعاً والمدعومة من شركات عملاقة لا تُستثنى من هذه الإشكاليات حين يتعلق الأمر بالنصوص العربية:

  • ### Tesseract الأكثر استخداماً، لكن ليس للعربية

Tesseract مفتوح المصدر، مجاني، وسريع. لكنه صُمم في الأساس لمعالجة النص المطبوع النظيف ذو الخط الواضح. يعتمد على مراحل تجزئة وتصنيف تقليدية وهي بالتحديد ما تُخفق مع الحروف المتصلة.

في اختبارات عملية موثقة عبر منتديات تقنية متعددة، احتاج مستخدمو Tesseract مع العربية إلى طبقات معالجة مسبقة كثيرة (تحسين الإضاءة، تصحيح الميل، تحسين التباين) للحصول على نتائج قريبة من المقبولة ومع ذلك تبقى دقة الجداول والخطوط المتشابكة ضعيفة.

  • ### Adobe Acrobat جيد للإنجليزية، متوسط للعربية

Adobe Acrobat Pro يتضمن محرك OCR متطوراً ويعمل جيداً مع النصوص اللاتينية. لكن تقييمات المستخدمين للنصوص العربية تشير إلى دقة متوسطة، خاصة مع الخطوط غير المعيارية أو الوثائق القديمة. علاوة على ذلك، استخراج الجداول في المستندات العربية يُعدّ نقطة ضعف موثقة، ولا يوفر API مرن للمطورين.

  • ### google documents AI وMicrosoft Azure Document Intelligence

هذه الأدوات السحابية تتفوق على Tesseract بفارق واضح من حيث الدقة العامة وتدعم العربية ضمن قائمة لغاتها. لكن بناءها على نماذج متعددة اللغات يعني أن العربية «لغة مدعومة» لا «لغة مُحسَّن لها». تكاليفها مرتفعة عند الاستخدام بالحجم ($1.5 لكل ألف صفحة للنص الأساسي، وتقفز بشكل كبير للجداول والبنية)، وتمرير المستندات عبر خوادم خارجية يُثير قلقاً حقيقياً في سياقات الخصوصية والمستندات الحساسة.

  • ### Mistral OCR

يُمثل Mistral OCR الجيل الأحدث من أدوات فهم المستندات التي أطلقتها شركة Mistral AI، حيث يعتمد على بنية "النماذج الرؤيوية" القادرة على قراءة المستند ككتلة بصرية متكاملة تشمل النصوص والصور والمعادلات الرياضية المعقدة في آن واحد. ورغم تفوقه الملحوظ في اختبارات الأداء العالمية وقدرته على استخراج المحتوى بتنسيق Markdown المنظم، إلا أنه يظل نموذجاً "عالمياً" صُمم لخدمة آلاف اللغات والأنظمة الكتابية؛ وهذا يعني أن خصوصية العربية - بكل تعقيدات اتصال حروفها وتعدد أشكالها وتداخل نقاطها- تظل ضمن نطاق الدعم العام وليست في قلب عملية التحسين الجوهري.

لكن المستخدم العربي لا يزال يواجه معه تحديات من قبيل أنه لا يدعم بُنى عربية معقدة، كما أنه في بعض الأحيان ينتج نصا مكررا وهلوسة واضحة في بعض الأجزاء إضافة إلى اختلال في ضبط التشكيل الدقيق أو الحفاظ على الاتجاه الصحيح للنص ثنائي الطرفين (RTL/LTR) في الجداول الأكثر تعقيداً، مما يجعل مخرجاته أحياناً بحاجة إلى مراجعة بشرية لضمان الدقة اللغوية والبنيوية الكاملة.

المصدر: E2E Networks OCR Guide 2025 مقارنة تكاليف وأداء أدوات OCR

7 بصير OCR بني للعربية من الأساس

كل المشاكل التي استعرضناها تنبثق من افتراض واحد خاطئ: أن نموذجاً مدرَّباً على الإنجليزية يمكن «تكييفه» ليعمل مع العربية.لكن بصير ينطلق من نموذج مدرب على لغات عدة من بينها: العربية والإنجليزية كلغات أساسية

بناءٌ على بيانات عربية حقيقية

بصير نموذج رؤيوي لغوي طوّرته شركة مسراج للذكاء الاصطناعي، مبني على Qwen2.5 VL 3B وأُعيد تدريبه تدريباً دقيقاً على 769,000 صفحة من المستندات العربية. هذه الصفحات تشمل: كتباً أكاديمية، وثائق حكومية، فواتير تجارية، مجلات، وأوراق بحثية بتنوع خطوط وأحجام وجودة صور يعكس واقع الاستخدام الفعلي. بصير يتفوق على Gemini 2.5 Pro وGPT-4o وAzure Document Intelligence في معيار Misraj DocOCR وهو معيار تقييم مكوّن من 400 مستند عربي متنوع مُراجَع يدوياً -تراجع الورقة البحثية-

يقرأ الصفحة كصورة كاملة لا كسطور

إن ما يميز بصير أنه نموذج رؤيوي لغوي Vision Language Model أنه أُنشِئ خصيصا للغة العربية حيث دُرِّب على بيانات متنوعة ومناسبة، وأنه يتعامل مع المستند كصورة شاملة يفهمها بصرياً وسياقياً لا كتسلسل سطور. هذا يعني أنه يعرف هيكلة الجداول ويحافظ على تخطيطها، ويميز العناوين عن الفقرات، ويحترم التسلسل الهرمي للنص، ويحوّل كل ذلك إلى Markdown منظم يعكس بنية الوثيقة الأصلية. مما ينتج لنا محتوى جاهز للاستخدام مباشرة في الأبحاث والأنظمة والتطبيقات.

ModelWERCERBLEUCHRFTEDSMARS
Baseer_v20.190.1276.3188.946777.8
gemini_2.5_pro0.370.3177.9289.555270.775
Azure Document Intelligence0.440.2762.0482.494262.245
Dots_ocr0.50.458.1678.414059.205
Nanonets_OCR2_3B0.780.7144.2968.394958.695
GPT-50.860.6240.6761.64854.8
Qwen2_5_vl_32b0.760.5937.6262.644151.82
Qwen3_VL_8B_Instruct0.870.7832.9554.544951.77
DeepSeek_OCR0.880.8141.5762.333046.165
MISTRAL0.490.4252.4471.811744.405
Qari0.760.6438.5964.52142.75
Gemma3_12B0.960.819.7544.533338.765

المصدر: Misraj DocOCR Benchmark - 400 مستند عربي متنوع ومراجع يدوياً. Misraj AI, 2026

ختاما فالأسباب دائماً بنيوية والحل يبدأ بالاختيار الصحيح

فشل أدوات OCR مع النصوص العربية ليس عطلاً تقنياً يمكن حله بضبط الإعدادات إنه نتيجة طبيعية لأدوات بُنيت لغرض مختلف. الأسباب الجوهرية يمكن تلخيصها:

  • 81 شكلاً للحروف في منظومة الكتابة العربية، لا تغطيها الأدوات العامة.
  • الكتابة المتصلة تجعل عملية التجزئة أصعب بكثير.
  • التشكيل والنقاط تُهمل أو تتحول إلى رموز لا معنى لها.
  • الاتجاه ثنائي الطرفين (RTL/LTR) يقلب ترتيب الكلمات والأرقام.
  • تنوع الخطوط (الرقعة، الديواني، النسخ، الكوفي) يتجاوز قدرات النماذج العامة.
  • فشل تحليل التخطيط يحول الجداول إلى فوضى نصية غير قابلة للاستخدام.
  • شح بيانات التدريب العربية مقارنة بالإنجليزية.

وفي النهاية، يبرز "بصير" منبثقاً من لغته الأم، وليس من لغات الآخرين.

المصادر والمراجع

  1. Salaheldin Kasem, M., Mahmoud, M., & Kang, H. S. (2025). Advancements and challenges in Arabic optical character recognition: A comprehensive survey. ACM Computing Surveys, 58(4), 1-37.
  2. Faizullah, S., Ayub, M. S., Hussain, S., & Khan, M. A. (2023). A survey of OCR in Arabic language: applications, techniques, and challenges. Applied Sciences, 13(7), 4584.
  3. Faizullah, S., Ayub, M. S., Alghamdi, T., Ali, T. S., Khan, M. A., & Nabil, E. (2024). Revolutionizing Historical Document Digitization: LSTM-Enhanced OCR for Arabic Handwritten Manuscripts. International Journal of Advanced Computer Science & Applications, 15(10).
  4. Alhefdhi, K., Alsalman, A., & Faizullah, S. (2025). Toward Building a Domain-Based Dataset for Arabic Handwritten Text Recognition. Electronics, 14(12), 2461.
  5. Ahmed, R., Gogate, M., Tahir, A., Dashtipour, K., Al-Tamimi, B., Hawalah, A., ... & Hussain, A. (2021). Novel deep convolutional neural network-based contextual recognition of Arabic handwritten scripts. Entropy, 23(3), 340.
  6. Mohammad, K., Qaroush, A., Ayesh, M., Washha, M., Alsadeh, A., & Agaian, S. (2019). Contour-based character segmentation for printed Arabic text with diacritics. Journal of Electronic Imaging, 28(4), 043030-043030.
  7. Flitto DataLab Arabic Text Recognition: Challenges and Solutions, 2024
  8. Encyclopedia MDPI Arabic Optical Character Recognition Challenges, 2023
  9. E2E Networks Complete Guide to Open Source OCR Models 2025
  10. Reddit r/OCR, r/computervision مناقشات مستخدمين حول OCR العربي (تجارب موثقة)
  11. Misraj AI بصير: النموذج الرؤيوي اللغوي من مسراج لفهم المستندات العربية، 2026
  12. Misraj DocOCR Benchmark 400 مستند عربي متنوع، مُراجَع يدوياً