مقالات متخصصة في مجال معالجة المستندات ، وأدوات الذكاء الاصطناعي للمحتوى العربي
بصير هو نموذج رؤيوي لغوي طورناه في مسراج لتحويل صور المستندات العربية وملفات PDF إلى نص منظم بصيغة Markdown مع الحفاظ على البنية. دُرب على ~750 ألف صفحة، ويتفوق على كافة النماذج في سياق اللغة العربية في تحويل المستندات إلى نصوص.
حاولنا نسخ محتوى من ملف PDF للاستفادة منه في أحد المشاريع، لنُفاجأ بحروف مقلوبة ورموز غريبة ومسافات شاذة، بل إن الجداول اختفت كلياً. وحين لجأنا إلى أداة OCR (والمعروفة باسم «النماذج الرؤيوية اللغوية») لاستخراج النص رقمياً، نجحت في سحب المحتوى، غير أن الجداول تحولت إلى صفوف متناثرة بلا ترابط، وانقلب ترتيب الكلمات رأساً على عقب.
لا يزال التعرف الضوئي على الحروف العربية (OCR) مهمة صعبة للغاية. فالكتابة المتصلة، والتراكيب المعقدة للحروف، وتنوع الخطوط، واتجاه الكتابة من اليمين لليسار، والاستخدام المهم للحركات والتشكيل، كلها عوامل تجعل من هذه المهمة كابوسًا للنماذج القياسية. بينما تؤدي نماذج اللغة متعددة الوسائط الضخمة (MLLMs) أداءً رائعًا مع اللغات عالية الموارد، يظل أداؤها على المستندات العربية محدودًا بشدة.
أجرينا 9 حلول على نفس صفحة خطة العمل العربية. تفوّق أحدها على البقية. إليك مقارنة شاملة بينها جميعًا. الأقسام: الإعداد ووثيقة الاختبار Nanonets-OCRs DeepSeek-OCR PaddleOCR-VL Qari-OCR HunyuanOCR الأدوات التقليدية: Tesseract، EasyOCR، ArabicOCR