مقالات متنوعة

من ملفات PDF إلى Markdown نظيف: داخل بصير، المعيار الجديد للتعرف الضوئي على الحروف العربية

الأدمن
4 دقائق للقراءة
من ملفات PDF الى ملفات قابلة للتعديل

إذا كنت مطورًا أو باحثًا يعمل في مجال تحليل المستندات، فأنت تعرف المعاناة جيدًا: استخراج النصوص والجداول من ملفات PDF الإنجليزية أصبح تقريبًا أمرًا بسيطًا بفضل الذكاء الاصطناعي الحديث. لكن بمجرد أن تُدخل مستندًا عربيًا إلى نموذج رؤية-لغة متطور، تبدأ الأمور في الانهيار.

لا يزال التعرف الضوئي على الحروف العربية (OCR) مهمة صعبة للغاية. فالكتابة المتصلة، والتراكيب المعقدة للحروف، وتنوع الخطوط، واتجاه الكتابة من اليمين لليسار، والاستخدام المهم للحركات والتشكيل، كلها عوامل تجعل من هذه المهمة كابوسًا للنماذج القياسية. بينما تؤدي نماذج اللغة متعددة الوسائط الضخمة (MLLMs) أداءً رائعًا مع اللغات عالية الموارد، يظل أداؤها على المستندات العربية محدودًا بشدة.

وهنا يأتي دور "بصير" — نموذج رؤية-لغة متخصص صُمم خصيصًا لحل مشكلة تحويل المستندات العربية إلى Markdown. فيما يلي نظرة على كيفية وضع هذا النموذج الجديد لمعيار حديث في هذا المجال، متفوقًا على عمالقة تجاريين مثل GPT-4 و Azure AI.

يمكنك تجربة بصير مجانًا على هذا الرابط. بصير OCR | معالجة وفهم المستندات العربية بالذكاء الاصطناعي

مشكلة الذكاء الاصطناعي "العام"

لقد أعطتنا التطورات الحديثة في الذكاء الاصطناعي نماذج ضخمة متعددة الوسائط قادرة على تحليل الصور والنصوص في آن واحد. لكن هذه النماذج العملاقة للأغراض العامة نادرًا ما تكون مُحسّنة للمتطلبات الدقيقة والمتخصصة للتعرف الضوئي على الحروف العربية.

عندما يستخدم المطورون النماذج الجاهزة للمستندات العربية، غالبًا ما يواجهون تشوهات محبطة: نص ينقلب عشوائيًا من اليسار لليمين، وتشكيل مكسور، وانهيار هيكلي كامل عند التعامل مع الجداول. هذا يترك الصناعات والأكاديميين والمطورين بدون أدوات قوية لرقمنة الحجم الهائل من المستندات العربية الواقعية.

كيف يرى بصير بوضوح

لسد هذه الفجوة، طور الباحثون نموذج بصير بضبط نموذج أساسي موجود بدقة. بدلاً من تدريب نموذج من الصفر، اخترنا البناء على أساس قوي، لأننا لسنا بحاجة لإعادة اختراع العجلة. قمنا بضبط النموذج بدقة وفقًا للتفاصيل التالية:

ضبط دقيق للمفكك فقط (Decoder-Only): قام الفريق بتجميد "عيون" النموذج (برج الرؤية) وتحديث "دماغه" (مفكك اللغة) فقط. سمح هذا لبصير بالحفاظ على قدراته البصرية المعممة مع تكييف مهاراته اللغوية والاستدلالية بشكل كبير مع هياكل المستندات العربية. أثبتت الاختبارات تفوق هذه الطريقة بشكل ملحوظ على تدريب النموذج الكامل.

مُصمم للمطورين (Markdown و HTML): لجعل المخرجات قابلة للاستخدام الفوري، تم تدريب بصير على تنسيق النص العادي إلى Markdown نظيف. ولأن Markdown يعاني مع البيانات الجدولية المعقدة، تم تدريب بصير على إخراج الجداول بصيغة HTML، مما يحافظ على التخطيطات الهيكلية الدقيقة.

مجموعة بيانات ضخمة ومخصصة: تم تدريب النموذج على مجموعة بيانات ضخمة تحتوي على ما يقرب من 769,000 زوج من النصوص والصور. جمعت هذه المجموعة الهجينة بين مستندات مولدة صناعيًا وكتب ومجلات وجداول مالية من العالم الحقيقي.

لا مجال للهلاوس: لمنع الذكاء الاصطناعي من "اختلاق" نصوص، قام الباحثون عن عمد بتضمين حوالي 1,500 صورة لا تحتوي على نصوص (مثل الصفحات الفارغة والمشاهد الطبيعية) في بيانات التدريب، لتعليم النموذج ألا يُخرج شيئًا عندما لا يكون هناك نص ليقرأه.

سياق طويل للبيانات الكثيفة: لضمان قدرة بصير على قراءة جداول ضخمة كثيفة البيانات دون اقتطاع المخرجات، تم تدريبه باستخدام طول تسلسل يبلغ 8192 رمزًا.

لا يمكنك تحسين ما لا يمكنك قياسه: معيار Misraj-DocOCR خلال التطوير، واجه الفريق عقبة: معايير تقييم التعرف الضوئي العربية الحالية كانت معيبة بشدة. عند تحليل مجموعة بيانات KITAB-bench الشهيرة، وجد الباحثون أخطاء جسيمة في الحقيقة الأساسية. احتوى المعيار على نصوص مهلوسة، وأغفل أرقام الصفحات، وتجاهل بشكل متكرر النصوص ذات الخط الصغير في أسفل الصفحات.

لإصلاح هذا، قام الفريق بأمرين:

تصحيح القديم: قاموا بمراجعة وتصحيح مجموعة بيانات KITAB-bench بدقة، وأطلقوا نسخة منقحة للمجتمع.

بناء الجديد: قدموا Misraj-DocOCR، وهو معيار جديد مفتوح المصدر بالكامل. يضم 400 صورة مستند متنوعة للغاية وموثقة من قبل خبراء، مصممة لاختبار أنظمة التعرف الضوئي العربية بدقة بعيدًا عن التحليلات الخاطئة للماضي.

النتائج: التفوق على عمالقة الصناعة إذًا، كيف هو أداء بصير؟ في تقييمات شاملة شملت كلاً من دقة النص (معدل خطأ الكلمات، معدل خطأ الأحرف) ودقة الهيكل والتخطيط (TEDS, MARS)، حقق بصير نتائج متطورة هي الأحدث في المجال.

في معيار Misraj-DocOCR، احتل بصير المرتبة الأولى، متفوقًا على أنظمة تجارية كبرى. لقد تفوق على Gemini-2.5-pro (الذي حل ثانيًا)، وترك نماذج أكبر مثل GPT-4o-mini و Azure AI Document Intelligence ونماذج متنوعة مفتوحة المصدر خلفه.

على الرغم من كونه نموذجًا أصغر بكثير من منافسيه، أثبت تكييف بصير المتخصص بالمجال أن البيانات المصممة خصيصًا واستراتيجيات التدريب الفعالة أهم بكثير من الحجم الهائل للمعلمات عند التعامل مع اللغات الغنية صرفيًا. يوضح الجدول التالي نتائج بصير وفقًا لمقاييس مختلفة.

للحصول على معلومات تقنية مفصلة، يمكنك قراءة الورقة البحثية.

ماذا يعني هذا بالنسبة لك؟

بالنسبة للمطورين الذين يبنون خطوط أنابيب لتحليل المستندات، يقدم بصير أداة قوية ومتخصصة تُخرج Markdown و HTML موثوقين وجاهزين للاستخدام الفوري. أما بالنسبة للباحثين، فيوفر معيار Misraj-DocOCR معيارًا موثوقًا تشتد الحاجة إليه لتقييم النماذج المستقبلية.

بصير ليس مجرد فوز أكاديمي؛ إنه يؤسس لخط أساس عملي وقوي لرقمنة التراث الثقافي العربي، وأتمتة إدخال البيانات التجارية، وجعل النصوص العربية متاحة للمستخدمين النهائيين في جميع أنحاء العالم.

المراجع

  1. *بصير: نموذج رؤية ولغة لتحويل المستندات العربية إلى Markdown عبر التعرف الضوئي على الحروف (OCR)*

(https://arxiv.org/abs/2509.18174)

  1. *مقارنة شاملة لأفضل 8 نماذج مفتوحة المصدر للتعرف الضوئي على الحروف (OCR)*

(https://modal.com/blog/8-top-open-source-ocr-models-compared)