لا يكفي تصوير الكتب والصحف والمخطوطات العربية وحفظها في ملفات رقمية لجعل محتواها قابلاً للبحث أو الاستخدام في أنظمة الذكاء الاصطناعي، إذ تظل الصفحة المصورة بالنسبة إلى الحاسوب صورة لا نصاً يمكن فهرسته وتحليله.
فجوة تحويل الأرشيف العربي إلى بيانات قابلة للقراءة
وبينما تكشف مجموعة بيانات «سرد»، المنشورة في سبتمبر/أيلول 2026، ضخامة الموارد المطلوبة لتعليم الآلة قراءة الصفحات العربية، يحذر باحثون من أن الوثائق التاريخية الحقيقية تفرض تحديات تتجاوز التعرف على الحروف إلى استعادة بنية الصفحة وتوثيق مصدرها والتحقق من دقة النص المستخرج. تحتفظ المكتبات والأرشيفات العربية بذاكرة واسعة من الكتب والوثائق والصحف والمخطوطات التي نجت من التلف أو الضياع.
وقد خرج جزء من هذه المواد من عزلته على الرفوف بعد تصويره وحفظه رقمياً، غير أن نقله من الورق إلى الشاشة لا يعني بالضرورة إدخاله بصورة فعلية إلى البيئة الرقمية التي تعمل فيها محركات البحث والنماذج الحاسوبية. فمحرك البحث لا يستطيع العثور على كلمة داخل صورة الصفحة بالطريقة التي يبحث بها في نص رقمي، كما لا يمكن لنموذج ذكاء اصطناعي معالجة الصورة كما يعالج محتوى قابلاً للقراءة الآلية.
وتنتج عن ذلك فجوة بين حفظ المعرفة في ملفات رقمية وبين تحويلها إلى بيانات تستطيع الأنظمة فهرستها وقراءتها وتحليلها والاستفادة منها. وتتسع هذه الفجوة عند التعامل مع مخطوطات قديمة أو صحف متضررة أو وثائق كتبت بخطوط عربية متعددة.
تقنيات OCR وHTR لتفكيك الصفحات العربية
وفي هذه الحالات، لا يؤدي المسح الضوئي المهمة كاملة، بل يلزم استخدام تقنيات تتعرف على النص وتفهم تنظيم الصفحة وتعالج الأخطاء، ثم تربط المحتوى المستخرج بسياقه التاريخي وبياناته الوصفية. تمر عملية تحويل الورق إلى مادة قابلة للاستخدام الحاسوبي بتقنيات التعرف الضوئي على الحروف، المعروفة اختصاراً باسم «أو سي آر» (OCR).
أما الوثائق والمخطوطات المكتوبة بخط اليد، فتحتاج إلى تقنيات التعرف على الكتابة اليدوية، أو «إتش تي آر» (HTR). ويتطلب تدريب النوعين كميات كبيرة ومتنوعة من الصور والنصوص المرجعية الصحيحة. وتقدم مجموعة «سرد» (SARD) مثالاً على حجم هذه المتطلبات.
فقد نشرها باحثون من جامعة الأمير سلطان وأكاديمية طويق السعودية في سبتمبر/أيلول 2026، وتضم أكثر من 2.6 مليون صورة لصفحات عربية تحتوي مجتمعة على نحو 794.6 مليون كلمة. وصُممت المجموعة لتدريب أنظمة التعرف على النصوص العربية واختبارها باستخدام صفحات تحاكي تخطيطات الكتب.
ولا تمثل «سرد» أرشيفاً تاريخياً من المخطوطات أو الوثائق التي جرى إنقاذها ورقمنتها، بل هي مجموعة بيانات اصطناعية. واستخدم الباحثون في إعدادها نصوصاً عربية رقمية من مكتبة الألوكة، ثم حولوها إلى صور لصفحات مع الاحتفاظ بالنص الأصلي مرجعاً صحيحاً يمكن الاعتماد عليه خلال تدريب النماذج وقياس أدائها.
وتتيح هذه الآلية إنتاج عدد كبير من الصفحات المصورة المقترنة بنصوص مرجعية معروفة، من دون الحاجة إلى تفريغ كل صفحة يدوياً. لكنها لا تحسم مشكلة الانتقال من صفحات مولدة في بيئة منظمة إلى الوثائق الفعلية المحفوظة في المكتبات والأرشيفات، بما تحمله من تلف واختلافات طباعية وتخطيطات معقدة.
باحثو سرد يشرحون حدود البيانات الاصطناعية
وقال وديع بوعليلة، مدير مختبر الروبوتات وإنترنت الأشياء في جامعة الأمير سلطان بالرياض وأحد الباحثين المشاركين في بناء «سرد»، إن الدافع الأساسي لإنشاء المجموعة كان سد فجوة في البيانات اللازمة لتطوير تقنيات قراءة الوثائق العربية.
وأوضح أن مجموعات سابقة قدمت إسهامات مهمة، إلا أن كثيراً منها ركز على الحروف أو الكلمات أو الأسطر المنفردة، أو بقي محدوداً من حيث الحجم والتنوع الطباعي وتمثيل الصفحة الكاملة. وأضاف بوعليلة أن المجموعة تستهدف توفير بيانات تساعد النماذج على قراءة صفحات كاملة تشبه صفحات الكتب المطبوعة، مع مراعاة اختلاف الخطوط وكثافة النصوص.
وأتاح التوليد الاصطناعي إنتاج البيانات بهذا الحجم، مع ربط كل صورة بالنص المرجعي الذي استخدم لإنشائها، بما يخفض كلفة التفريغ اليدوي ويؤسس لتطوير أنظمة التعرف الضوئي على الحروف والنماذج التي تدمج قدرات الرؤية واللغة.
ومع ذلك، شدد بوعليلة على أن «سرد» لا تجسد الأرشيف العربي الحقيقي بكل تعقيداته، لأنها تحاكي صفحات الكتب ضمن تنسيقات مضبوطة، ولا تشمل جميع أشكال التخطيط المعقد أو العيوب الموجودة في الوثائق القديمة. ولذلك لا يمكن اعتبار النجاح على هذه البيانات دليلاً كافياً على قدرة النظام على قراءة المواد التاريخية الفعلية.
ويتطلب نقل هذه الأنظمة إلى الاستخدام الواقعي، بحسب بوعليلة، استكمال التدريب والتقييم ببيانات مأخوذة مباشرة من وثائق حقيقية. ودعا إلى التعاون مع المكتبات ومراكز الأرشيف لجمع عينات متنوعة، وإعداد نصوص مرجعية لها بعد مراجعتها من متخصصين، ثم تكييف النماذج لتتعامل مع خصائص تلك المواد.
ويمكن تعزيز التدريب بمحاكاة عيوب الطباعة والتصوير التي تظهر عادة في الأرشيفات، لكن بوعليلة أكد أن الاختبار ينبغي أن يجري أيضاً على وثائق حقيقية لم تدخل ضمن بيانات التدريب. ويفضل أن تأتي مواد الاختبار من مصادر متعددة، حتى يتبين ما إذا كان النموذج قادراً على التعامل مع وثائق جديدة، لا مع أنماط سبق له تعلمها فقط.
ولا يقتصر التحدي، في رأيه، على تمييز الحروف والكلمات، بل يشمل فهم بنية الصفحة وترتيب أعمدتها، والتفريق بين العناوين والحواشي والمتن، وربط كل عنصر بموضعه ووظيفته. أما المخطوطات، فتحتاج إلى بيانات متخصصة وخبرات في الكتابة اليدوية والخطوط التاريخية، مؤكداً أن «النجاح في قراءة النص المطبوع لا يعني تلقائياً النجاح في قراءة المخطوطات».
ويرى فريق مختبر الروبوتات وإنترنت الأشياء أن تطوير هذا المجال يقتضي الجمع بين أدوات الذكاء الاصطناعي وخبرة المختصين باللغة والتراث. ويشمل ذلك إخضاع المقاطع التي لا يثق النظام في قراءتها لمراجعة بشرية، مع إبقاء النص المستخرج مرتبطاً دائماً بصورة الصفحة التي أخذ منها.
وبحسب بوعليلة، لا ينبغي أن ينحصر الهدف في استخراج نصوص من ملايين الصفحات، بل يجب أن يمتد إلى إتاحة التراث العربي للبحث والمعرفة من دون الإخلال بأمانة نقله أو فقدان تفاصيله التاريخية. ويجعل ذلك جودة الاستخراج والتوثيق جزءاً أساسياً من الرقمنة، لا مرحلة إضافية يمكن الاستغناء عنها. وتكشف الوثائق القديمة الفعلية مستوى آخر من الصعوبات.
الوثائق المتضررة تعقّد قراءة البنية والسياق التاريخي
وقال حمدي مبارك، المهندس الرئيسي في معهد قطر لبحوث الحوسبة، إن قراءة هذه الوثائق لا تتعلق بالتعرف على الحروف فحسب، بل بمحاولة استعادة وثيقة كاملة ربما فقدت بعض عناصر بنيتها الأصلية خلال عملية الرقمنة.
وأوضح مبارك أن حالة المادة نفسها تؤثر مباشرة في أداء النظام، بدءاً من ضعف جودة المسح الضوئي واصفرار الورق أو تعرضه للتلف، مروراً ببقع الحبر وعدم انتظام الصفحات، وصولاً إلى تشابك الحروف العربية وغياب التشكيل وتعدد أشكال الخطوط وأنماط الطباعة القديمة. وقد تؤدي كل واحدة من هذه العوامل إلى أخطاء في التعرف على النص. وتفرض الصحف تحديات إضافية بسبب تعدد الأعمدة والعناوين والإعلانات والحواشي، فضلاً عن تداخل الصور والنصوص.
ولذلك لا يكفي أن تتعرف الآلة على الكلمات منفردة، إذ ينبغي لها أيضاً تحديد ترتيب القراءة الصحيح وفهم العلاقة بين عناصر الصفحة كي تعيد بناء محتواها على نحو قريب من الأصل. وتزداد حساسية الأخطاء في اللغة العربية، وفق مبارك، لأن تغيير حرف واحد قد يحول الكلمة إلى كلمة عربية أخرى سليمة من الناحية اللغوية، لكنها مختلفة تماماً في الدلالة.
كما أن النصوص القديمة قد تستخدم تهجئات وأساليب كتابة لا تتطابق مع الاستعمال الحديث، فينجح النظام في القراءة البصرية للكلمة، لكنه يخطئ في تفسيرها أو في وضعها ضمن سياقها التاريخي. ولا تنتهي الرقمنة عند إنتاج ملف نصي قابل للبحث.
فقد أكد مبارك أن استخراج النص ليس سوى بداية العملية، لأن المحتوى يحتاج، قبل إدخاله في التدريب أو أنظمة استرجاع المعلومات، إلى التنظيف والتوصيف وضبط الجودة والتحقق من سلامة ترتيب عناصره. ومن الضروري، بحسب مبارك، الحفاظ على الرابط بين النص المستخرج والصفحة الأصلية، وتصحيح مسار القراءة، ولا سيما في الصحف ذات الأعمدة المتعددة.
كما ينبغي فصل الحواشي والعناوين والتعليقات عن المتن الأساسي، وحفظ بيانات المصدر، بما فيها اسم الكتاب أو الصحيفة، واسم المؤلف، والتاريخ، والطبعة، ورقم الصفحة. وحذر مبارك من اعتبار مخرجات التعرف الضوئي على الحروف «حقيقة» لمجرد تحولها إلى نص يمكن البحث فيه.
ودعا إلى تحديد مستوى ثقة أو جودة لكل صفحة أو مقطع، وإخضاع العينات منخفضة الجودة لمراجعة بشرية، خصوصاً إذا كانت النصوص ستدخل في إنشاء مجموعات بيانات تستخدم لاحقاً لتدريب نماذج أخرى. وقد تمتد آثار أخطاء التعرف الضوئي إلى ما وراء الوثيقة الأصلية.
فمن الممكن أن يتحول اسم شخص أو مكان إلى كلمة مختلفة، أو تتبدل أرقام وتواريخ، أو تختلط محتويات الأعمدة، أو تسقط جملة كاملة بسبب خطأ في تحليل تخطيط الصفحة. وقال مبارك إن تكرار هذه الأخطاء عبر ملايين الصفحات قد يجعلها جزءاً من البيانات التي تتعلم منها النماذج.
وفي أنظمة استرجاع المعلومات، يمكن لخطأ في اسم أو مكان أو مصطلح أن يحول دون ظهور الوثيقة عند البحث عنها، بينما قد تتعلم النماذج التوليدية النص المشوه وتتعامل معه على أنه الصيغة الصحيحة.
ولهذا، يرى مبارك أن نجاح رقمنة الذاكرة العربية لا يقاس بعدد الصفحات التي تحولت إلى نصوص فقط، وإنما بمدى مطابقة النص المستخرج للمصدر، واحتفاظه ببنية الوثيقة وسياقها ومعلومات منشئها، إلى جانب معرفة مستوى الثقة في كل عملية استخراج. وفي الوقت نفسه، يمكن توظيف الذكاء الاصطناعي في التحقق من النتائج، عبر اكتشاف أخطاء التعرف الضوئي، ومقارنة النص المستخرج بصورة الصفحة، وفحص اتساقه مع السياق.
لكن هذه المراجعة الآلية تظل مرتبطة بضرورة الاحتفاظ بالصورة الأصلية إلى جانب النص، حتى تبقى النتائج قابلة للفحص البشري والتحقق اللاحق. وتوضح تجربة «سرد» مقدار البيانات اللازمة لتعليم الأنظمة قراءة صفحات عربية تشبه الكتب المطبوعة، فيما تظهر الوثائق الحقيقية أن استخراج النص ليس نهاية المهمة.
فالرقمنة القابلة للاستخدام تتطلب حماية بنية الصفحة، وتوثيق المصدر والسياق، وقياس جودة الاستخراج، والإبقاء على صلة مباشرة بين النص الرقمي وأصله المصور، بحيث تصبح الذاكرة العربية قابلة للبحث والتحليل من دون أن تفقد أمانتها التاريخية.