Retour à l'accueil
Technologie

La numérisation de la mémoire arabe confrontée au fossé entre conservation des pages et lecture automatique

Le jeu de données synthétique « SARD », qui compte plus de 2,6 millions d’images et environ 794,6 millions de mots, révèle l’ampleur des données nécessaires pour développer la lecture automatique des pages arabes. Mais des chercheurs soulignent que le traitement des livres, journaux et manuscrits réels exige un entraînement spécialisé, une vérification humaine et le maintien du lien entre le texte extrait, le document original et son contexte.

•11 min

Écouter cet article

Une version audio générée automatiquement.

0:00
0:00
Un ancien manuscrit arabe est ouvert sur une table en bois dans une bibliothèque, à côté d’un ordinateur portable affichant une copie numérique d’une page. Des rayonnages de livres et des lecteurs sont visibles à l’arrière-plan.

Photographier les livres, journaux et manuscrits arabes et les conserver dans des fichiers numériques ne suffit pas à rendre leur contenu interrogeable ou utilisable par des systèmes d’intelligence artificielle: pour l’ordinateur, la page numérisée reste une image, et non un texte pouvant être indexé et analysé.

Le fossé de la conversion des archives arabes en données lisibles

Alors que le jeu de données « SARD », publié en septembre 2026, révèle l’ampleur des ressources nécessaires pour apprendre aux machines à lire les pages arabes, des chercheurs avertissent que les documents historiques réels posent des difficultés qui vont au-delà de la reconnaissance des caractères: il faut reconstituer la structure de la page, documenter sa source et vérifier l’exactitude du texte extrait. Les bibliothèques et les archives arabes conservent une vaste mémoire de livres, documents, journaux et manuscrits qui ont échappé à la détérioration ou à la disparition.

Une partie de ces documents est sortie de l’isolement des rayonnages après avoir été numérisée et conservée sous forme numérique. Mais le passage du papier à l’écran ne signifie pas nécessairement leur intégration effective dans l’environnement numérique des moteurs de recherche et des modèles informatiques. Un moteur de recherche ne peut pas trouver un mot à l’intérieur de l’image d’une page comme il le ferait dans un texte numérique; de même, un modèle d’intelligence artificielle ne peut pas traiter l’image comme un contenu lisible automatiquement.

Il en résulte un fossé entre la conservation des connaissances dans des fichiers numériques et leur conversion en données que les systèmes peuvent indexer, lire, analyser et exploiter. Ce fossé s’élargit lorsqu’il s’agit de manuscrits anciens, de journaux endommagés ou de documents rédigés dans plusieurs écritures arabes.

Les technologies OCR et HTR pour décomposer les pages arabes

Dans ces cas, la numérisation ne suffit pas: il faut utiliser des technologies capables de reconnaître le texte, de comprendre l’organisation de la page et de traiter les erreurs, puis de relier le contenu extrait à son contexte historique et à ses métadonnées. La conversion du papier en contenu exploitable par ordinateur passe par la reconnaissance optique de caractères, connue sous l’abréviation « OCR ».

Les documents et manuscrits écrits à la main nécessitent, eux, des technologies de reconnaissance de l’écriture manuscrite, ou « HTR ». L’entraînement de ces deux types de systèmes exige de grandes quantités d’images et de textes de référence exacts, variés. Le jeu de données « SARD » en donne une idée.

2.6 مليون
صور صفحات عربية في مجموعة سرد

Il a été publié par des chercheurs de l’Université Prince Sultan et de l’Académie saoudienne Tuwaiq en septembre 2026. Il comprend plus de 2,6 millions d’images de pages arabes contenant au total environ 794,6 millions de mots. Le jeu de données a été conçu pour entraîner et tester des systèmes de reconnaissance des textes arabes à partir de pages reproduisant la mise en page des livres.

« SARD » ne constitue pas une archive historique de manuscrits ou de documents sauvés puis numérisés, mais un jeu de données synthétique. Pour le constituer, les chercheurs ont utilisé des textes arabes numériques issus de la bibliothèque Alukah, qu’ils ont transformés en images de pages tout en conservant le texte original comme référence exacte pour l’entraînement des modèles et l’évaluation de leurs performances.

Cette méthode permet de produire un grand nombre de pages numérisées associées à des textes de référence connus, sans devoir transcrire chaque page manuellement. Elle ne résout toutefois pas le problème du passage de pages générées dans un environnement organisé aux documents réels conservés dans les bibliothèques et les archives, avec leurs détériorations, leurs variations typographiques et leurs mises en page complexes.

Les chercheurs de SARD expliquent les limites des données synthétiques

Wadie Boualila, directeur du laboratoire de robotique et d’Internet des objets de l’Université Prince Sultan à Riyad et l’un des chercheurs ayant participé à la conception de « SARD », a déclaré que la principale motivation de la création du jeu de données était de combler le manque de données nécessaires au développement des technologies de lecture des documents arabes.

Il a expliqué que des jeux de données antérieurs avaient apporté des contributions importantes, mais que nombre d’entre eux se concentraient sur des caractères, des mots ou des lignes isolés, ou restaient limités par leur taille, leur diversité typographique et leur représentation de la page entière. Boualila a ajouté que le jeu de données visait à fournir des données permettant aux modèles de lire des pages entières ressemblant à celles des livres imprimés, en tenant compte de la diversité des polices et de la densité des textes.

La génération synthétique a permis de produire des données à cette échelle, chaque image étant reliée au texte de référence utilisé pour la créer. Elle réduit le coût de la transcription manuelle et jette les bases du développement de systèmes de reconnaissance optique de caractères et de modèles combinant des capacités de vision et de langage.

Boualila a toutefois souligné que « SARD » ne reproduisait pas toute la complexité des véritables archives arabes, car il simule des pages de livres selon des formats contrôlés et ne couvre pas toutes les formes de mise en page complexe ni les défauts présents dans les documents anciens. La réussite obtenue sur ces données ne peut donc pas être considérée comme une preuve suffisante de la capacité d’un système à lire des documents historiques réels.

Selon Boualila, le déploiement de ces systèmes dans des conditions réelles exige de compléter leur entraînement et leur évaluation avec des données directement tirées de documents authentiques. Il a appelé à coopérer avec les bibliothèques et les centres d’archives afin de recueillir des échantillons variés, de préparer des textes de référence après leur révision par des spécialistes, puis d’adapter les modèles aux caractéristiques de ces documents.

L’entraînement peut être renforcé par la simulation des défauts d’impression et de numérisation habituellement observés dans les archives. Boualila a toutefois insisté sur la nécessité de tester aussi les systèmes sur des documents réels absents des données d’entraînement. Les documents de test devraient de préférence provenir de plusieurs sources, afin de déterminer si le modèle peut traiter de nouveaux documents, et pas seulement des formes qu’il a déjà apprises.

À ses yeux, le défi ne se limite pas à distinguer les caractères et les mots: il comprend aussi la compréhension de la structure de la page et de l’ordre de ses colonnes, la distinction entre titres, notes de bas de page et corps du texte, ainsi que le rattachement de chaque élément à sa position et à sa fonction. Les manuscrits nécessitent, eux, des données spécialisées et une expertise de l’écriture manuscrite et des écritures historiques. Il a souligné que « réussir à lire un texte imprimé ne signifie pas automatiquement réussir à lire des manuscrits ».

L’équipe du laboratoire de robotique et d’Internet des objets estime que le développement de ce domaine exige d’associer les outils de l’intelligence artificielle à l’expertise de spécialistes de la langue et du patrimoine. Cela comprend la soumission à une révision humaine des passages dont le système n’est pas sûr, tout en maintenant en permanence le lien entre le texte extrait et l’image de la page dont il provient.

Selon Boualila, l’objectif ne doit pas se limiter à extraire des textes de millions de pages, mais s’étendre à la mise à disposition du patrimoine arabe pour la recherche et la connaissance, sans compromettre la fidélité de sa transmission ni perdre ses détails historiques. La qualité de l’extraction et de la documentation devient ainsi un élément essentiel de la numérisation, et non une étape supplémentaire dont on pourrait se passer. Les documents anciens réels révèlent un autre niveau de difficulté.

Les documents endommagés compliquent la lecture de la structure et du contexte historique

Hamdi Mubarak, ingénieur principal à l’Institut de recherche informatique du Qatar, a déclaré que la lecture de ces documents ne concernait pas seulement la reconnaissance des caractères, mais aussi la tentative de reconstituer un document complet qui a pu perdre certains éléments de sa structure originale au cours de la numérisation.

Mubarak a expliqué que l’état du document lui-même influait directement sur les performances du système: mauvaise qualité de la numérisation, jaunissement ou détérioration du papier, taches d’encre, pages irrégulières, enchevêtrement des caractères arabes, absence de signes diacritiques, diversité des écritures et des anciens styles d’impression. Chacun de ces facteurs peut entraîner des erreurs de reconnaissance du texte. Les journaux posent des difficultés supplémentaires en raison de la multiplicité des colonnes, des titres, des publicités et des notes de bas de page, ainsi que de l’imbrication des images et des textes.

Il ne suffit donc pas que la machine reconnaisse les mots séparément: elle doit aussi déterminer le bon ordre de lecture et comprendre la relation entre les éléments de la page afin d’en reconstituer le contenu de manière proche de l’original. Selon Mubarak, les erreurs sont particulièrement sensibles en arabe, car la modification d’un seul caractère peut transformer un mot en un autre mot arabe grammaticalement correct, mais dont le sens est totalement différent.

Les textes anciens peuvent également employer des orthographes et des styles d’écriture qui ne correspondent pas à l’usage moderne. Le système peut alors réussir la lecture visuelle du mot, mais se tromper dans son interprétation ou dans son placement dans son contexte historique. La numérisation ne s’achève pas avec la production d’un fichier texte interrogeable.

Mubarak a souligné que l’extraction du texte n’était que le début du processus: avant son intégration dans l’entraînement ou dans des systèmes de recherche d’informations, le contenu doit être nettoyé, décrit, soumis à un contrôle qualité et vérifié afin de garantir le bon ordre de ses éléments. Il est indispensable, selon lui, de préserver le lien entre le texte extrait et la page originale et de corriger le sens de lecture, notamment dans les journaux à plusieurs colonnes.

Il faut également séparer les notes de bas de page, les titres et les commentaires du corps principal du texte, et conserver les données de la source, notamment le nom du livre ou du journal, le nom de l’auteur, la date, l’édition et le numéro de page. Mubarak a mis en garde contre le fait de considérer les résultats de la reconnaissance optique de caractères comme une « vérité » au seul motif qu’ils sont devenus interrogeables.

Il a appelé à attribuer un niveau de confiance ou de qualité à chaque page ou passage et à soumettre les échantillons de faible qualité à une révision humaine, en particulier lorsque les textes doivent servir à créer des jeux de données utilisés ultérieurement pour entraîner d’autres modèles. Les effets des erreurs de reconnaissance optique peuvent dépasser le document original.

Un nom de personne ou de lieu peut être transformé en un autre mot, des chiffres et des dates peuvent être modifiés, le contenu des colonnes peut être mélangé ou une phrase entière peut disparaître en raison d’une erreur d’analyse de la mise en page. Mubarak a déclaré que la répétition de ces erreurs sur des millions de pages pouvait les intégrer aux données sur lesquelles les modèles apprennent.

Dans les systèmes de recherche d’informations, une erreur dans un nom, un lieu ou un terme peut empêcher l’apparition du document lors d’une recherche, tandis que les modèles génératifs peuvent apprendre le texte déformé et le traiter comme la formulation correcte.

Pour Mubarak, la réussite de la numérisation de la mémoire arabe ne se mesure donc pas seulement au nombre de pages transformées en textes, mais aussi au degré de conformité du texte extrait à la source, à la préservation de la structure du document, de son contexte et des informations sur son créateur, ainsi qu’à la connaissance du niveau de confiance de chaque extraction. Dans le même temps, l’intelligence artificielle peut être utilisée pour vérifier les résultats, en détectant les erreurs de reconnaissance optique, en comparant le texte extrait à l’image de la page et en contrôlant sa cohérence avec le contexte.

Cette vérification automatisée reste toutefois liée à la nécessité de conserver l’image originale à côté du texte, afin que les résultats puissent être examinés par des humains et vérifiés ultérieurement. L’expérience de « SARD » montre la quantité de données nécessaire pour apprendre aux systèmes à lire des pages arabes ressemblant à celles des livres imprimés, tandis que les documents réels montrent que l’extraction du texte n’est pas la fin de la tâche.

Une numérisation réellement exploitable exige de préserver la structure de la page, de documenter la source et le contexte, de mesurer la qualité de l’extraction et de maintenir un lien direct entre le texte numérique et son original numérisé, afin que la mémoire arabe puisse être recherchée et analysée sans perdre sa fidélité historique.