
#
Falcon OCR Arabic étend Falcon OCR aux documents arabes sans modifier son architecture. Le modèle de base est un modèle OCR en fusion précoce de 270 M de paramètres. Il a été présenté dans l'article de blog Falcon Perception.
L'adaptation suit deux étapes. D'abord, un finetuning supervisé sur des documents arabes réels et synthétiques. Ensuite, un apprentissage par renforcement sur un ensemble sélectionné d'échantillons de haute qualité. La source décrit l'arabe comme une écriture difficile pour l'OCR. Elle indique aussi que la difficulté va au-delà des lettres elles-mêmes.
Falcon OCR réutilise la conception en fusion précoce de Falcon Perception. Un seul Transformer dense lit les patches d'image et les jetons de texte dans un espace de paramètres partagé. Il commence dès la première couche. Il n'y a pas d'encodeur visuel séparé.
Un masque d'attention hybride contrôle les interactions entre les jetons. Il est implémenté avec PyTorch FlexAttention. Les jetons d'image s'attendent mutuellement de manière bidirectionnelle. Les jetons de texte se décodent de façon causale, tout en tenant compte de l'image entière.
La tâche est définie par le prompt, et non par des modules supplémentaires. Un argument de catégorie sélectionne le type de sortie. La source liste du texte brut, LaTeX pour les formules et HTML pour les tableaux.
Le modèle a été entraîné from scratch pour l'OCR plutôt que distillé à partir de modèles visuels enseignants. La source indique que cela aide le modèle à capturer les détails fins des glyphes et des traits. Cela compte pour une écriture où un seul point peut changer la lettre.
Le mélange d'entraînement inclut des documents arabes réels et synthétiques. La source indique que les catégories couvertes incluent les reçus, les factures, les formulaires administratifs, les livres, et plus encore. Les documents réels apportent des mises en page authentiques et du bruit du monde réel. Les documents synthétiques ajoutent de l'échelle, des étiquettes exactes et une couverture des cas rares.
Ces cas rares incluent des diacritiques denses, des tableaux de droite à gauche et des lignes à écriture mixte. Ce mélange suggère une stratégie d'entraînement pratique. Il combine réalisme et couverture contrôlée. C'est une hypothèse sur la conception de l'entraînement, fondée sur la description de la source.
La source donne des scores sur des documents anglais pour le modèle. Elle indique 80,3 sur olmOCR et 88,64 sur OmniDocBench. Ces chiffres sont présentés comme une preuve que le modèle fonctionne bien au-delà du contenu uniquement arabe.
La source ne fournit pas de scores de benchmark arabes dans le matériel fourni. Elle ne compare pas non plus Falcon OCR Arabic à d'autres systèmes OCR arabes. Toute affirmation plus large sur les performances serait donc une hypothèse, et non un fait énoncé.
L'architecture maintient l'OCR dans un seul chemin de modèle partagé. Cela peut simplifier le système par rapport aux conceptions qui séparent la vision et le texte en parties distinctes. Le contrôle des tâches par prompt rend aussi le traitement des sorties plus flexible.
La source met l'accent sur les détails visuels fins. C'est important pour les tâches OCR où de petites marques changent le sens. L'entraînement from scratch du modèle est présenté comme faisant partie de cette force. La source ne prétend pas que cela soit toujours meilleur dans tous les contextes.
La source ne rapporte aucun fait spécifique au Maroc. Une leçon générale pour les lecteurs est que les systèmes OCR peuvent bénéficier de données réelles et synthétiques mélangées lorsque les mises en page et les écritures sont complexes.
La source met en avant quelques considérations pratiques. Premièrement, le modèle dépend d'échantillons sélectionnés de haute qualité pour l'apprentissage par renforcement. Deuxièmement, le mélange d'entraînement doit inclure à la fois des documents réels et une couverture synthétique. Troisièmement, le comportement de sortie dépend du prompt et de l'argument de catégorie.
Ces détails comptent pour la planification du déploiement. Ils suggèrent que le type de document, le format de sortie et la qualité des données d'entraînement influencent tous les résultats. La source ne fournit pas de guide d'implémentation au-delà de cela.
Falcon OCR Arabic est un modèle OCR de 270 M de paramètres adapté aux documents arabes. Il conserve l'architecture en fusion précoce, utilise un processus d'adaptation en deux étapes et s'appuie sur un ensemble d'entraînement mixte réel et synthétique. La source le présente comme un bon point de départ OCR pour l'arabe et les mises en page documentaires associées.
Ajoutez Intelligence Artificielle Maroc à vos sources préférées pour retrouver davantage de nos actualités pertinentes dans la recherche Google.
Nous construisons des plateformes IA sur mesure, des produits SaaS, des applications métier intelligentes et des systèmes d’automatisation.
Ce formulaire est réservé aux demandes de projets, et non aux questions générales sur l’intelligence artificielle.