
#
يوسّع Falcon OCR Arabic نموذج Falcon OCR ليشمل المستندات العربية من دون تغيير معمارية النموذج. النموذج الأساسي هو نموذج OCR بدمج مبكر وبـ 270 مليون معامل. وقد تم تقديمه في تدوينة Falcon Perception.
تتم عملية التكييف على مرحلتين. تبدأ أولاً بالضبط الدقيق الخاضع للإشراف على مستندات عربية حقيقية واصطناعية. ثم يأتي التعلم المعزز على مجموعة منتقاة من العينات عالية الجودة. تصف المصدر العربية بأنها خط صعب بالنسبة إلى OCR. كما يذكر أن الصعوبة تتجاوز الحروف نفسها.
يعيد Falcon OCR استخدام تصميم الدمج المبكر من Falcon Perception. يقرأ Transformer كثيف واحد رقع الصور ورموز النص ضمن فضاء معاملات مشترك واحد. ويبدأ ذلك من الطبقة الأولى. ولا يوجد مشفّر رؤية منفصل.
تتحكم قناع انتباه هجين في كيفية تفاعل الرموز. وقد تم تنفيذه باستخدام PyTorch FlexAttention. تنتبه رموز الصورة إلى بعضها البعض بشكل ثنائي الاتجاه. بينما تُفك رموز النص بشكل سببي، مع الاعتماد على الصورة كاملة.
تُحدَّد المهمة عبر prompt، وليس عبر وحدات إضافية. ويختار معامل الفئة نوع المخرجات. وتذكر المصدر النص العادي وLaTeX للمعادلات وHTML للجداول.
تم تدريب النموذج من الصفر لأجل OCR بدلاً من تقطيره من نماذج رؤية تعليمية. وتذكر المصدر أن هذا يساعد النموذج على التقاط التفاصيل الدقيقة للغليفات والضربات. وهذا مهم في خط يمكن أن تغيّر فيه نقطة واحدة الحرف.
يشمل مزيج التدريب مستندات عربية حقيقية واصطناعية. وتذكر المصدر أن الفئات المشمولة تشمل الإيصالات والفواتير والنماذج الإدارية والكتب وغيرها. توفر المستندات الحقيقية تخطيطات أصيلة وضوضاء من العالم الواقعي. وتضيف المستندات الاصطناعية الحجم والدقة في الوسوم وتغطية الحالات النادرة.
تشمل تلك الحالات النادرة التشكيل الكثيف والجداول من اليمين إلى اليسار والأسطر متعددة الخطوط. يشير هذا المزيج إلى استراتيجية تدريب عملية. فهو يجمع بين الواقعية والتغطية المضبوطة. وهذا استنتاج حول تصميم التدريب، استناداً إلى وصف المصدر.
تقدم المصدر درجات على مستندات إنجليزية للنموذج. وتذكر 80.3 على olmOCR و88.64 على OmniDocBench. وتُعرض هذه الأرقام بوصفها دليلاً على أن النموذج يؤدي أداءً جيداً يتجاوز المحتوى العربي فقط.
لا توفر المصدر درجات معيارية عربية في المادة المقدمة. كما أنها لا تقارن Falcon OCR Arabic بأنظمة OCR عربية أخرى. لذلك فإن أي ادعاء أوسع حول الأداء سيكون استنتاجاً، وليس حقيقة مذكورة.
تحافظ المعمارية على OCR ضمن مسار نموذج واحد مشترك. وقد يبسّط ذلك النظام مقارنةً بالتصاميم التي تفصل الرؤية والنص إلى أجزاء منفصلة. كما أن التحكم في المهمة عبر prompt يبقي التعامل مع المخرجات مرناً.
تؤكد المصدر على التفاصيل البصرية الدقيقة. وهذا مهم في مهام OCR حيث تؤثر العلامات الصغيرة في المعنى. ويُعرض التدريب من الصفر للنموذج بوصفه جزءاً من هذه القوة. ولا تدّعي المصدر أن هذا أفضل دائماً في كل الحالات.
لا تذكر المصدر أي حقيقة خاصة بالمغرب. والدرس العام للقراء هو أن أنظمة OCR يمكن أن تستفيد من البيانات الحقيقية والاصطناعية الممزوجة عندما تكون التخطيطات والخطوط معقدة.
تشير المصدر إلى بعض الاعتبارات العملية. أولاً، يعتمد النموذج على عينات منتقاة عالية الجودة للتعلم المعزز. ثانياً، يحتاج مزيج التدريب إلى مستندات حقيقية وتغطية اصطناعية معاً. ثالثاً، يعتمد سلوك المخرجات على prompt ومعامل الفئة.
هذه التفاصيل مهمة لتخطيط النشر. فهي تشير إلى أن نوع المستند، وتنسيق المخرجات، وجودة بيانات التدريب كلها تؤثر في النتائج. ولا تقدم المصدر إرشادات تنفيذية تتجاوز ذلك.
Falcon OCR Arabic هو نموذج OCR بمعاملات 270M تم تكييفه للمستندات العربية. ويحافظ على معمارية الدمج المبكر، ويستخدم عملية تكييف من مرحلتين، ويعتمد على مجموعة تدريب مختلطة من بيانات حقيقية واصطناعية. وتقدمه المصدر بوصفه نقطة انطلاق قوية لـ OCR العربي وتخطيطات المستندات ذات الصلة.
أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.
نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.
هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.