
#
أطلقت Google DeepMind نموذج EmbeddingGemma 2، وهو نموذج تضمين متعدد الوسائط مفتوح الأوزان. وهو يربط النصوص والصور وإطارات الفيديو والصوت في فضاء متجهي واحد موحّد. وتصفه المصدر بأنه الأفضل في فئته بالنسبة لحجمه.
صُمم النموذج للمطورين الذين يريدون تجارب بحث محلية واسترجاع الوسائط. وهو يقلل الحاجة إلى ربط نماذج منفصلة لتوليد أوصاف الصور، وتحويل الكلام إلى نص، ونماذج تضمين النصوص. وهذا يمكن أن يبسّط سير العمل على الجهاز.
صُمم EmbeddingGemma 2 لتطبيقات محلية تراعي الخصوصية. ويأتي ببصمة مدمجة تبلغ 740 مليون معلمة. وتذكر المصدر أيضًا أن مشفّراته المعيارية يمكن أن تعمل باستخدام نحو 191 ميغابايت فقط من ذاكرة RAM النشطة لأوزان النص فقط، ونحو 567 ميغابايت للنموذج متعدد الوسائط الكامل على Google Pixel 11 Pro.
هذه البصمة مهمة لأنها تقلل العبء الناتج عن تشغيل البحث متعدد الوسائط على الجهاز. كما تساعد على خفض زمن الاستجابة مقارنة بخطوط الأنابيب متعددة النماذج. وبالنسبة للفرق التي تبني تجارب خاصة، قد يجعل ذلك النشر أسهل.
أحد الاستخدامات البارزة هو اتخاذ القرار فائق الانخفاض في زمن الاستجابة. يمكن للنموذج مطابقة مدخلات المستخدم مباشرة مع تسميات التصنيف والأوصاف. ويقوم بذلك من دون بيانات تدريب أو ضبط دقيق.
وتقول المصدر إن هذا يتيح توجيه النية الصفري الفوري خلال أجزاء من الثانية. عمليًا، يعني ذلك أن التطبيق المحلي يمكنه تصنيف الطلب بسرعة. ثم يمكنه إرسال الطلب إلى سير العمل المناسب.
تقول Google إن المطورين يمكنهم تجربة EmbeddingGemma 2 عبر العروض التفاعلية في Google AI Edge. وهو متاح أيضًا عبر Google AI Edge Gallery على الهاتف المحمول وGoogle AI Edge Foresight على Mac. وتُعرض هذه الأدوات كطرق لاستكشاف النموذج فورًا.
ويذكر المنشور أيضًا أن المطورين يمكنهم استخدام النموذج لبناء بحث دلالي خاص على الجهاز، واسترجاع الإطارات الرئيسية المرئية، وسير عمل يعتمد على الشروط. وفي الأسابيع المقبلة، تخطط Google لإتاحة النموذج كخدمة على Android عبر ML Kit. وتقول المصدر إن ذلك سيتضمن تسريع NPU لتحسين الأداء عبر مجموعة واسعة من الأجهزة.
الموضوع التشغيلي الرئيسي في المصدر هو الدمج. يمكن لـ EmbeddingGemma 2 أن يحل محل عدة نماذج منفصلة في حزمة محلية. وهذا يمكن أن يقلل زمن الاستجابة والعبء على الذاكرة.
وهناك اعتبار آخر يتعلق بنطاق النشر. فالنموذج موجه للاستخدام على الجهاز، وليس لسير العمل المعتمد على السحابة أولًا. ينبغي للفرق تقييم ما إذا كان تطبيقها يحتاج إلى معالجة محلية أو استرجاع متعدد الوسائط أو توجيه صفري قبل اعتماده.
لا يورد المصدر أي حقيقة خاصة بالمغرب. والدرس العام للقراء هو أن النماذج متعددة الوسائط المدمجة يمكن أن تدعم تصميمات منتجات محلية تراعي الخصوصية عندما تكون المعالجة على الجهاز هي الهدف.
تقول Google إن المزيد من الإتاحة على Android قادم عبر ML Kit. كما يوجّه المصدر القراء إلى مدونة Google DeepMind للحصول على تفاصيل حول البنية والتقييم. وقد تساعد هذه التفاصيل المطورين على تقييم مدى ملاءمة النموذج لمهام الاسترجاع أو التوجيه الخاصة بهم.
وفي الوقت الحالي، يبرز EmbeddingGemma 2 كنموذج مدمج للتضمينات متعددة الوسائط الموحدة. وتكمن قيمته الأساسية ببساطة في: أجزاء أقل، عبء أقل، وقرارات محلية أسرع.
أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.
نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.
هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.