
#
Google DeepMind a lancé EmbeddingGemma 2, un modèle d'embedding multimodal à poids ouverts. Il projette le texte, les images, les images vidéo et l'audio dans un espace vectoriel unique et unifié. La source le décrit comme le meilleur de sa catégorie pour sa taille.
Le modèle est conçu pour les développeurs qui souhaitent des expériences de recherche locale et de récupération de médias. Il réduit le besoin d'enchaîner des modèles distincts de génération de légendes d'images, de reconnaissance vocale et d'embeddings textuels. Cela peut simplifier les workflows sur l'appareil.
EmbeddingGemma 2 est conçu pour des applications locales axées sur la confidentialité. Il affiche une empreinte compacte de 740 millions de paramètres. La source indique également que ses encodeurs modulaires peuvent fonctionner avec seulement environ 191 Mo de RAM active pour les poids texte uniquement, et environ 567 Mo pour le modèle multimodal complet sur un Google Pixel 11 Pro.
Cette empreinte est importante car elle réduit la surcharge liée à l'exécution de la recherche multimodale sur l'appareil. Elle contribue aussi à réduire la latence par rapport aux pipelines multi-modèles. Pour les équipes qui construisent des expériences privées, cela peut simplifier le déploiement.
Un cas d'usage notable est la prise de décision à très faible latence. Le modèle peut faire correspondre directement les entrées utilisateur avec des libellés et descriptions de classification. Il le fait sans données d'entraînement ni ajustement fin.
La source indique que cela permet un routage d'intention zero-shot instantané en quelques millisecondes. En pratique, cela signifie qu'une application locale peut classer rapidement une requête. Elle peut ensuite l'envoyer vers le bon workflow.
Google indique que les développeurs peuvent découvrir EmbeddingGemma 2 via les démonstrations interactives de Google AI Edge. Il est également disponible via Google AI Edge Gallery sur mobile et Google AI Edge Foresight sur Mac. Ces outils sont présentés comme des moyens d'explorer le modèle immédiatement.
L'article précise aussi que les développeurs peuvent utiliser le modèle pour créer une recherche sémantique privée sur l'appareil, une récupération de keyframes visuelles et des workflows déclenchés par des conditions. Dans les semaines à venir, Google prévoit de rendre le modèle disponible en tant que service sur Android via ML Kit. La source indique que cela inclura l'accélération NPU afin d'optimiser les performances sur un large éventail d'appareils.
Le thème opérationnel principal de la source est la consolidation. EmbeddingGemma 2 peut remplacer plusieurs modèles distincts dans une pile locale. Cela peut réduire la latence et la surcharge mémoire.
Une autre considération est le périmètre de déploiement. Le modèle est positionné pour une utilisation sur l'appareil, et non pour des workflows cloud-first. Les équipes doivent évaluer si leur application a besoin de traitement local, de récupération multimodale ou de routage zero-shot avant de l'adopter.
La source ne rapporte aucun fait spécifique au Maroc. Une leçon générale pour les lecteurs est que les modèles multimodaux compacts peuvent soutenir des conceptions de produits locales et axées sur la confidentialité lorsque le traitement sur l'appareil est l'objectif.
Google indique que d'autres disponibilités sur Android arrivent via ML Kit. La source renvoie également au blog de Google DeepMind pour les détails sur l'architecture et l'évaluation. Ces détails peuvent aider les développeurs à évaluer l'adéquation du modèle à leurs propres tâches de récupération ou de routage.
Pour l'instant, EmbeddingGemma 2 se distingue comme un modèle compact pour des embeddings multimodaux unifiés. Sa principale valeur est simple : moins d'éléments à gérer, moins de surcharge et des décisions locales plus rapides.
Ajoutez Intelligence Artificielle Maroc à vos sources préférées pour retrouver davantage de nos actualités pertinentes dans la recherche Google.
Nous construisons des plateformes IA sur mesure, des produits SaaS, des applications métier intelligentes et des systèmes d’automatisation.
Ce formulaire est réservé aux demandes de projets, et non aux questions générales sur l’intelligence artificielle.