Brief IA : Google Lens révolutionne la recherche visuelle avec l'IA multimodale

Google Lens révolutionne la recherche visuelle avec l'IA multimodale

Brief IA
Tom Levy·5 min·6 vues

L'IA utilise une méthode de fan-out des requêtes pour traiter efficacement les images et extraire des informations pertinentes, transformant ainsi l'interaction des utilisateurs avec les moteurs de recherche visuels. Grâce à la mise à jour de **Circle to Search** et **Lens**, Google permet désormais de rechercher plusieurs objets dans une seule image simultanément, améliorant l'expérience utilisateur. Ces avancées technologiques redéfinissent la recherche visuelle en rendant les résultats plus intuitifs et efficaces.

En bref
1Google a amélioré Circle to Search et Lens pour analyser plusieurs objets dans une image.
2Dounia Berrada explique comment l'IA décompose et recherche simultanément des éléments visuels.
3Le modèle Gemini alimente ces avancées en combinant analyse d'image et recherche web.
💡Pourquoi c'est importantCes innovations simplifient la recherche visuelle, facilitant l'accès à l'information et l'inspiration dans divers contextes.
Le brief IA que lisent les pros

L’IA appliquée, concrètement ?

Les cas d’usage qui marchent vraiment, décryptés chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Google Lens révolutionne la recherche visuelle avec l'IA multimodale

La recherche visuelle a récemment franchi un cap significatif grâce aux innovations de Google, notamment avec les mises à jour de Google Search. Un expert de Google éclaire sur ces avancées et les techniques employées pour les réaliser.

Tout le monde a déjà vécu cette situation : apercevoir une image d'un salon magnifiquement décoré ou d'une tenue de rue élégante et vouloir en connaître chaque détail. Jusqu'à peu, la recherche visuelle se faisait élément par élément. Cependant, une mise à jour majeure de Circle to Search et Lens permet désormais à Google de décomposer et d'analyser plusieurs objets dans une seule image en même temps. Cela signifie que si l'on utilise Circle to Search sur Android pour une tenue complète, on obtiendra des résultats pour chaque composant du look, et non plus un seul élément à la fois. Au cours des derniers mois, plusieurs mises à jour ont été déployées pour améliorer la recherche visuelle et les résultats d'image en Mode IA, facilitant ainsi la recherche d'inspiration.

Pour mieux comprendre ces avancées, un échange a eu lieu avec Dounia Berrada, Directrice Senior de l'ingénierie de recherche chez Google.

Sur quel aspect de la recherche travaillez-vous ?

Dounia Berrada se concentre sur la recherche multimodale, également connue sous le nom de Google Lens. L'idée est de permettre à Google de répondre aux questions les plus complexes concernant les images, les PDF et tout ce que l'on voit. La recherche visuelle redéfinit l'interaction avec l'information ; Lens doit être suffisamment intelligent pour comprendre le "pourquoi" de la recherche, rendant ainsi facile l'obtention d'aide sur ce que l'on voit à l'écran ou dans le monde qui nous entoure. Cela signifie construire un outil capable d'expliquer aussi facilement un problème mathématique complexe que d'identifier une plante succulente rare ou d'aider à retrouver une paire de chaussures adorée.

Comment cela fonctionne-t-il ?

Imaginez que quelqu'un redessine une pièce et télécharge une photo d'un espace de style moderne du milieu du siècle pour s'inspirer. Cette personne ne cherche probablement pas seulement la table d'appoint ; elle souhaite recréer toute l'ambiance. Auparavant, il fallait rechercher la lampe, puis le tapis, puis la chaise individuellement. Désormais, le Mode IA peut décomposer cette image complexe, identifier chaque pièce individuelle et effectuer plusieurs recherches visuelles simultanément. Cela peut être vu en action dès maintenant en utilisant Circle to Search.

Qu'est-ce qui alimente ces types de réponses de recherche visuelle ?

Les modèles avancés Gemini rendent le Mode IA possible, et ses capacités multimodales bénéficient de l'expertise visuelle intégrée dans Lens au fil des ans. Lorsque l'on recherche avec une image, Gemini analyse l'image en parallèle avec la question pour décider quels outils utiliser. Supposons que quelqu'un fait défiler son téléphone et voit une tenue sur les réseaux sociaux qu'il aime. Lorsqu'il la recherche, le modèle sait utiliser Lens pour récupérer simultanément les résultats d'image pour le chapeau, les chaussures et la veste de la tenue. Il tisse ensuite ces résultats individuels en une réponse unique et facile à lire.

Pensez-y de cette manière : le modèle IA agit comme le "cerveau" capable de "voir" l'image, tandis que le backend de recherche visuelle agit comme la "bibliothèque" contenant des milliards de résultats web. L'IA effectue un raisonnement multi-objets pour comprendre ce que l'on regarde. Ensuite, elle utilise une technique de "fan-out" qui déclenche plusieurs recherches à la fois, lit les résultats et présente une réponse unique et cohérente avec des liens utiles — le tout en quelques secondes.

Pouvez-vous expliquer la technique de fan-out ?

Le Mode IA effectue essentiellement une douzaine de recherches pour l'utilisateur en un temps record. Si quelqu'un télécharge une photo d'un jardin admiré, il pourrait avoir plusieurs questions : ces plantes survivront-elles à l'ombre ? Sont-elles adaptées à mon climat ? Quelle est leur maintenance ? Auparavant, il fallait poser ces questions une par une. Désormais, le Mode IA identifie toutes ces recherches "fan-out" nécessaires. De cette façon, il rassemble les exigences de soin pour chaque plante sur la photo en utilisant des résultats web utiles, décompose les informations et suggère même les prochaines étapes que l'utilisateur pourrait vouloir entreprendre. Comme le Mode IA découvre plus de résultats visuels à partir d'une seule recherche, il est plus facile que jamais de trouver exactement ce que l'on cherche, tout en découvrant quelque chose de nouveau qui suscite l'intérêt.

Devez-vous commencer par une image pour obtenir ce type d'aide dans le Mode IA ?

Pas du tout ! On peut commencer par une simple recherche textuelle dans le Mode IA, comme "inspiration visuelle pour des tenues de travail". Lorsque l'on voit un résultat qui plaît, il suffit de dire : "Montrez-moi plus d'options comme la deuxième jupe." Le système prend immédiatement cette image spécifique et commence le processus de fan-out à partir de là.

Cela semble idéal pour le shopping — à quoi d'autre cela pourrait-il servir ?

On pourrait prendre une photo d'un mur dans un musée et demander des explications sur chaque tableau. Ou prendre une photo d'une vitrine de boulangerie et demander ce que sont toutes les différentes pâtisseries. Il s'agit de passer de "Qu'est-ce que cette chose ?" à "Expliquez-moi toute cette scène."

Il semble qu'il y ait quelques photos à prendre et beaucoup plus à découvrir. Ces outils seront mis à l'épreuve !

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires