Brief IA : Gemini Omni de Google : révolution ou illusion pour la vidéo IA ?

Gemini Omni de Google : révolution ou illusion pour la vidéo IA ?

Brief IA
Tom Levy·7 min·15 vues

Gemini Omni est le premier modèle 'any-to-any' de Google, capable de générer et d'éditer du contenu multimédia, y compris texte, image, audio et vidéo. Cette innovation pourrait transformer la création de contenu numérique, augmentant l'efficacité des professionnels et redéfinissant les standards de l'industrie, positionnant ainsi Google comme un leader dans ce domaine.

En bref
1Gemini Omni, le modèle any-to-any de Google, génère et édite texte, image, audio et vidéo sans intermédiaire.
2En Europe, les fonctionnalités audio et vidéo de Gemini sont restreintes, mais Google Flow offre une alternative via abonnement.
3La technologie SynthID de DeepMind intègre un filigrane numérique indélébile dans les vidéos générées par Gemini Omni.
💡Pourquoi c'est importantGemini Omni pourrait transformer la production multimédia, mais les restrictions géographiques limitent son potentiel en Europe.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Gemini Omni : le modèle any-to-any de Google

Gemini Omni est le premier modèle "any-to-any" de Google, capable de comprendre et de générer simultanément du texte, des images, de l'audio et de la vidéo. Cette innovation permet de traiter ces différents médias sans passer par des modèles intermédiaires, simplifiant ainsi des processus complexes. Grâce à cette approche, il est possible de créer des vidéos à partir de simples descriptions textuelles ou d'images, et d'éditer des séquences existantes avec une grande précision.

Le modèle se distingue par sa capacité à intégrer plusieurs types de médias dans un seul flux de travail, ce qui était auparavant impossible sans l'utilisation de multiples outils distincts. Cela ouvre de nouvelles possibilités pour les créateurs de contenu qui peuvent désormais générer des vidéos complexes et dynamiques avec une facilité inédite.

Interface et fonctionnalités de génération

Lors de nos tests, l'application grand public de Gemini s'est révélée intuitive et efficace. Elle permet de choisir le ratio d'aspect du clip, qu'il soit en paysage ou en portrait, avant de lancer la génération. Cela évite les approximations et garantit un rendu optimal. L'interface propose également des modèles prédéfinis pour appliquer instantanément des styles graphiques particuliers, facilitant ainsi la personnalisation des vidéos.

Cette interface utilisateur simplifiée est conçue pour être accessible même aux utilisateurs qui n'ont pas d'expérience préalable en montage vidéo, rendant la technologie accessible à un public plus large. Les modèles prédéfinis permettent également de gagner du temps en appliquant des styles visuels cohérents en quelques clics seulement.

Modification de vidéos existantes

L'un des principaux atouts de Gemini Omni est sa capacité à modifier des vidéos existantes en utilisant un langage naturel. Il suffit de décrire les modifications souhaitées, et le modèle s'occupe du reste, préservant la cohérence visuelle de la séquence. Par exemple, remplacer un élément visuel dans une vidéo existante en fournissant une image de référence est particulièrement utile pour les équipes souhaitant intégrer un produit dans une scène réelle. Cependant, lors de nos tests, un souci est apparu : Omni a compris qu'il fallait remplacer tous les taxis par une voiture de luxe, ce qui n'était pas notre intention initiale.

Dans un autre exemple, nous avons transformé une scène ensoleillée de New York en une scène de tempête. Bien que Gemini respecte globalement les consignes imposées par le prompt, la qualité visuelle de certains éléments laisse à désirer. Les éclairs générés manquent de réalisme et l'animation de l'eau apparaît artificielle.

Cette capacité à modifier des vidéos existantes sans avoir à reconstruire entièrement la séquence est un gain de temps considérable pour les créateurs de contenu, mais elle nécessite encore des améliorations pour atteindre un niveau de réalisme optimal.

Restrictions en Europe et alternatives

Il est important de noter que dans l'Espace Économique Européen, les fonctionnalités d'entrée audio et vidéo de Gemini sont actuellement restreintes pour des raisons réglementaires liées au RGPD et à l'AI Act. Cependant, ces limitations peuvent être partiellement contournées en utilisant Google Flow, accessible via l'abonnement Google AI Pro. Google Flow utilise un système de crédits, permettant aux utilisateurs de gérer leur consommation de ressources.

Cette restriction géographique est un obstacle pour les utilisateurs européens qui souhaitent exploiter pleinement les capacités de Gemini Omni. Google Flow offre une alternative viable, mais nécessite un abonnement payant, ce qui peut être un frein pour certains utilisateurs.

Génération audio et vidéo à partir de photos

Gemini Omni se distingue également par sa capacité à générer du son synchronisé avec l'action à l'écran. Lors de nos tests, bien que les bruitages demandés aient été présents, leur synchronisation laissait à désirer. En outre, la génération de vidéos à partir de photos est un point fort du modèle. Nous avons fourni des images d'un lieu pour générer une vidéo 360°, mais le rendu final n'a pas réussi à atteindre la rotation complète demandée, se contentant d'un panorama partiel.

Au-delà de l'animation de lieux, cette capacité à générer des vidéos à partir d'images fixes trouve une application particulièrement pertinente dans le domaine de la publicité. Par exemple, nous avons testé la création d'une vidéo à partir d'une chaussure de sport. Le résultat est qualitatif, même si les transitions pourraient être plus fluides. La chaussure est, en revanche, totalement fidèle à l'image transmise.

Création de doubles numériques

Une autre fonctionnalité intéressante de Gemini Omni est la création de doubles numériques, des clones IA de votre visage et de votre voix, utilisables dans toutes les vidéos générées. Pour créer ce double numérique, l'utilisateur doit scanner son visage sous plusieurs angles à l'aide de la caméra frontale, puis lire quelques phrases à voix haute pour modéliser sa voix. Cette fonctionnalité n'est pas encore disponible dans l'EEA, au Royaume-Uni et en Suisse.

La création de ce clone numérique s'effectue directement depuis l'application Gemini. Une fois généré, cet avatar est associé au compte Google de l'utilisateur sous la forme d'un tag (par exemple @nom). Il devient alors extrêmement simple de l'intégrer dans n'importe quelle vidéo en mentionnant simplement ce tag dans le prompt de génération.

Cette technologie ouvre la voie à de nouvelles formes de personnalisation dans le contenu vidéo, permettant aux utilisateurs de s'intégrer numériquement dans des scénarios variés.

Cohérence des séries et outils de montage

Pour assurer une cohérence graphique dans une série de clips, Google Flow, un outil de production IA, peut être utilisé. Il permet de générer des clips en série avec des personnages récurrents. Cependant, il y a toujours des incohérences dans les décors si l'on génère plusieurs vidéos dans un même lieu, car l'IA n'en a pas forcément la notion. Flow intègre directement un outil de montage où l'on peut insérer les différents clips générés et les modifier directement avec l'agent. Pour l'instant, il n'est possible de modifier qu'une vidéo à la fois, qu'il faut bien sélectionner.

Dans cet exemple, nous avons utilisé Google Flow, un outil de production IA développé par Google Labs, qui utilise Omni. Google Flow est disponible pour les abonnés payants et utilise un système de crédits. Avant tout, il faut générer une image de référence propre du personnage avec Nano Banana. Pour que le personnage généré soit efficace, utilisez un fond uni (de préférence blanc), demandez des photos de face et de profil pour améliorer la qualité finale de la vidéo, et veillez à ce qu'aucune autre personne ou visage n'apparaisse dans l'image.

Pour chaque clip, rappeler le personnage via @personnage (par exemple @sophie dans notre exemple) dans le prompt, avec le modèle Omni activé. Il faut ensuite glisser le produit. L'avantage avec Google Flow, c'est que l'on peut choisir la durée, le modèle, le nombre de versions que l'on souhaite et l'orientation souhaitée.

Attention à toujours glisser le personnage et le produit dans chaque message sur Flow, sinon l'outil peut utiliser un autre personnage. Il y a toujours des incohérences dans les décors si l'on génère plusieurs vidéos dans un même lieu, l'IA n'en a pas forcément la notion. Une bonne idée est de créer un storyboard avec Nano Banana afin de générer des lieux et personnages cohérents tout au long de la vidéo.

Filigrane numérique et tarification

Toutes les vidéos produites par Gemini Omni intègrent désormais la technologie SynthID de Google DeepMind, un filigrane numérique injecté directement dans les pixels de chaque image lors de la génération. Ce filigrane reste détectable même après des modifications comme la compression ou le recadrage. En termes de tarification, trois niveaux d'abonnement sont proposés, allant de l'offre gratuite à Google AI Ultra à 99,99 €/mois, offrant des quotas étendus et un accès prioritaire aux derniers modèles.

Gemini Omni représente une avancée significative dans la création vidéo par IA, simplifiant des processus qui nécessitaient auparavant plusieurs outils distincts. Cependant, les restrictions géographiques limitent son potentiel en Europe. Les utilisateurs doivent peser le coût des abonnements et les limitations géographiques contre les avantages offerts par cette technologie de pointe.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires