Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI réinvente la génération d'images
OpenAI a récemment annoncé le lancement de ChatGPT Images 2.0, un modèle de génération d'images de nouvelle génération qui se concentre sur la précision, l'utilisabilité et les tâches visuelles complexes. Ce modèle se distingue par sa capacité à combiner texte et images pour créer des pages complexes et esthétiques. OpenAI redéfinit ainsi la génération d'images, en la présentant comme un langage visuel plutôt qu'un simple processus de création décorative.
OpenAI décrit ce modèle en affirmant : "Une bonne image fait ce qu'une bonne phrase fait : elle sélectionne, organise et révèle. Elle peut expliquer un mécanisme, créer une ambiance, tester une idée ou faire un argument."
Capacités de réflexion pour des flux de travail complexes
En plus de sa capacité améliorée à mélanger texte et graphiques, le nouveau modèle utilise des capacités de réflexion avancées. Il peut générer plusieurs images par prompt avec une continuité entre les résultats. Cette approche est possible car le modèle intègre réellement le raisonnement dans la sortie d'image.
Par exemple, à partir d'un prompt vague comme "Générer une infographie sur les activités à faire en tenant compte de la météo de demain à San Francisco", l'IA recueillera des données sur la météo et les activités appropriées, puis construira une image ou un ensemble d'images qui correspondent aux résultats.
Selon OpenAI, "Dans ce modèle, Images 2.0 agit davantage comme un partenaire de réflexion visuelle, aidant à faire passer un projet d'un concept brut à un actif fini avec beaucoup moins de travail de votre part."
Précision et contrôle de conception
De nombreux utilisateurs ont longtemps eu du mal à convaincre ChatGPT de générer des images dans un rapport d'aspect spécifique. Souvent, l'IA produit obstinément ce qu'elle veut. Mais maintenant, avec Images 2.0, le modèle prend en charge des "rapports d'aspect aussi larges que 3:1 et aussi hauts que 1:3".
Le modèle prend également en charge des sorties de haute fidélité qui produisent (principalement) un placement d'objets précis, un rendu de texte détaillé et des compositions complexes. Nous verrons si nous pouvons retirer le mot "principalement" de cette phrase après la sortie officielle du produit.
Test de l'aperçu
J'ai eu accès à un aperçu la veille de la sortie, et le modèle est impressionnant, pour la plupart. J'ai fourni une capture d'écran de la page d'accueil de ZDNET et un brouillon du communiqué de presse d'Images 2.0.
Ensuite, j'ai demandé : "En vous basant sur le contenu du communiqué de presse, générez une infographie au format 16:9 sur la nouvelle mise à jour d'image et générez-la en utilisant le style de marque ZDNET tel qu'indiqué dans le document de la page d'accueil de ZDNET."
Le modèle a bien réussi l'infographie, mais il n'a pas pu reproduire le logo ZDNET. Lors de sa première tentative, il a rendu le "Z" de ZDNET avec un léger affaissement.
J'ai essayé une variété de demandes pour corriger le logo, mais Images 2.0 n'a jamais réussi à le corriger. J'ai donc commencé une nouvelle session, en incluant l'instruction : "Prenez soin de reproduire le logo ZDNET avec précision."
Problèmes avec le logo
C'est à ce moment-là que les choses sont devenues étranges. Pour son premier essai, le modèle a retrouvé une copie du logo ZDNET d'avant notre redesign de 2022, qui n'est nulle part visible sur notre page d'accueil actuelle. Étrangement, il a rendu ce vieux logo avec le schéma de couleurs actuel. Le modèle a ensuite poussé le logo et les informations de l'infographie hors du bord gauche de l'image, choisissant une couleur bleu clair pour "Images 2.0" qui n'est pas une couleur de marque ZDNET.
J'ai fait de mon mieux pour le convaincre d'utiliser le logo actuel, mais même après avoir demandé de ne pas chercher un logo alternatif, le problème n'a pas été résolu.
Conclusion et disponibilité
Je teste une version préliminaire d'Images 2.0 et je reviendrai avec un test beaucoup plus complet après la sortie officielle du produit. Le nouveau modèle est disponible dès aujourd'hui pour tous les utilisateurs de ChatGPT et Codex. Les sorties avancées et la capacité de réflexion sont accessibles aux utilisateurs de ChatGPT Plus, Pro, Business et Enterprise.
À l'heure actuelle, avant la sortie, le nouveau modèle Images 2.0 n'est disponible que sur desktop, mais OpenAI promet que ces capacités seront également présentes dans la version mobile. Les images sont également disponibles via l'API en utilisant le modèle gpt-image-2. Les prix de l'API varient en fonction de la qualité, de la complexité et de la résolution d'image souhaitée.
