Brief IA : ChatGPT Images 2.0 : OpenAI révolutionne la génération d'images

ChatGPT Images 2.0 : OpenAI révolutionne la génération d'images

Brief IA
Tom Levy·3 min·1 vues

OpenAI a lancé ChatGPT Images 2.0, un modèle de génération d'images avancé, le 25 octobre 2023. Cette mise à jour est comparée à la transition de GPT-3 à GPT-5, ce qui pourrait transformer la création visuelle en ligne et augmenter la créativité des utilisateurs, révolutionnant ainsi le design numérique et l'interaction créative.

En bref
1OpenAI a lancé ChatGPT Images 2.0, un modèle de génération d'images qui promet une avancée significative par rapport à son prédécesseur.
2Les tests comparatifs avec d'autres modèles, comme Nano Banana 2, montrent des performances variées, mais ChatGPT Images 2.0 se distingue par sa qualité.
3Le modèle utilise 13 342 tokens pour générer des images complexes, avec un coût d'environ 40 cents par image.
💡Pourquoi c'est importantCette avancée technologique d'OpenAI pourrait transformer la manière dont les images complexes sont générées et utilisées dans divers secteurs.
Le brief IA que lisent les pros

L’IA créative te passionne ?

Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

OpenAI dévoile ChatGPT Images 2.0

OpenAI a récemment présenté ChatGPT Images 2.0, son dernier modèle de génération d'images, lors d'une diffusion en direct. Sam Altman, le PDG d'OpenAI, a comparé l'évolution de ce modèle à un bond technologique similaire à celui entre GPT-3 et GPT-5. Cette comparaison souligne l'ampleur des améliorations apportées par ce nouveau modèle.

Premiers tests avec gpt-image-1

Pour évaluer les progrès réalisés, j'ai d'abord testé l'ancien modèle gpt-image-1 en utilisant ChatGPT. Le défi consistait à trouver un raton laveur dans une image de type "Où est Charlie", un exercice qui s'est avéré frustrant. Même avec l'aide de Claude Opus 4.7, qui dispose de capacités de résolution d'image améliorées, le raton laveur est resté introuvable, caché derrière une carte d'instructions dans l'image.

Comparaison avec Nano Banana 2 et Pro

J'ai ensuite testé Nano Banana 2 via Gemini. Ce modèle a réussi à identifier le raton laveur, qui était placé de manière évidente dans le stand du "Amateur Radio Club" au centre de l'image. Le détail humoristique "W6HAM" sur le panneau du stand a également été remarqué. En revanche, Nano Banana Pro, testé dans AI Studio, a offert une performance décevante, échouant à repérer le raton laveur.

Essai du nouveau modèle

Avec ces références en tête, j'ai mis à l'épreuve le nouveau modèle. J'ai utilisé une version mise à jour de mon script openai_image.py, qui fonctionne avec la bibliothèque cliente Python d'OpenAI. Bien que cette bibliothèque n'ait pas encore intégré gpt-image-2, elle permet néanmoins son utilisation grâce à l'absence de validation de l'ID du modèle.

Voici comment le test a été réalisé :

OPENAI_API_KEY="$(llm keys get openai)" \
uv run https://tools.simonwillison.net/python/openai_image.py \
-m gpt-image-2 \
"Do a where's Waldo style image but it's where is the raccoon holding a ham radio"

Le résultat initial ne montrait pas de raton laveur, ni pour moi, ni pour Claude. Cependant, après avoir ajusté les paramètres de qualité de sortie et de taille d'image, j'ai obtenu une image de haute qualité où le raton laveur était clairement visible en bas à gauche.

Détails techniques et coûts

L'image générée a utilisé 13 342 tokens, facturés à 30 $/million, ce qui représente un coût d'environ 40 cents. Cette tarification rend le modèle accessible pour des applications nécessitant des images complexes.

Limites et perspectives

Malgré les avancées, il reste des défis. Un utilisateur de Hacker News, rizaco, a tenté de faire dessiner un cercle rouge autour du raton laveur par ChatGPT, mais le modèle n'a pas réussi à résoudre sa propre énigme. Cela souligne les limites actuelles des modèles d'IA à comprendre et à interagir avec les tâches qu'ils génèrent.

En conclusion, ChatGPT Images 2.0 marque une étape importante dans la génération d'images par IA, offrant des améliorations significatives par rapport à ses prédécesseurs. Cependant, des défis subsistent quant à la capacité des modèles à résoudre des énigmes complexes qu'ils créent eux-mêmes.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires