L’IA créative te passionne ?
Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI dévoile ChatGPT Images 2.0
OpenAI a récemment présenté ChatGPT Images 2.0, son dernier modèle de génération d'images, lors d'une diffusion en direct. Sam Altman, le PDG d'OpenAI, a comparé l'évolution de ce modèle à un bond technologique similaire à celui entre GPT-3 et GPT-5. Cette comparaison souligne l'ampleur des améliorations apportées par ce nouveau modèle.
Premiers tests avec gpt-image-1
Pour évaluer les progrès réalisés, j'ai d'abord testé l'ancien modèle gpt-image-1 en utilisant ChatGPT. Le défi consistait à trouver un raton laveur dans une image de type "Où est Charlie", un exercice qui s'est avéré frustrant. Même avec l'aide de Claude Opus 4.7, qui dispose de capacités de résolution d'image améliorées, le raton laveur est resté introuvable, caché derrière une carte d'instructions dans l'image.
Comparaison avec Nano Banana 2 et Pro
J'ai ensuite testé Nano Banana 2 via Gemini. Ce modèle a réussi à identifier le raton laveur, qui était placé de manière évidente dans le stand du "Amateur Radio Club" au centre de l'image. Le détail humoristique "W6HAM" sur le panneau du stand a également été remarqué. En revanche, Nano Banana Pro, testé dans AI Studio, a offert une performance décevante, échouant à repérer le raton laveur.
Essai du nouveau modèle
Avec ces références en tête, j'ai mis à l'épreuve le nouveau modèle. J'ai utilisé une version mise à jour de mon script openai_image.py, qui fonctionne avec la bibliothèque cliente Python d'OpenAI. Bien que cette bibliothèque n'ait pas encore intégré gpt-image-2, elle permet néanmoins son utilisation grâce à l'absence de validation de l'ID du modèle.
Voici comment le test a été réalisé :
OPENAI_API_KEY="$(llm keys get openai)" \
uv run https://tools.simonwillison.net/python/openai_image.py \
-m gpt-image-2 \
"Do a where's Waldo style image but it's where is the raccoon holding a ham radio"
Le résultat initial ne montrait pas de raton laveur, ni pour moi, ni pour Claude. Cependant, après avoir ajusté les paramètres de qualité de sortie et de taille d'image, j'ai obtenu une image de haute qualité où le raton laveur était clairement visible en bas à gauche.
Détails techniques et coûts
L'image générée a utilisé 13 342 tokens, facturés à 30 $/million, ce qui représente un coût d'environ 40 cents. Cette tarification rend le modèle accessible pour des applications nécessitant des images complexes.
Limites et perspectives
Malgré les avancées, il reste des défis. Un utilisateur de Hacker News, rizaco, a tenté de faire dessiner un cercle rouge autour du raton laveur par ChatGPT, mais le modèle n'a pas réussi à résoudre sa propre énigme. Cela souligne les limites actuelles des modèles d'IA à comprendre et à interagir avec les tâches qu'ils génèrent.
En conclusion, ChatGPT Images 2.0 marque une étape importante dans la génération d'images par IA, offrant des améliorations significatives par rapport à ses prédécesseurs. Cependant, des défis subsistent quant à la capacité des modèles à résoudre des énigmes complexes qu'ils créent eux-mêmes.