Brief IA : Qwen3.6-35B-A3B devance Claude Opus 4.7 dans un test humoristique

Qwen3.6-35B-A3B devance Claude Opus 4.7 dans un test humoristique

Brief IA
Tom Levy·2 min·4 vues

Le modèle Qwen3.6-35B-A3B d'Alibaba a surpassé Claude Opus 4.7 d'Anthropic en produisant une image de pélican plus convaincante. Ce benchmark souligne les avancées rapides des modèles d'IA générative dans la création artistique, ce qui pourrait redéfinir les standards de qualité dans le contenu visuel.

En bref
1Qwen3.6-35B-A3B d'Alibaba a surpassé Claude Opus 4.7 d'Anthropic dans un test de génération d'images de pélicans.
2Le modèle Qwen, utilisant un fichier de 20,9 Go par Unsloth, a fonctionné via LM Studio sur un MacBook Pro M5.
3Malgré la nature humoristique du test, Qwen a également excellé dans la création d'un SVG de flamant rose à vélo.
💡Pourquoi c'est importantLa performance de Qwen souligne l'évolution rapide des capacités des modèles d'IA, même dans des tâches non conventionnelles.
Le brief IA que lisent les pros

L’IA créative te passionne ?

Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Qwen3.6-35B-A3B : un modèle en avance

Dans un test de génération d'images qui se veut humoristique, le modèle Qwen3.6-35B-A3B d'Alibaba a surpassé Claude Opus 4.7 d'Anthropic. Ce test, surnommé le "benchmark du pélican à vélo", a été utilisé pour comparer les capacités des deux modèles récents.

Le modèle Qwen3.6-35B-A3B, utilisant le fichier quantifié de 20,9 Go Qwen3.6-35B-A3B-UD-Q4_K_S.gguf par Unsloth, a fonctionné sur un MacBook Pro M5 via LM Studio et le plugin llm-lmstudio. Il a produit une image de pélican jugée supérieure à celle générée par Claude Opus 4.7, qui a notamment gâché le cadre du vélo. Même en ajustant le paramètre "thinking_level" au maximum, Claude Opus n'a pas réussi à égaler la qualité de Qwen.

Un test au-delà de la blague

Bien que le benchmark du pélican soit conçu comme une blague, il a révélé une corrélation entre la qualité des images produites et l'utilité générale des modèles. Beaucoup de gens sont convaincus que les laboratoires s'entraînent pour ce benchmark absurde, bien que cela ne soit pas confirmé. Cependant, ce lien entre la qualité des pélicans et l'utilité générale des modèles a été rompu.

J'ai un énorme respect pour Qwen, mais je doute très fortement qu'une version quantifiée de 21 Go de leur dernier modèle soit plus puissante ou utile que la dernière version propriétaire d'Anthropic. Pourtant, pour des tâches spécifiques comme la création d'un SVG d'un pélican à vélo, Qwen3.6-35B-A3B semble être le meilleur choix actuellement.

Un résultat inattendu

En plus du test principal, un autre défi a été proposé aux modèles : générer un SVG d'un flamant rose à vélo. Là encore, Qwen a pris l'avantage, notamment grâce à un commentaire humoristique sur le SVG produit : "Sunglasses on flamingo!".

Ce résultat inattendu montre que, malgré la nature absurde du test, Qwen3.6-35B-A3B peut offrir des performances impressionnantes dans des tâches créatives et visuelles.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires