Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un changement de paradigme dans l'industrie de l'IA
L'essor de l'intelligence artificielle repose sur une idée largement acceptée : plus un modèle est grand, plus il est puissant, et donc, plus il est performant. Cependant, cette hypothèse pourrait être remise en question, alors que l'industrie se prépare à explorer les conséquences d'une telle évolution.
Les coûts croissants incitent déjà les utilisateurs à envisager des modèles plus petits et moins onéreux. Ce mouvement vers des solutions plus économiques est encore récent, et bien que ses effets sur l'industrie soient incertains, ils pourraient être considérables.
La vision de Brian Armstrong
Brian Armstrong, cofondateur de Coinbase, anticipe un déplacement majeur vers des modèles moins coûteux. Selon lui, la demande en intelligence artificielle est presque illimitée, mais il prévoit que 80 % des tâches seront exécutées par des modèles 99 % moins chers dans les 12 à 18 mois à venir. Les 20 % restants continueront à nécessiter les modèles les plus avancés pour des optimisations spécifiques.
Si cette prédiction se réalise, cela pourrait transformer radicalement le paysage de l'IA.
La concurrence sur la qualité
Historiquement, les entreprises d'IA ont misé sur la qualité, ce qui les a poussées à adopter les modèles les plus avancés disponibles. Si des tâches peuvent être accomplies avec des modèles moins coûteux sans compromettre la qualité, cela représenterait un bouleversement majeur dans l'économie de l'IA. Les économies réalisées proviendraient principalement des grands laboratoires, ce qui pourrait avoir des répercussions financières sur des entreprises comme OpenAI et Anthropic, surtout à l'approche de leurs introductions en bourse.
Tests prometteurs avec des modèles plus petits
Des tests initiaux indiquent que des modèles plus petits et moins chers peuvent être utilisés sans perte de qualité, à condition que le système soit bien organisé. Par exemple, Harvey, un outil d'IA pour le secteur juridique, a réussi à réduire ses coûts d'inférence par trois sans affecter la qualité. En collaboration avec Fireworks AI, Harvey a utilisé Claude Opus et GLM 5.1 de Fireworks, en réservant Opus pour les tâches les plus exigeantes. Cette approche a permis de diminuer considérablement le temps serveur et les coûts globaux.
La redéfinition de la qualité
Gabe Pereyra, cofondateur de Harvey, a souligné que la qualité reste primordiale, surtout dans le domaine juridique. Cependant, la définition de la qualité évolue : il ne s'agit plus seulement d'utiliser le modèle le plus puissant, mais de choisir celui qui offre la meilleure réponse de manière efficace.
La vraie division : grands modèles contre petits modèles
La discussion ne se limite pas à l'opposition entre modèles propriétaires et modèles ouverts. La véritable distinction se situe entre grands et petits modèles. Passer de GPT-5.5 à V4 Flash de DeepSeek peut générer des économies, mais opter pour GPT-5.4-mini peut être tout aussi efficace.
Une guerre des prix en cours
Il existe une compétition active entre l'inférence interne des grands laboratoires et les modèles à poids ouverts servis indépendamment. Pour la question des petits contre grands modèles, peu importe quel type de petit modèle l'emporte.
Un changement de mentalité nécessaire
Bien que cela puisse sembler évident de ne pas utiliser plus de ressources que nécessaire, cette idée va à l'encontre de l'approche de "scalabilité d'abord" qui a dominé jusqu'à présent. Les laboratoires ont longtemps cherché à développer les modèles les plus gourmands en ressources, poussant les limites de l'IA. Avec des prix souvent subventionnés par les investisseurs, les clients n'avaient aucune raison de ne pas choisir l'option la plus avancée.
Pression sur les coûts et avenir incertain
Avec l'augmentation des prix des tokens et la diminution des subventions, les utilisateurs ressentent pour la première fois une pression sur les coûts. Il reste à voir si cela poussera réellement les entreprises à adopter des modèles plus petits. Elles pourraient aussi choisir de réduire le nombre d'appels, d'utiliser moins de contexte, ou d'abandonner certains déploiements.
Si la plupart des déploiements peuvent fonctionner aussi bien avec un modèle plus petit, cela pourrait freiner la demande croissante pour l'inférence et poser de nouvelles questions sur la justification des coûts liés à l'entraînement de modèles de pointe.
