Brief IA : Apple Silicon : le coût énergétique caché des LLM locaux révélé

Apple Silicon : le coût énergétique caché des LLM locaux révélé

Brief IA
Tom Levy·4 min·16 vues

Une étude a testé cinq modèles de langage de grande taille (LLM) et a mesuré leur consommation énergétique à 0,31 $/kWh, révélant des coûts plus élevés que prévu. Les prévisions concernant la consommation de la carte graphique RTX-3090 ont été confirmées, mais la consommation réelle s'est avérée encore plus importante. Cette situation pourrait influencer les décisions des développeurs et des entreprises sur l'optimisation des ressources informatiques.

En bref
1Cinq modèles de LLM ont été testés pour évaluer leur consommation énergétique.
2La consommation a été mesurée à 0,31 $/kWh, révélant des coûts plus élevés que prévu.
3Les prévisions pour la RTX-3090 ont été confirmées, mais avec une consommation encore plus importante.
💡Pourquoi c'est importantLa consommation énergétique des LLM pourrait influencer les décisions des développeurs et des entreprises concernant l'optimisation des ressources informatiques.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Apple Silicon : le coût énergétique caché des LLM locaux révélé

Coût d'exploitation d'un LLM local

Un article récent de Towards Data Science, intitulé How Much Does It Actually Cost to Run a Local LLM?, a mis en lumière le coût énergétique associé à l'utilisation d'un modèle de langage local. L'étude a révélé que le modèle le plus coûteux à faire fonctionner n'était pas le plus grand, mais plutôt celui dont le coût par jeton dépendait du débit et non du nombre de paramètres.

L'auteur de l'article n'a pas de RTX 3090. Il utilise un Mac Studio M3 Ultra avec 96 Go de mémoire unifiée. Il a donc voulu savoir si les résultats de l'étude s'appliquaient également à sa machine. Il a mesuré la consommation d'énergie de cinq modèles en génération soutenue, en utilisant l'énergie réelle du mur et en la tarifiant à son tarif d'électricité de 0,31 $/kWh. Résultat : la surprise est encore plus marquée sur Apple Silicon. Son modèle de 120 milliards de paramètres coûte environ cinq fois moins par jeton qu'un modèle de taille inférieure.

Méthodologie de mesure

L'outil utilisé pour ces mesures s'appelle TokenWatt. C'est un proxy compatible avec OpenAI, conçu spécifiquement pour Apple Silicon. Il envoie chaque requête à un serveur d'inférence local tout en mesurant la consommation d'énergie. TokenWatt lit les rails d'alimentation de la puce via l'interface IOReport d'Apple, sans nécessiter de permissions spéciales ou d'instruments externes. Il soustrait une ligne de base d'inactivité pour mesurer le coût marginal de la requête, et il évalue le résultat selon le tarif d'électricité de l'utilisateur.

Pour garantir la fiabilité des mesures, l'auteur a calibré TokenWatt avec un Shelly Plug US Gen4 qui mesure l'énergie réelle au mur. Chaque chiffre présenté est accompagné d'une marge d'erreur réelle, variant entre ±2,6 % et ±4,5 %.

Résultats des modèles mesurés

Les mesures ont été effectuées en boucle de génération soutenue à trois durées (120, 360 et 720 secondes), avec un temps d'inactivité de 15 minutes entre chaque exécution. Voici les résultats :

| Modèle | Paramètres | Type | Empreinte | tok/s | Coût ($/1M out) | |----------------------|------------|-------|-----------|-------|------------------| | Qwen3.5-4B | 4B | Dense | 2.9 GB | 133.8 | $0.063 | | Qwen3.6-35B-A3B | 35B | MoE | 35 GB | 76.0 | $0.087 | | Qwen3-Coder-Next | ~80B | MoE | 60 GB | 65.0 | $0.103 | | gpt-oss-120b | 120B | MoE | 59 GB | 74.0 | $0.109 | | Qwen3.6-27B | 27B | Dense | 28 GB | 21.5 | $0.554 |

Analyse des coûts

Le modèle le moins cher est le plus petit, mais le modèle le plus coûteux, par un facteur de cinq à neuf, est le modèle dense de 27 milliards de paramètres. Le modèle de 120 milliards est cinq fois moins cher. Le coût d'exploitation d'un modèle ne dépend pas simplement du nombre de paramètres, mais de la manière dont les données sont traitées.

Pourquoi le grand modèle est plus avantageux

Le coût énergétique par jeton est déterminé par la puissance consommée et le débit de génération. Le modèle dense de 27B consomme 138 watts tout en ne générant que 21,5 jetons par seconde. En revanche, les modèles de type mixture-of-experts (MoE) activent seulement une fraction de leurs paramètres pour chaque jeton, ce qui réduit la quantité de données déplacées et améliore la vitesse et l'efficacité énergétique.

Impact en conditions réelles

Un benchmark en boucle soutenue ne reflète pas toujours la réalité d'une utilisation quotidienne. L'auteur a également enregistré ses requêtes d'inférence réelles pendant un mois, totalisant environ 6 300 requêtes. Les résultats montrent que le modèle dense de 27B coûte environ dix fois plus par jeton que les MoE.

Considérations spécifiques à Apple Silicon

  • Coût de la mémoire : Sur une machine à mémoire unifiée, le maintien d'un grand modèle en mémoire consomme de l'énergie même entre les jetons.

  • Limites de mémoire : Le modèle de 120B utilise environ 59 Go, ce qui approche la limite pratique du Mac de l'auteur. Des machines avec 192 Go ou 256 Go pourraient exécuter des modèles plus grands.

  • Coût marginal : Les mesures ne prennent en compte que l'électricité marginale, et non le coût total du Mac, qui est bien plus élevé selon son utilisation.

Ces résultats sont utiles pour comparer les coûts d'exploitation des modèles de langage sur des machines Apple Silicon.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires