Brief IA

PrismML compresse Qwen 27B à 5,9 Go, vise l’usage sur appareil

🛠️ AI Tools·Tom Levy·

PrismML compresse Qwen 27B à 5,9 Go, vise l’usage sur appareil

PrismML compresse Qwen 27B à 5,9 Go, vise l’usage sur appareil
Key Takeaways
1PrismML lance Bonsai 2 27B, une version compressée de Qwen3.8 27B à 5,9 Go
2Le modèle atteint 98 % des scores de référence de l’original et tient sur PC
3La compression repose sur des poids ternaires (+1, -1, 0) au lieu de 16 bits
4Des modèles de plusieurs centaines de milliards de paramètres sont prévus
💡Why it mattersLa compression permet d’exécuter des LLM avancés localement, ouvrant la voie à des usages privés et accessibles sur des appareils courants.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Avec Bonsai 2 27B, PrismML propose une version compressée du modèle Qwen3.8 27B ramenée à 5,9 Go. La startup californienne revendique 98 % des scores de référence de l’original et prépare déjà des versions de plusieurs centaines de milliards de paramètres.

Sur l’appareil, gratuit et privé selon Ion Stoica, mais la parité totale reste incertaine

Pour Ion Stoica, conseiller de PrismML, la technologie permet d'exécuter des modèles avancés directement sur les appareils des utilisateurs. Il estime que l'intelligence sera accessible sans coût supplémentaire, car elle fonctionnera sur l'appareil déjà acquis, et que la confidentialité sera préservée puisque les données ne seront pas envoyées dans le cloud. Babak Hassibi, PDG de PrismML, indique que la compression aura probablement toujours un effet sur la performance et que la parité à 100 % reste incertaine. Il considère cependant qu'atteindre 100 % devient plus accessible avec des modèles plus grands.

Bonsai 2 27B réduit Qwen3.8 27B à 5,9 Go, avec 98 % des benchmarks

PrismML a lancé Bonsai 2 27B, qui compresse le modèle open source Qwen3.8 27B d’Alibaba à une taille de 5,9 Go. Cette réduction représente un facteur de 9 à 10 sur la mémoire par rapport à l’original et permet au modèle de tenir sur un PC, avec une utilisation sur smartphone haut de gamme envisagée. Bonsai 2 atteint 98 % des scores de référence agrégés de Qwen. Le premier Bonsai, lancé en mars, égalait 95 % et, selon PrismML, a été téléchargé plus de 11 millions de fois, tandis que des modèles encore plus petits totalisent 2,6 millions de téléchargements supplémentaires.

Compression par poids ternaires : de 16 bits à +1, -1, 0

La méthode de PrismML consiste à réduire la taille des modèles en agissant sur les poids du réseau, qui représentent les informations apprises lors de l’entraînement. Alors qu’un poids nécessite normalement 16 bits, l’approche des poids ternaires limite chaque valeur à +1, -1 ou 0. Cette réduction de granularité diminue la quantité d’informations à stocker par paramètre et réduit fortement l’espace occupé par le modèle.

Une jeune pousse issue du Caltech, épaulée par Ion Stoica et des investisseurs reconnus

PrismML a été fondée par des chercheurs du Caltech et est dirigée par Babak Hassibi, professeur à l’institut et spécialiste des technologies de compression. Ion Stoica, cofondateur de Databricks et directeur du Sky Computing Lab de Berkeley, fait partie des conseillers. Le Sky Computing Lab a contribué à plusieurs technologies et startups, dont Letta et SGLang. PrismML est soutenue par Khosla Ventures, Cerberus Capital et Caltech, et a levé 22,25 millions de dollars. L’entreprise défend l’idée qu’un LLM performant n’a pas besoin d’être massif et conçoit des modèles adaptés aux PC et aux smartphones. Des discussions avec Apple sont évoquées, mais Babak Hassibi a refusé de commenter ce point. Dans le domaine de la compression des LLM, Multiverse Computing opère également, fondée par un professeur du Donostia International Physics Center en Espagne, avec des levées de fonds importantes.

Prochain cap : des modèles à plusieurs centaines de milliards de paramètres

PrismML prévoit de lancer dans les prochains mois des modèles comptant plusieurs centaines de milliards de paramètres. Babak Hassibi anticipe qu’il sera plus facile d’y conserver l’intelligence, estimant que l’augmentation de la taille des modèles offre davantage de marge pour les compresser sans perte sensible de performance.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.