Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Avec Bonsai 2 27B, PrismML propose une version compressée du modèle Qwen3.8 27B ramenée à 5,9 Go. La startup californienne revendique 98 % des scores de référence de l’original et prépare déjà des versions de plusieurs centaines de milliards de paramètres.
Sur l’appareil, gratuit et privé selon Ion Stoica, mais la parité totale reste incertaine
Pour Ion Stoica, conseiller de PrismML, la technologie permet d'exécuter des modèles avancés directement sur les appareils des utilisateurs. Il estime que l'intelligence sera accessible sans coût supplémentaire, car elle fonctionnera sur l'appareil déjà acquis, et que la confidentialité sera préservée puisque les données ne seront pas envoyées dans le cloud. Babak Hassibi, PDG de PrismML, indique que la compression aura probablement toujours un effet sur la performance et que la parité à 100 % reste incertaine. Il considère cependant qu'atteindre 100 % devient plus accessible avec des modèles plus grands.
Bonsai 2 27B réduit Qwen3.8 27B à 5,9 Go, avec 98 % des benchmarks
PrismML a lancé Bonsai 2 27B, qui compresse le modèle open source Qwen3.8 27B d’Alibaba à une taille de 5,9 Go. Cette réduction représente un facteur de 9 à 10 sur la mémoire par rapport à l’original et permet au modèle de tenir sur un PC, avec une utilisation sur smartphone haut de gamme envisagée. Bonsai 2 atteint 98 % des scores de référence agrégés de Qwen. Le premier Bonsai, lancé en mars, égalait 95 % et, selon PrismML, a été téléchargé plus de 11 millions de fois, tandis que des modèles encore plus petits totalisent 2,6 millions de téléchargements supplémentaires.
Compression par poids ternaires : de 16 bits à +1, -1, 0
La méthode de PrismML consiste à réduire la taille des modèles en agissant sur les poids du réseau, qui représentent les informations apprises lors de l’entraînement. Alors qu’un poids nécessite normalement 16 bits, l’approche des poids ternaires limite chaque valeur à +1, -1 ou 0. Cette réduction de granularité diminue la quantité d’informations à stocker par paramètre et réduit fortement l’espace occupé par le modèle.
Une jeune pousse issue du Caltech, épaulée par Ion Stoica et des investisseurs reconnus
PrismML a été fondée par des chercheurs du Caltech et est dirigée par Babak Hassibi, professeur à l’institut et spécialiste des technologies de compression. Ion Stoica, cofondateur de Databricks et directeur du Sky Computing Lab de Berkeley, fait partie des conseillers. Le Sky Computing Lab a contribué à plusieurs technologies et startups, dont Letta et SGLang. PrismML est soutenue par Khosla Ventures, Cerberus Capital et Caltech, et a levé 22,25 millions de dollars. L’entreprise défend l’idée qu’un LLM performant n’a pas besoin d’être massif et conçoit des modèles adaptés aux PC et aux smartphones. Des discussions avec Apple sont évoquées, mais Babak Hassibi a refusé de commenter ce point. Dans le domaine de la compression des LLM, Multiverse Computing opère également, fondée par un professeur du Donostia International Physics Center en Espagne, avec des levées de fonds importantes.
Prochain cap : des modèles à plusieurs centaines de milliards de paramètres
PrismML prévoit de lancer dans les prochains mois des modèles comptant plusieurs centaines de milliards de paramètres. Babak Hassibi anticipe qu’il sera plus facile d’y conserver l’intelligence, estimant que l’augmentation de la taille des modèles offre davantage de marge pour les compresser sans perte sensible de performance.






