⚡
Brief IA
›

DSpark accélère LFM2.5-VL-3B jusqu’à 3,13x au décodage

🔬 Research·Tom Levy·

DSpark accélère LFM2.5-VL-3B jusqu’à 3,13x au décodage

DSpark accélère LFM2.5-VL-3B jusqu’à 3,13x au décodage
⚡
Key Takeaways
1Liquid AI publie un drafter DSpark pour LFM2.5-VL-3B
2Jusqu’à 3,13x d’accélération du décodage sur Apple Silicon, 2,66x sur H100
3Les gains de latence globale atteignent 2,62x sur appareil, 2,27x sur H100
4Surcoût mémoire limité à 280M de paramètres (8,9%), intégrations prêtes pour llama.cpp, MLX-VLM et SGLang
💡Why it matters — Le décodage spéculatif DSpark permet d’accélérer les modèles vision-langage sur divers matériels, mais l’amélioration globale dépend fortement du poids du pré-remplissage et de l’encodage visuel.
⚡Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Liquid AI propose un drafter DSpark pour son modèle vision-langage LFM2.5-VL-3B. Les mesures internes annoncent des accélérations de décodage sur Apple Silicon et H100, pour un ajout d’environ 280M de paramètres. Les gains de latence globale restent toutefois encadrés par le poids du pré-remplissage et de l’encodage visuel.

Le pré-remplissage limite les gains de bout en bout, selon Liquid AI

Le pré-remplissage dans les modèles de langage est principalement lié au calcul, avec un coût qui augmente de façon (sous) quadratique selon la longueur du prompt. Dans les modèles vision-langage, un encodeur de vision intervient avant que le backbone linguistique ne traite des centaines de tokens visuels en plus du texte. Les mesures réalisées sur puces Apple et H100 montrent que cette phase occupe une part importante de la latence totale, surtout sur des appareils Edge moins puissants que les GPU de datacenter. Les accélérateurs neuronaux par cœur du M5 contribuent à réduire cet écart. Le décodage spéculatif accélère uniquement la phase de décodage, sans effet sur l’encodage de vision ni le pré-remplissage ; lorsque ces étapes dominent déjà la latence, même une forte accélération du décodage n’apporte qu’un gain global modéré. Ce phénomène s’explique par la loi d’Amdahl. Dans ce contexte, Liquid AI rapporte des gains de latence bout en bout allant jusqu’à 2,62x sur appareil et 2,27x sur H100.

Accélérations mesurées sur Apple Silicon et H100

Les évaluations utilisent une taille de bloc DSpark de 8 et couvrent six tâches de vision selon le benchmark MMSpec. Sur un M5 Max avec MLX, le décodage s’accélère de 2,30x à 3,13x selon la tâche, pour une latence globale améliorée de 1,56x à 2,62x. Sur un M3 Ultra avec llama.cpp, le décodage gagne de 1,57x à 2,14x et le bout en bout de 1,30x à 1,77x. Sur GPU H100, le drafter affiche des accélérations de décodage allant de 20,4x à 2,66x, avec des gains globaux de 1,64x à 2,27x.

Un surcoût mémoire d’environ 8,9% pour le drafter

Le drafter ajoute environ 280M de paramètres, soit 8,9% de plus par rapport à un modèle cible de 3 milliards de paramètres. Selon Liquid AI, cette augmentation de taille reste limitée tout en permettant les accélérations observées.

Disponibilité immédiate dans llama.cpp, MLX-VLM et SGLang

L’intégration DSpark pour LFM est disponible dès le premier jour dans llama.cpp, MLX-VLM et SGLang. Le modèle de draft de vision est proposé sur Hugging Face en formats Safetensors et GGUF. Liquid AI présente la gamme LFM2.5 comme des poids ouverts, téléchargeables, ajustables et déployables sans restriction, avec un support initial pour ces frameworks et une famille qui s’étend des modèles de base aux variantes audio et vision.

Architecture et entraînement du drafter DSpark

Le drafter de vision reprend l’approche DSpark appliquée au texte : il capture les états cachés du modèle cible à des couches fixes et s’y conditionne pour générer des blocs de tokens. Les patches d’image et les tokens textuels sont projetés dans une représentation commune en amont, ce qui permet d’opérer sur des vecteurs d’état de même dimension, quelle que soit la modalité, sans modifier l’algorithme d’inférence. L’entraînement suit un mélange SFT vision-langage pondéré selon les usages attendus, avec des ablations sur 3, 4 et 5 couches. Le modèle retenu est attention-only avec 4 couches et une taille de bloc de 9, entraîné sur 10 époques ; le taux d’acceptation a progressé avec davantage de tokens avant de plafonner. À l’inférence, une taille de bloc de 8 ou 9 est recommandée selon le matériel.

Mise en route: versions requises et commandes d’exemple

SGLang nécessite une version incluant le support DSpark pour les cibles LFM (PR #40651). Une commande d’exemple attache un drafter, active l’algorithme DSPARK, sélectionne flashinfer pour l’attention et fixe un block size de 9. L’API se consulte via un endpoint compatible OpenAI à http://localhost:30000/v1, la taille de bloc étant lue depuis le fichier de configuration du draft ; la ligne de base consiste à retirer les drapeaux spéculatifs. Pour llama.cpp, une version incluant PR#29339 est requise, avec un exemple utilisant un modèle cible LFM2.5-VL-3B-F16.gguf, un mmproj et un draft LFM2.5-2.6B-DSpark-F16.gguf, avec n-max 8. MLX-VLM nécessite une version incluant PR#2280 et se lance avec un modèle LFM2.5-VL-3B et son draft associé ; le n-max est borné par les métadonnées sidecar. Le décodage spéculatif est exact, le modèle cible validant chaque token proposé ; les temps par réponse exposent le ratio draft_n sur draft_n_accepted.

⚡

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.