Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Deepseek DSpark booste l'IA de 85 %, défiant les restrictions US
Deepseek a lancé DSpark, une nouvelle méthode qui augmente la vitesse de réponse par utilisateur pour ses modèles d'IA de 60 à 85 %, selon l'entreprise.
La plupart des LLM (modèles de langage de grande taille) génèrent du texte un mot à la fois. Cela entraîne une faible utilisation des GPU et de longs temps d'attente pour des réponses longues, explique Deepseek. Son nouveau cadre, DSpark, utilise le décodage spéculatif, où un petit modèle léger propose des candidats de réponse que le modèle plus grand vérifie ensuite par lots. Il génère également de petits groupes de mots au lieu de jetons uniques, augmentant ainsi l'efficacité globale. Un système basé sur la confiance ajuste la profondeur de vérification en temps réel en fonction de la charge de calcul, réduisant le traitement inutile des propositions de jetons rejetées.
Deepseek a également testé DSpark avec des modèles ouverts de Google DeepMind (Gemma) et Alibaba (Qwen), suggérant que l'approche fonctionne de manière générale. Le cadre et le modèle Deepseek-V4-Pro, développés conjointement avec l'Université de Pékin, sont disponibles sur Hugging Face et GitHub sous la licence MIT. Les détails techniques se trouvent dans l'article.
Le rédacteur DSpark atteint la plus haute efficacité de génération de texte, surpassant des alternatives comme Eagle3 et DFlash dans toutes les catégories de test, y compris les modèles Qwen et Gemma.
Moins de pression sur les puces ou une mise à l'échelle plus rapide
Cette sortie est stratégiquement importante pour la Chine. Une inférence plus rapide réduit les besoins en puces et diminue les coûts d'infrastructure. C'est une bonne nouvelle pour la Chine et potentiellement pour l'UE, qui sont toutes deux à la traîne par rapport aux États-Unis en matière de construction de centres de données et de puces haute performance.
Cependant, le paradoxe de Jevons pourrait entrer en jeu. Une inférence plus efficace réduit la demande de puces par requête. Pourtant, la capacité de calcul libérée sera probablement immédiatement absorbée par davantage de demandes d'IA, des contextes plus longs ou de nouvelles applications. La demande totale de puces pourrait rester stable, voire augmenter. Deepseek lui-même affirme que DSpark "permet des niveaux de performance qui étaient auparavant inaccessibles, déplaçant la frontière de Pareto de notre système de service."
Néanmoins, à court terme, ces gains d'efficacité aident la Chine et l'UE. Elles peuvent tirer davantage de performances d'IA avec moins de puces haut de gamme. Étant donné l'offre de puces serrée et les restrictions à l'exportation des États-Unis, cela constitue un avantage stratégique, réduisant la capacité des États-Unis à utiliser les puces comme levier géopolitique.


