Moonshot accusé de copier Fable pour Kimi K3

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Moonshot accusé de copier Fable d'Anthropic
Michael Kratsios, conseiller scientifique de la Maison Blanche, a récemment pointé du doigt Moonshot, une entreprise chinoise, pour avoir prétendument copié le modèle de langage Fable d'Anthropic. Selon lui, Moonshot aurait utilisé des puces interdites à l'exportation vers la Chine pour développer Kimi K3, le plus grand modèle de langage à poids ouvert disponible. Kratsios a qualifié cette pratique de "distillation industrielle à grande échelle" visant à voler la technologie américaine et à saper la recherche nationale. Cependant, il n'a pas fourni de détails supplémentaires sur les sources de ses accusations, et Moonshot n'a pas répondu aux questions concernant son processus d'entraînement.
Des accusations qui résonnent dans le secteur
Le tweet de Kratsios a trouvé un écho auprès de Scott Bessent, secrétaire au Trésor, qui a également exprimé son inquiétude face à la présence de "filigranes" de modèles américains sur des modèles chinois. Toutefois, le département du Trésor n'a pas clarifié ce que ces filigranes impliquent. Cette situation a provoqué des discussions sur l'interdiction potentielle des modèles à poids ouvert chinois, secouant ainsi le secteur de l'intelligence artificielle.
Scepticisme des experts sur la distillation
Malgré ces accusations, certains experts restent sceptiques quant à l'idée que la distillation soit à l'origine des performances avancées de Kimi K3. Braden Hancock, chercheur à l'Institut Laude et co-fondateur de Snorkel AI, a exprimé ses doutes sur la possibilité de créer un modèle aussi puissant en si peu de temps après la sortie publique de Fable. Selon lui, la distillation stricte ne permettrait pas d'atteindre un tel niveau de performance en seulement deux semaines. Fable n'est disponible publiquement que depuis le 1er juillet, ce qui rend cette hypothèse peu probable.
Le rôle de l'apprentissage par renforcement
Nathan Lambert, chercheur en IA à l'Allen Institute for AI, a également partagé son point de vue sur la question. Dans un podcast, il a expliqué que la distillation perd de son impact à mesure que les modèles chinois se rapprochent de la frontière technologique et que l'entraînement évolue vers l'apprentissage par renforcement. Selon lui, si la distillation était suffisante, d'autres modèles comme GLM ou K3 auraient déjà été rattrapés par des concurrents utilisant cette méthode.
Les défis de la distillation et de l'ajustement fin
La distillation implique souvent de questionner un modèle cible pour générer des données d'entraînement. Ce processus peut inclure des demandes explicites au modèle pour qu'il explique sa chaîne de pensée. Les réponses obtenues sont ensuite utilisées pour entraîner un nouveau modèle via un ajustement fin supervisé (SFT). Cependant, Lambert souligne que le SFT devient moins efficace à mesure que les modèles se complexifient, nécessitant des techniques avancées comme l'apprentissage par renforcement.
Infrastructure et coût de l'apprentissage par renforcement
L'apprentissage par renforcement nécessite une infrastructure significative, souvent des dizaines de millions d'agents pour évaluer et ajuster les réponses des modèles. Utiliser l'API d'un laboratoire de pointe pour ce type d'entraînement serait extrêmement coûteux et pourrait constituer un goulot d'étranglement temporel. De plus, il n'est pas garanti que cela améliore les performances du modèle.
Accusations d'Anthropic contre Moonshot
Anthropic a précédemment accusé Moonshot, ainsi que d'autres entreprises comme DeepSeek et MiniMax, d'avoir distillé ses modèles. Selon Anthropic, des millions d'échanges entre ses modèles et des utilisateurs identifiés chez ces entreprises ont été détectés, reflétant une extraction délibérée de capacités plutôt qu'une utilisation légitime. Ces échanges ont été identifiés via des adresses IP et d'autres métadonnées.
La distillation, une pratique courante
La distillation n'est pas une pratique isolée à la Chine. Elon Musk a témoigné que sa société SpaceXAI avait distillé les modèles d'OpenAI pour développer Grok, soulignant que cette pratique est courante dans l'industrie. La frontière entre la distillation et le développement de jeux de données synthétiques est souvent floue.
Sous-estimation de l'expertise chinoise
Braden Hancock a critiqué la tendance à sous-estimer l'expertise technique des équipes chinoises. Il a rappelé que l'un des fondateurs de Moonshot était un étudiant en doctorat à l'Université Carnegie Mellon, soulignant que ces chercheurs et ingénieurs sont légitimes et compétents. Selon lui, même si les modèles américains s'arrêtaient, les progrès chinois continueraient.
L'accès controversé aux puces Nvidia
Les accusations de Kratsios incluent également l'accès de Moonshot à des puces Nvidia avancées, les Grace Blackwell 300, et à des serveurs équipés de GB300 en Thaïlande. Ces puces sont interdites à l'exportation vers la Chine, mais un marché noir existe. Sam Bresnick, chercheur au Georgetown Center for Security and Emerging Technology, a souligné l'importance de lois sur la connaissance de votre client pour les centres de données. En mai, le fondateur de Supermicro, un constructeur de serveurs américain, a été inculpé pour avoir introduit des puces avancées en Chine.
Vers une régulation plus stricte
Le département du Commerce sous la présidence de Joe Biden a proposé des règles fédérales pour 2024 concernant la connaissance de votre client dans les centres de données. Cependant, aucun progrès significatif n'a été réalisé sous Donald Trump. Les exportateurs de puces avancées doivent s'assurer qu'elles ne sont utilisées que pour des fins approuvées, mais la mise en œuvre de ces mesures reste un défi.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.