Brief IA : Moonshot accusé de copier Fable pour Kimi K3

Moonshot accusé de copier Fable pour Kimi K3

Brief IA
Tom Levy·5 min·1 vues

Michael Kratsios, conseiller scientifique de la Maison Blanche, accuse Moonshot d'avoir copié le modèle Fable d'Anthropic pour développer Kimi K3, en utilisant des puces interdites à l'exportation vers la Chine. Cette affaire soulève des préoccupations sur la sécurité technologique et la concurrence internationale dans le domaine de l'IA, notamment en raison des accusations d'extraction de capacités par plusieurs entreprises, dont Moonshot.

En bref
1Michael Kratsios accuse Moonshot d'avoir copié le modèle Fable d'Anthropic pour développer Kimi K3, en utilisant des puces interdites à l'exportation vers la Chine.
2Les experts doutent que la distillation soit responsable des performances de Kimi K3, soulignant le rôle de l'apprentissage par renforcement.
3Anthropic a accusé plusieurs entreprises, dont Moonshot, d'avoir extrait ses capacités via des millions d'échanges suspects.
💡Pourquoi c'est importantCette affaire soulève des questions sur la sécurité technologique et la concurrence internationale dans le domaine de l'IA.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Moonshot accusé de copier Fable d'Anthropic

Michael Kratsios, conseiller scientifique de la Maison Blanche, a récemment pointé du doigt Moonshot, une entreprise chinoise, pour avoir prétendument copié le modèle de langage Fable d'Anthropic. Selon lui, Moonshot aurait utilisé des puces interdites à l'exportation vers la Chine pour développer Kimi K3, le plus grand modèle de langage à poids ouvert disponible. Kratsios a qualifié cette pratique de "distillation industrielle à grande échelle" visant à voler la technologie américaine et à saper la recherche nationale. Cependant, il n'a pas fourni de détails supplémentaires sur les sources de ses accusations, et Moonshot n'a pas répondu aux questions concernant son processus d'entraînement.

Des accusations qui résonnent dans le secteur

Le tweet de Kratsios a trouvé un écho auprès de Scott Bessent, secrétaire au Trésor, qui a également exprimé son inquiétude face à la présence de "filigranes" de modèles américains sur des modèles chinois. Toutefois, le département du Trésor n'a pas clarifié ce que ces filigranes impliquent. Cette situation a provoqué des discussions sur l'interdiction potentielle des modèles à poids ouvert chinois, secouant ainsi le secteur de l'intelligence artificielle.

Scepticisme des experts sur la distillation

Malgré ces accusations, certains experts restent sceptiques quant à l'idée que la distillation soit à l'origine des performances avancées de Kimi K3. Braden Hancock, chercheur à l'Institut Laude et co-fondateur de Snorkel AI, a exprimé ses doutes sur la possibilité de créer un modèle aussi puissant en si peu de temps après la sortie publique de Fable. Selon lui, la distillation stricte ne permettrait pas d'atteindre un tel niveau de performance en seulement deux semaines. Fable n'est disponible publiquement que depuis le 1er juillet, ce qui rend cette hypothèse peu probable.

Le rôle de l'apprentissage par renforcement

Nathan Lambert, chercheur en IA à l'Allen Institute for AI, a également partagé son point de vue sur la question. Dans un podcast, il a expliqué que la distillation perd de son impact à mesure que les modèles chinois se rapprochent de la frontière technologique et que l'entraînement évolue vers l'apprentissage par renforcement. Selon lui, si la distillation était suffisante, d'autres modèles comme GLM ou K3 auraient déjà été rattrapés par des concurrents utilisant cette méthode.

Les défis de la distillation et de l'ajustement fin

La distillation implique souvent de questionner un modèle cible pour générer des données d'entraînement. Ce processus peut inclure des demandes explicites au modèle pour qu'il explique sa chaîne de pensée. Les réponses obtenues sont ensuite utilisées pour entraîner un nouveau modèle via un ajustement fin supervisé (SFT). Cependant, Lambert souligne que le SFT devient moins efficace à mesure que les modèles se complexifient, nécessitant des techniques avancées comme l'apprentissage par renforcement.

Infrastructure et coût de l'apprentissage par renforcement

L'apprentissage par renforcement nécessite une infrastructure significative, souvent des dizaines de millions d'agents pour évaluer et ajuster les réponses des modèles. Utiliser l'API d'un laboratoire de pointe pour ce type d'entraînement serait extrêmement coûteux et pourrait constituer un goulot d'étranglement temporel. De plus, il n'est pas garanti que cela améliore les performances du modèle.

Accusations d'Anthropic contre Moonshot

Anthropic a précédemment accusé Moonshot, ainsi que d'autres entreprises comme DeepSeek et MiniMax, d'avoir distillé ses modèles. Selon Anthropic, des millions d'échanges entre ses modèles et des utilisateurs identifiés chez ces entreprises ont été détectés, reflétant une extraction délibérée de capacités plutôt qu'une utilisation légitime. Ces échanges ont été identifiés via des adresses IP et d'autres métadonnées.

La distillation, une pratique courante

La distillation n'est pas une pratique isolée à la Chine. Elon Musk a témoigné que sa société SpaceXAI avait distillé les modèles d'OpenAI pour développer Grok, soulignant que cette pratique est courante dans l'industrie. La frontière entre la distillation et le développement de jeux de données synthétiques est souvent floue.

Sous-estimation de l'expertise chinoise

Braden Hancock a critiqué la tendance à sous-estimer l'expertise technique des équipes chinoises. Il a rappelé que l'un des fondateurs de Moonshot était un étudiant en doctorat à l'Université Carnegie Mellon, soulignant que ces chercheurs et ingénieurs sont légitimes et compétents. Selon lui, même si les modèles américains s'arrêtaient, les progrès chinois continueraient.

L'accès controversé aux puces Nvidia

Les accusations de Kratsios incluent également l'accès de Moonshot à des puces Nvidia avancées, les Grace Blackwell 300, et à des serveurs équipés de GB300 en Thaïlande. Ces puces sont interdites à l'exportation vers la Chine, mais un marché noir existe. Sam Bresnick, chercheur au Georgetown Center for Security and Emerging Technology, a souligné l'importance de lois sur la connaissance de votre client pour les centres de données. En mai, le fondateur de Supermicro, un constructeur de serveurs américain, a été inculpé pour avoir introduit des puces avancées en Chine.

Vers une régulation plus stricte

Le département du Commerce sous la présidence de Joe Biden a proposé des règles fédérales pour 2024 concernant la connaissance de votre client dans les centres de données. Cependant, aucun progrès significatif n'a été réalisé sous Donald Trump. Les exportateurs de puces avancées doivent s'assurer qu'elles ne sont utilisées que pour des fins approuvées, mais la mise en œuvre de ces mesures reste un défi.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires