Brief IA : Cohere dévoile North Mini Code : une révolution pour les développeurs

Cohere dévoile North Mini Code : une révolution pour les développeurs

Brief IA
Tom Levy·4 min·18 vues

Cohere a lancé North Mini Code, un modèle d'intelligence artificielle de 30 milliards de paramètres, spécifiquement conçu pour les développeurs afin d'améliorer leur productivité dans l'intégration de l'IA. Ce modèle, qui obtient un score de 33,4 sur l'Index de Codage d'Artificial Analysis, surpasse plusieurs modèles concurrents, positionnant Cohere comme un acteur clé dans le marché des outils d'IA personnalisés.

En bref
1Cohere lance North Mini Code, un modèle de 30 milliards de paramètres, optimisé pour le codage agentique, disponible sous licence Apache 2.0.
2Le modèle surpasse des concurrents plus grands sur l'Index de Codage d'Artificial Analysis avec un score de 33,4.
3North Mini Code utilise une architecture Transformer avancée avec une attention efficace et un bloc MoE de 128 experts.
💡Pourquoi c'est importantNorth Mini Code pourrait transformer les pratiques de développement logiciel grâce à ses capacités avancées et sa robustesse en environnements variés.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Un modèle innovant pour les développeurs

Cohere a récemment introduit North Mini Code, un modèle de pointe conçu pour les développeurs. Ce modèle, qui comprend 30 milliards de paramètres, utilise une architecture Mixture-of-Experts avec 3 milliards de paramètres actifs. Il est désormais accessible sur la plateforme Hugging Face sous la licence Apache 2.0. North Mini Code est spécifiquement conçu pour répondre aux besoins des tâches d'ingénierie logicielle agentiques, offrant des capacités de codage avancées.

Ce modèle marque le début d'une nouvelle série de modèles développés par Cohere, visant à optimiser les flux de travail complexes en ingénierie logicielle. Il est particulièrement adapté aux tâches nécessitant une interaction avec le terminal et à la génération de code de haute qualité. Sur l'Index de Codage d'Artificial Analysis, North Mini Code obtient un impressionnant score de 33,4, surpassant des modèles tels que Qwen3.5 et Gemma 4, ainsi que des modèles beaucoup plus volumineux comme Nemotron 3 Super et Mistral Small 4.

Une qualité et une robustesse éprouvées

La qualité et la robustesse de North Mini Code sont essentielles pour les agents de codage qui opèrent dans des environnements variés. Cohere a entraîné ce modèle en utilisant plusieurs structures, ce qui le rend particulièrement fiable pour des agents de codage comme OpenCode. North Mini Code repose sur une architecture de Transformer avec un décodeur, intégrant une attention efficace qui combine l'attention par fenêtre glissante avec RoPE et une attention globale sans embeddings positionnels, dans un rapport de 3:1.

Le modèle utilise un bloc de feed-forward MoE avec 128 experts, dont 8 sont activés par token. Chaque expert est structuré en bloc FFN avec activation SwiGLU. Un routeur applique une fonction d'activation sigmoïde aux logits avant la sélection top-k, et une couche dense unique précède les couches éparses.

Un entraînement post-formation rigoureux

Pour atteindre une excellence en codage, North Mini Code a subi un processus de supervised fine-tuning (SFT) en deux étapes, suivi d'un apprentissage par renforcement avec des récompenses vérifiables (RLVR). La première étape de SFT se concentre sur l'intégration des capacités de codage dans un mélange plus large pour garantir robustesse et utilisabilité. Les données utilisées comprennent 70% de tokens entraînables, 43% de données d'utilisation d'outils agentiques, et 27% de données de programmation compétitive ou scientifique.

La seconde étape de SFT utilise un mélange de 4,5 milliards de tokens provenant d'échantillons axés sur le raisonnement, avec 61% de tokens de code. Le pipeline de données de Cohere s'appuie sur des environnements de codage agentiques conteneurisés, utilisant plus de 70 000 tâches vérifiables issues de 5 000 dépôts uniques. Les longueurs de contexte de 64K et 128K sont utilisées respectivement pour les premières et secondes étapes de SFT, permettant un entraînement en cascade « long-à-long ».

Adaptabilité dans divers environnements

La capacité de North Mini Code à s'adapter à différents environnements améliore son efficacité dans des contextes de développement logiciel variés. Cohere a introduit une petite quantité de données supplémentaires de banc d'essai (6% du mélange SFT) lors de la seconde étape de SFT, ce qui a permis d'améliorer de 10% les performances avec l'environnement OpenCode tout en maintenant la compatibilité avec SWE-Agent sur SWE-Bench Verified.

L'entraînement sur des données d'environnements hybrides a révélé un minimum de conflit de données, suggérant que les compétences requises par différents environnements sont complémentaires.

Apprentissage par renforcement asynchrone

Les déploiements d'agents de codage nécessitent souvent des durées variées, rendant un apprentissage synchrone inefficace. Cohere a donc opté pour un apprentissage par renforcement asynchrone, utilisant un formateur en parallèle avec un vLLM pour des déploiements continus. Le modèle utilise CISPO, un objectif de log-vraisemblance avec correction d'échantillonnage d'importance au niveau des tokens.

Cohere a mis en place un entraînement en ligne multi-environnements sur deux types de tâches : celles basées sur terminal et celles d'ingénierie logicielle. Chaque lot d'entraînement comprend 512 déploiements, avec 8 déploiements échantillonnés par prompt.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires