La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un modèle innovant pour les développeurs
Cohere a récemment introduit North Mini Code, un modèle de pointe conçu pour les développeurs. Ce modèle, qui comprend 30 milliards de paramètres, utilise une architecture Mixture-of-Experts avec 3 milliards de paramètres actifs. Il est désormais accessible sur la plateforme Hugging Face sous la licence Apache 2.0. North Mini Code est spécifiquement conçu pour répondre aux besoins des tâches d'ingénierie logicielle agentiques, offrant des capacités de codage avancées.
Ce modèle marque le début d'une nouvelle série de modèles développés par Cohere, visant à optimiser les flux de travail complexes en ingénierie logicielle. Il est particulièrement adapté aux tâches nécessitant une interaction avec le terminal et à la génération de code de haute qualité. Sur l'Index de Codage d'Artificial Analysis, North Mini Code obtient un impressionnant score de 33,4, surpassant des modèles tels que Qwen3.5 et Gemma 4, ainsi que des modèles beaucoup plus volumineux comme Nemotron 3 Super et Mistral Small 4.
Une qualité et une robustesse éprouvées
La qualité et la robustesse de North Mini Code sont essentielles pour les agents de codage qui opèrent dans des environnements variés. Cohere a entraîné ce modèle en utilisant plusieurs structures, ce qui le rend particulièrement fiable pour des agents de codage comme OpenCode. North Mini Code repose sur une architecture de Transformer avec un décodeur, intégrant une attention efficace qui combine l'attention par fenêtre glissante avec RoPE et une attention globale sans embeddings positionnels, dans un rapport de 3:1.
Le modèle utilise un bloc de feed-forward MoE avec 128 experts, dont 8 sont activés par token. Chaque expert est structuré en bloc FFN avec activation SwiGLU. Un routeur applique une fonction d'activation sigmoïde aux logits avant la sélection top-k, et une couche dense unique précède les couches éparses.
Un entraînement post-formation rigoureux
Pour atteindre une excellence en codage, North Mini Code a subi un processus de supervised fine-tuning (SFT) en deux étapes, suivi d'un apprentissage par renforcement avec des récompenses vérifiables (RLVR). La première étape de SFT se concentre sur l'intégration des capacités de codage dans un mélange plus large pour garantir robustesse et utilisabilité. Les données utilisées comprennent 70% de tokens entraînables, 43% de données d'utilisation d'outils agentiques, et 27% de données de programmation compétitive ou scientifique.
La seconde étape de SFT utilise un mélange de 4,5 milliards de tokens provenant d'échantillons axés sur le raisonnement, avec 61% de tokens de code. Le pipeline de données de Cohere s'appuie sur des environnements de codage agentiques conteneurisés, utilisant plus de 70 000 tâches vérifiables issues de 5 000 dépôts uniques. Les longueurs de contexte de 64K et 128K sont utilisées respectivement pour les premières et secondes étapes de SFT, permettant un entraînement en cascade « long-à-long ».
Adaptabilité dans divers environnements
La capacité de North Mini Code à s'adapter à différents environnements améliore son efficacité dans des contextes de développement logiciel variés. Cohere a introduit une petite quantité de données supplémentaires de banc d'essai (6% du mélange SFT) lors de la seconde étape de SFT, ce qui a permis d'améliorer de 10% les performances avec l'environnement OpenCode tout en maintenant la compatibilité avec SWE-Agent sur SWE-Bench Verified.
L'entraînement sur des données d'environnements hybrides a révélé un minimum de conflit de données, suggérant que les compétences requises par différents environnements sont complémentaires.
Apprentissage par renforcement asynchrone
Les déploiements d'agents de codage nécessitent souvent des durées variées, rendant un apprentissage synchrone inefficace. Cohere a donc opté pour un apprentissage par renforcement asynchrone, utilisant un formateur en parallèle avec un vLLM pour des déploiements continus. Le modèle utilise CISPO, un objectif de log-vraisemblance avec correction d'échantillonnage d'importance au niveau des tokens.
Cohere a mis en place un entraînement en ligne multi-environnements sur deux types de tâches : celles basées sur terminal et celles d'ingénierie logicielle. Chaque lot d'entraînement comprend 512 déploiements, avec 8 déploiements échantillonnés par prompt.





