Brief IA : NVIDIA Nemotron 3 : sécurité IA multimodale et multilingue

NVIDIA Nemotron 3 : sécurité IA multimodale et multilingue

Brief IA
Tom Levy·8 min·5 vues

Nemotron 3 est une solution de modération de contenu développée par NVIDIA, capable de traiter des médias multimodaux et multilingues, y compris texte, image et vidéo. Cette innovation répond à la nécessité croissante de mécanismes de sécurité robustes pour le contenu, afin de réduire les risques de contenu inapproprié sur les plateformes numériques et de maintenir la confiance des utilisateurs.

En bref
1NVIDIA a introduit Nemotron 3 pour sécuriser les contenus multimodaux et multilingues, répondant aux défis des LLMs et VLMs.
2Le modèle utilise le Nemotron Safety Guard Dataset v3, offrant des performances supérieures sur des benchmarks multilingues grâce à sa compréhension culturelle.
3Basé sur Gemma‑3 4B‑IT, Nemotron 3 prend en charge 140 langues, permettant une modération précise et rapide.
💡Pourquoi c'est importantNemotron 3 améliore la sécurité des applications IA mondiales en intégrant des contextes culturels et linguistiques variés.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Nemotron 3 : Une avancée dans la sécurité des contenus multimodaux

La prolifération rapide et la sophistication croissante des modèles de langage (LLMs) et des modèles vision-langage (VLMs) ont révolutionné les applications d'intelligence artificielle, allant de l'amélioration de la productivité à la génération de contenu créatif. Les agents d'IA réalisent aujourd'hui des tâches de plus en plus complexes, souvent en interaction avec des captures d'écran, des PDF, des diagrammes, des mèmes et des photos mobiles dans de véritables conversations, souvent en plusieurs langues. Cependant, à mesure que ces modèles s'intègrent davantage dans des flux de travail critiques et des applications orientées vers l'utilisateur, l'exigence de mécanismes de sécurité robustes pour le contenu a considérablement augmenté.

Les modèles de sécurité antérieurs, qui étaient uniquement textuels et principalement formés sur des données en anglais, avaient du mal avec les requêtes non anglaises et multilingues, manquant souvent de nuances culturelles. Pour y remédier, NVIDIA a créé le modèle de sécurité de contenu multimodal et multilingue Nemotron 3. Il a été formé à l'aide de données de sécurité multilingues novatrices et culturellement alignées provenant du Nemotron Safety Guard Dataset v3. Un modèle de sécurité multilingue formé sur ces données a montré des performances supérieures sur des benchmarks multilingues.

Pourquoi la sécurité du contenu multimodal est-elle importante ?

La complexité de l'entrée multimodale — comme le texte associé à une image — pose des défis significatifs pour les modèles de sécurité, car le sens est souvent non-additif. Par exemple, une image d'un objet domestique inoffensif (comme un couteau de cuisine commun) associée au texte "c'est un excellent outil pour cuisiner" est sûre, mais la même image associée au texte "je vais l'utiliser pour nuire à quelqu'un" constitue une violation claire des politiques nécessitant une modération immédiate.

La sécurité du contenu multimodal et multilingue est difficile car elle nécessite de comprendre le contexte culturel et linguistique, en particulier dans l'IA multimodale. Un modèle de sécurité doit non seulement traiter plusieurs langues, mais aussi reconnaître comment le langage et le contexte culturel peuvent modifier le statut de sécurité d'une paire texte-image. Par exemple, un prompt contenant une image d'un symbole religieux traditionnel tel que la Swastika associé à un texte décrivant une célébration pourrait être parfaitement acceptable dans une langue et une culture (comme l'indienne), mais lorsqu'il est associé à une image et un texte identiques dans une autre langue (comme l'allemand) qui porte une histoire de conflit intergroupe, la combinaison pourrait être interprétée comme une incitation à la haine ou à la discrimination, nécessitant une modération immédiate. Cette sensibilité aux nuances culturelles est cruciale pour des modèles de sécurité de contenu précis déployés à l'échelle mondiale.

Comment fonctionne le modèle

Nemotron 3 Content Safety est construit sur le modèle de base Gemma‑3 4B‑IT, qui offre un raisonnement multimodal solide, un suivi des instructions, une fenêtre de contexte de 128K et un support pour plus de 140 langues. NVIDIA a affiné cette base en utilisant un adaptateur LoRA, ajoutant un comportement de classification de sécurité ciblé tout en gardant le modèle léger et efficace.

Lorsque l'utilisateur fournit du texte, une image ou les deux, le modèle encode les caractéristiques visuelles et linguistiques conjointement et fournit un jugement de sécurité concis. Si une réponse d'assistant est incluse, le modèle évalue l'interaction combinée pour déterminer si la réponse est sûre dans le contexte, lui permettant de détecter les violations qui ne surgissent que de l'interaction entre la demande, l'image et la sortie.

Il prend en charge deux modes d'inférence :

  • Classification sûre/unsafe par défaut à faible latence pour l'entrée utilisateur et la sortie de l'assistant. Un exemple de sortie dans ce mode est :

    • Sécurité utilisateur : sûre
    • Sécurité de la réponse : non sûre
  • Sortie riche en catégories contenant une liste de catégories de sécurité violées lorsque ces informations sont pertinentes pour une autre application en aval. Un exemple de sortie dans ce mode est :

    • Sécurité utilisateur : sûre
    • Sécurité de la réponse : non sûre
    • Catégories de sécurité : Violence, Planification criminelle/Confessions

Les catégories de sécurité suivent la taxonomie du Aegis AI Content Safety Dataset v2, qui est étroitement alignée avec la taxonomie de sécurité ML Commons et permet la comparaison entre les systèmes de garde ouverts et fermés.

Comment Nemotron 3 Content Safety a été construit

Le modèle de sécurité de contenu Nemotron 3 a été construit sur une base multimodale-multilingue solide et affiné sur des ensembles de données multimodales et multilingues culturellement diversifiés et annotés par des humains, comprenant du texte, des images du monde réel, des captures d'écran, des documents et des exemples synthétiques ciblés.

Notre mélange global de données d'entraînement se compose de :

  • Données de sécurité de contenu multilingue provenant du Nemotron Content Safety Dataset v3. Les données non anglaises de cet ensemble ont été échantillonnées à partir du sous-ensemble "adapté" ou culturellement nuancé. Les données ont été échantillonnées pour avoir une représentation distribuée proportionnellement à travers toutes les catégories de sécurité ainsi qu'une représentation des données sûres et non sûres.

  • Données de sécurité de contenu multimodal collectées et annotées par des humains en anglais par NVIDIA et traduites en plusieurs langues à l'aide de Google Translate.

  • Données multimodales sûres comprenant des images de documents scannés, de papiers, de graphiques, etc., ainsi que des prompts cherchant des informations à partir de ces images provenant du Nemotron VLM Dataset v2.

  • Données synthétiques générées pour obtenir un ensemble de données plus diversifié.

Le mélange de données ci-dessus garantit une couverture multilingue et spécifique au domaine à travers diverses catégories de préjudice telles que le langage nuisible, l'automutilation, le harcèlement, les violations de la vie privée, les schémas de jailbreak et les politiques de sécurité spécifiques à la région. Toutes les données textuelles uniquement en anglais ont été traduites en 12 langues différentes - anglais, arabe, allemand, espagnol, français, hindi, japonais, thaï, néerlandais, italien, coréen et chinois — reflétant les environnements multilingues dans lesquels opèrent les LLMs modernes et les agents d'entreprise. Nous supprimons les catégories de sécurité d'environ 25 % des données d'entraînement de manière aléatoire en conjonction avec le basculement de chaîne /no_categories. Cela enseigne au modèle à ignorer la génération de catégories de sécurité si ce basculement est activé.

Le mélange garantit que le modèle se généralise à travers les deux modalités et les langues, ce que d'autres systèmes de sécurité comparables ont du mal à faire.

Génération de données synthétiques (SDG)

La Génération de Données Synthétiques (SDG) a été utilisée pour compléter les données provenant de sources humaines. La SDG a contribué de plusieurs manières :

  • Augmenter la diversité des réponses en générant des sorties à partir de divers LLMs ou en incitant un LLM ou un VLM à adopter une autre personnalité lors de la génération d'une réponse.

  • Reformuler des réponses pour une plus grande pertinence culturelle.

  • Reformuler des prompts générés par des humains en modifiant le dialecte ou le ton de l'anglais.

  • Créer des prompts ou images de "jailbreak".

  • Générer divers types de refus.

De plus, la SDG a été essentielle pour acquérir des données très spécifiques qui seraient difficiles à obtenir de sources humaines, telles que des cas où des entrées sûres (prompts et images) ont conduit à des réponses non sûres. Des modèles ouverts comme Mixtral 8x 22B, Gemma 3-27B, et Microsoft Phi-4 ont été intégrés dans notre pipeline SDG.

Il est important de noter que les données synthétiques ne représentent qu'environ 10 % du total des données d'entraînement ; la majorité provient de sources humaines, y compris des prompts écrits manuellement et des images réelles.

NVIDIA a longtemps investi dans des technologies ouvertes pour la sécurité et les garde-fous des LLM. Le modèle de sécurité de contenu Nemotron 3 est la prochaine itération des modèles de sécurité de contenu ouverts de NVIDIA utilisant les travaux antérieurs réalisés dans ce domaine.

Nemotron 3 Content Safety a été évalué sur des benchmarks multimodaux et multilingues ouverts établis, y compris Polyguard, RTP-LX, VLGuard, MM SafetyBench, et Figstep. Ces benchmarks testent les scénarios auxquels les agents réels sont confrontés : conversations en langues mixtes, captures d'écran avec texte intégré, risques de sécurité visuellement motivés, et cas où le sens ne change que lorsque le texte et les images sont considérés ensemble.

À travers ces benchmarks, le modèle offre une précision de premier plan dans l'industrie pour sa taille. Dans les tests de contenu nuisible multimodal, il a atteint une précision moyenne de 84 %, surpassant les modèles de sécurité ouverts comparables.

Conclusion

Le modèle de sécurité de contenu Nemotron 3 est disponible sur Hugging Face, facilitant l'ajout de sécurité multimodale et multilingue à vos applications d'IA. Les développeurs peuvent charger le modèle via des interfaces standard de transformers ou vLLM et exécuter des vérifications de sécurité sur du texte, des images, ou les deux ensemble.

Le modèle peut être déployé à l'intérieur d'une boucle d'agent pour une modération synchrone, utilisé dans des pipelines par lots pour la révision de documents ou d'images, ou intégré comme une couche de sécurité dans des services personnalisés, aidant les équipes à fournir une modération multimodale précise et en temps réel à travers des bases d'utilisateurs mondiales.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires