La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Les modèles d'intelligence artificielle (IA) qui alimentent la majorité des agents aujourd'hui sont principalement formés sur des données web en anglais. Cela pose un problème lorsqu'il s'agit de s'adapter aux spécificités culturelles et linguistiques d'autres pays, comme la Corée du Sud. En effet, ces modèles ne prennent pas en compte les structures honorifiques coréennes, les modèles d'occupation régionaux et le contexte culturel que les utilisateurs coréens attendent. Par exemple, un agent qui applique les flux de travail de santé américains au système de santé publique coréen n'est pas prêt pour la production et risque de ne pas répondre adéquatement aux besoins des utilisateurs coréens.
Pour remédier à cette situation, Nemotron-Personas-Korea a été créé. Ce jeu de données fournit 6 millions de personas entièrement synthétiques, ancrés dans des statistiques officielles et des données de référence provenant de sources telles que le Korean Statistical Information Service (KOSIS), la Cour suprême de Corée, le National Health Insurance Service, et l'Institut économique rural de Corée. NAVER Cloud a également contribué à ce projet en fournissant des données de référence et une expertise de domaine lors de la conception.
Chaque persona est démographiquement précis mais ne contient aucune information personnellement identifiable (PII), respectant ainsi la Loi coréenne sur la protection des informations personnelles (PIPA). La Corée du Sud est également l'un des rares pays à publier un guide officiel sur la génération de données synthétiques, établissant des règles pour ancrer des modèles avec des versions synthétiques de données sensibles. Ce jeu de données suit cette approche rigoureuse.
Dans ce tutoriel, nous allons transformer un persona synthétique en un agent coréen déployé — de la filtration du jeu de données à l'inférence — en environ 20 minutes en utilisant des API hébergées.
Un jeu de données souverain pour la Corée du Sud
Le jeu de données Nemotron-Personas-Korea est vaste et détaillé. Il se compose de 7 millions d'enregistrements, chacun contenant 26 champs différents. Ces champs incluent 7 champs de persona, 6 champs d'attributs de persona, 12 champs contextuels démographiques et géographiques, et 1 identifiant unique. La couverture géographique est complète, englobant toutes les 17 provinces coréennes et 25 districts. En termes de diversité de noms, le jeu de données contient environ 209 000 noms uniques, comprenant 118 noms de famille et environ 21 400 prénoms.
En plus de la diversité géographique et nominale, le jeu de données couvre plus de 2 000 catégories professionnelles, reflétant des secteurs variés tels que la technologie, la fabrication, le secteur public, ainsi que des domaines comme le sport, les arts, le voyage, et la cuisine. Les personas incluent des profils variés tels que des étudiants, des militaires, des employés, des chômeurs, et des retraités.
Nemotron-Personas-Korea a été généré en utilisant le NeMo Data Designer, un système d'IA composite open-source de NVIDIA pour les données synthétiques. Le pipeline associe un Modèle Graphique Probabiliste (Apache-2.0) pour l'ancrage statistique avec Gemma-4-31B pour la génération de récits en langue coréenne. Les données de population proviennent de KOSIS, couvrant les versions de 2020 à 2026, tandis que les distributions de noms proviennent de la Cour suprême de Corée.
Ce jeu de données est le dernier ajout à la Nemotron-Personas Collection, qui inclut également des jeux de données pour les États-Unis, le Japon, l'Inde, Singapour (en collaboration avec AI Singapore), le Brésil (avec WideLabs) et la France (avec Pleias). Pour ceux qui construisent un agent multilingue servant des utilisateurs coréens aux côtés d'autres marchés, il est possible de mélanger des personas de différents pays dans le même pipeline.
Pourquoi cela compte pour les agents autonomes
La plupart des agents aujourd'hui sont aveugles à l'identité. Ils suivent des instructions sans aucune ancre sur qui ils servent. Par exemple, un agent qui prend un rendez-vous dans un hôpital coréen en utilisant des conventions de planification américaines, ou qui s'adresse à un patient de 60 ans en utilisant le 반말 (“banmal”, langage informel), ne semble pas juste. Cela échoue.
Nemotron-Personas-Korea change cela en donnant à votre agent un contexte opérationnel coréen. Chargez un persona dans le prompt système et l'agent hérite de la région, de l'occupation, des normes de communication et de l'expertise de domaine de ce persona.
Cela fonctionne dans n'importe quel cadre d'agent. Déployez avec NemoClaw (la pile de référence open-source de NVIDIA pour les agents toujours actifs fonctionnant dans des environnements NVIDIA OpenShell, sur tout, des PC RTX aux DGX Spark), servez via NVIDIA NIM pour l'inférence en production, ou appelez directement l'API NVIDIA. La couche de persona est indépendante du cadre, agissant comme un prompt système bien structuré ancré dans de vraies données démographiques coréennes.
Tutoriel : D'un persona synthétique à un agent souverain
Le processus de création d'un agent IA coréen avec Nemotron-Personas-Korea commence par le chargement et l'exploration du jeu de données. Les développeurs peuvent filtrer les personas par occupation, région ou âge pour trouver ceux qui correspondent à leur domaine cible. Ensuite, ils définissent le comportement de l'agent en utilisant les données structurées des personas, ce qui permet à l'agent de raisonner comme un professionnel coréen.
Enfin, l'agent peut être déployé à l'aide de différentes options, telles que le Catalogue API NVIDIA, NVIDIA NIM pour l'inférence auto-hébergée, ou NemoClaw pour le déploiement d'agents toujours actifs.
Ce que l'ancrage change
Voici la même question — "독감 예방접종은 언제 맞아야 하나요?" (Quand devrais-je me faire vacciner contre la grippe ?) — répondue avec et sans ancrage de persona.
Sans Personas
- Répond en anglais / coréen générique
- Références CDC / directives mondiales
- "Visitez votre clinique locale"
Avec des Personas de travailleurs de la santé coréens
- Répond en 존댓말 naturel approprié pour une consultation de santé
- Références au calendrier des 보건소 coréens, programme national de vaccination
- "가까운 보건소에서 무료 접종이 가능합니다" avec contexte régional
- Cite la politique de santé publique coréenne, utilise un coréen médical professionnel
Le persona va au-delà de la traduction — il contextualise et aboutit à un agent en qui vos utilisateurs auront confiance.
Venez construire avec nous à Séoul
Les NVIDIA Nemotron Developer Days se déroulent à Séoul aujourd'hui et demain, 21-22 avril 2026 — la première fois que cet événement a lieu en dehors de GTC. Deux jours d'activités, y compris des sessions techniques sur l'IA souveraine et les modèles ouverts, ainsi qu'un hackathon pratique où vous aurez l'occasion d'utiliser Nemotron-Personas-Korea pour construire des agents coréens spécifiques à un domaine et un claw. 🦞
Participez en personne ou via livestream. Partagez ce que vous construisez pour avoir une chance d'être présenté dans un futur tutoriel NVIDIA.