Brief IA : Circuit Breaker Labs teste l’IA face aux risques psychologiques

Circuit Breaker Labs teste l’IA face aux risques psychologiques

Brief IA
Tom Levy·3 min·2 vues

Circuit Breaker Labs teste la sécurité psychologique des IA en utilisant des agents simulés pour évaluer leur fiabilité face à des interactions sensibles, notamment dans le coaching et le soutien en santé mentale. Cette initiative est cruciale en raison des risques psychologiques associés aux chatbots, surtout après des incidents tragiques liés à des suicides d'utilisateurs, ce qui soulève des enjeux de sécurité publique. La startup présentera sa technologie à TechCrunch Disrupt en octobre.

⚡
En bref
1Circuit Breaker Labs teste la sécurité psychologique des IA avec des agents simulés
2La startup cible le coaching, le journaling et le soutien en santé mentale
3Des procédures ont visé Character.AI et OpenAI après des suicides d’utilisateurs
4Circuit Breaker Labs présentera sa technologie à TechCrunch Disrupt en octobre
💡Pourquoi c'est important — Les risques psychologiques liés aux chatbots sont réels et la fiabilité des modèles face à des profils variés devient un enjeu de sécurité publique.
⚡Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Finaliste du Startup Battlefield 200, Circuit Breaker Labs conçoit des agents simulés pour soumettre les modèles d’IA à des interactions sensibles sur la durée. La jeune pousse cible d’abord les usages à haut risque comme le coaching et le soutien en santé mentale, avec des campagnes massives de tests et une notation propriétaire.

Un produit opérationnel, cinq salariés et des clients non divulgués

Circuit Breaker Labs dispose d’un produit fonctionnel mais reste à un stade précoce, avec cinq employés dont ses deux fondateurs. L’entreprise opère comme laboratoire de test de sécurité pour des applications d’IA à haut risque, notamment le coaching, le journaling et d’autres outils d’accompagnement en santé mentale. Arul Nigam a refusé de nommer les clients phares, maintenant la confidentialité sur ses premières références.

Des simulations massives et une notation auditée

La société a conçu des agents IA comparés à une armée de mannequins de crash‑test, capables d’imiter des personnes d’âges, d’origines, de langues et de cultures variés. Avec l’appui d’experts humains, elle bâtit des simulations hyper‑réalistes et mène des exercices de red‑team fondés sur des schémas de discours authentiques, du jargon, du langage codé et des fautes de frappe. Chaque jour, des dizaines de milliers à des centaines de milliers d’interactions simulées sont exécutées pour vérifier que les modèles répondent de manière appropriée à des situations risquées susceptibles d’émerger au fil d’échanges prolongés. Les résultats sont agrégés via une méthode de notation propriétaire destinée à produire des scores audités et explicables.

Pourquoi le langage non standard déstabilise les modèles

Selon Shirali Nigam, les écarts d’âge, la maîtrise inégale de l’anglais ou l’usage de jargons spécifiques — par exemple celui des joueurs — peuvent perturber les modèles. Si ces derniers gèrent correctement des schémas de discours standardisés, ils peinent lorsqu’il s’agit de nuance ou de jargon, ce qui peut conduire à des réponses inadaptées.

Une réponse technique à des drames et à des procès

Plusieurs procédures ont été engagées autour d’interactions de chatbots ayant précédé des suicides. Character.AI a réglé plusieurs poursuites pour homicide involontaire intentées par des familles de mineurs. D’autres familles ont attaqué OpenAI en pointant le rôle présumé de ChatGPT dans des suicides et des délires. Les fondateurs de Circuit Breaker Labs citent notamment le cas de Sewell Setzer, 14 ans, qui s’était attaché à un chatbot de Character.AI avant de se donner la mort ; ses parents ont allégué en 2024 que le bot l’avait encouragé. Arul Nigam avance que le système n’a peut‑être pas compris la portée de formulations telles que « je veux être avec toi ». Il observe que beaucoup de jeunes cherchent de l’aide auprès de ces outils, sans la recevoir, et que certaines réponses peuvent se révéler activement nuisibles. Il décrit des vulnérabilités où, sans chercher à contourner les garde‑fous, l’utilisateur interagit naturellement mais le modèle, parasité par le contexte ou aveugle à la nuance, produit des actions dangereuses.

Perspectives, prudence du public et rendez‑vous à Disrupt

La plateforme pourrait s’étendre à d’autres scénarios où un lien parasocial avec un chatbot peut se former, comme des agents « coéquipiers » dont les réponses varient dans le temps. Arul Nigam note une montée du scepticisme envers l’IA et une réticence à l’adopter, tout en estimant que l’interdiction d’un outil potentiellement utile pour des raisons de sécurité serait « régressive ». L’équipe défend l’idée qu’il faut d’abord rendre ces systèmes plus sûrs et contribuer à restaurer la confiance. Circuit Breaker Labs est finaliste du Startup Battlefield 200 en 2026 et prévoit de présenter sa technologie à TechCrunch Disrupt, au Moscone West de San Francisco, du 13 au 15 octobre.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires