Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Crosby innove avec un outil d'évaluation pour l'IA juridique
Crosby, un cabinet d'avocats à la pointe de la technologie, a récemment dévoilé un outil novateur destiné à évaluer la performance des modèles d'intelligence artificielle dans le domaine juridique. Baptisé Redline Bench, ce référentiel a pour vocation d'aider les avocats à juger de la fiabilité des technologies IA dans la négociation de contrats.
Un secteur en quête de légitimité
Le secteur de la technologie juridique cherche à se faire reconnaître, mais pour cela, il doit prouver que ses outils peuvent penser comme des avocats. Crosby, qui se positionne à la fois comme une startup et un cabinet d'avocats, offre des services juridiques à des entreprises comme Cursor et Rogo. Avec le lancement du Redline Bench, l'entreprise vise à évaluer les modèles d'IA sur des tâches juridiques concrètes, en commençant par la révision de contrats.
L'IA face aux défis du droit
Ces dernières années, les ingénieurs ont constaté que les systèmes d'IA deviennent de plus en plus performants dans des tâches comme l'écriture de code. Les entreprises de technologie juridique espèrent désormais développer des IA capables de réviser des contrats, d'identifier des risques et de négocier des termes plus efficacement que les avocats humains. Cependant, le droit présente des défis uniques. Ryan Daniels, ancien avocat et fondateur de Crosby, souligne la difficulté de définir ce qui est "bon" ou "mauvais" dans le travail juridique, contrairement au codage où le succès est plus facilement mesurable.
La complexité de l'automatisation juridique
Cette ambiguïté complique les efforts d'automatisation du travail juridique. Des entreprises comme Anthropic ont tenté de séduire les avocats avec des outils spécifiques, attirant l'attention des investisseurs. Cependant, l'absence d'un référentiel commun pour évaluer la qualité du travail de l'IA reste un obstacle majeur.
La création d'un nouvel étalon
Pour répondre à ce besoin, Crosby a formé une équipe appelée Crosby Intelligence, composée d'ingénieurs et d'avocats, pour développer des agents et un référentiel d'évaluation. Parmi eux, Sharan Ramjee, expert en détection de fraude, et Ross Weiser, ancien avocat chez Sullivan & Cromwell, apportent leur expertise.
Collaboration avec Micro1
Crosby s'est associé à Micro1 pour recruter des avocats capables de définir les critères d'un bon travail juridique. Pour construire le référentiel, des avocats seniors ont simulé des transactions et noté les modifications de contrat cruciales, transformées ensuite en critères pondérés.
Un processus d'évaluation rigoureux
Lors des tests, les modèles d'IA reçoivent les mêmes contrats que ceux utilisés pour établir le référentiel, et leurs modifications sont comparées par un panel de juges. Le score final reflète la fréquence à laquelle les modèles effectuent les modifications jugées importantes par les avocats.
Transparence et publication des résultats
Le Redline Bench sera accessible à tous les laboratoires souhaitant tester leurs modèles selon les critères de Crosby. L'entreprise prévoit de publier régulièrement des rapports pour comparer les performances des principaux modèles.
Premiers résultats prometteurs
Dans la première série de tests, ChatGPT 5.5 a obtenu un score de 50,5%, indiquant que ses modifications correspondaient à la moitié des priorités des avocats. Gemini 3.5 Flash et Claude Opus 4.8 ont suivi avec respectivement 45,1% et 44,4%.
Un modèle prometteur retiré
Crosby a également testé Fable 5 d'Anthropic, qui a obtenu un score prometteur de 47,3% avant d'être retiré du marché. Une fois l'accès rétabli, Crosby prévoit de réévaluer ce modèle.
Une tendance à la mesure de la performance
Crosby n'est pas seul dans cette démarche. Harvey, une autre startup juridique, ainsi qu'Anthropic et OpenAI, développent également leurs propres référentiels pour évaluer la performance des IA sur des tâches concrètes. Cependant, Ryan Daniels met en garde contre la tentation des laboratoires d'ajuster leurs systèmes pour exceller sur leurs propres tests.
Enjeux financiers et confiance des avocats
Au-delà des scores, des milliards de dollars d'investissements dépendent de la capacité de l'IA à réduire les coûts juridiques et à alléger la charge de travail des conseillers juridiques. Pour que les avocats adoptent ces outils, ils doivent avoir confiance en leur fiabilité. Crosby s'efforce de leur fournir cette assurance.


