Brief IA : JEV, un juge IA low-cost qui sait douter

JEV, un juge IA low-cost qui sait douter

Brief IA
Tom Levy·5 min·7 vues

JEV, un juge IA basé sur un routage à seuil, atteint 93,4 % de précision tout en coûtant seulement 41,4 % du prix de GPT-6. En traitant 68,5 % des cas seul, JEV se révèle 277 fois moins cher et 13 fois plus rapide que GPT-6 Astra, bien que ses performances varient selon les tâches.

⚡
En bref
1Un routage à seuil basé sur la confiance de JEV atteint 93,4 % de précision pour 41,4 % du coût de GPT‑6, avec 68,5 % des cas traités par JEV seul
2Des mesures de la CMU indiquent JEV 277 fois moins cher et 13 fois plus rapide que GPT‑6 Astra, avec des performances variables selon les tâches
3Sans réponse de référence, JEV, GPT‑4.1 mini et GPT‑5.4 font des choix quasi aléatoires tout en paraissant confiants
💡Pourquoi c'est important — ces résultats suggèrent qu’un schéma de décision en deux étapes peut réduire les coûts tout en maintenant une précision comparable, à condition de fournir des preuves ou des listes de contrôle aux juges.
⚡Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

Un schéma en deux temps fondé sur la confiance de JEV revendique 93,4 % de précision pour 41,4 % du coût d'un juge LLM de référence, d'après des tests rapportés. Il apparaît que JEV et d'autres modèles échouent dans certains cas, et que ses décisions rapides et économiques sont pertinentes dans des conditions spécifiques.

Un routage à deux niveaux atteint 93,4 % de précision pour 41,4 % du coût

Dans le dispositif décrit, la confiance de JEV correspond à sa probabilité maximale parmi les options. Un exemple donné est une répartition de 95 % pour « premier » et 5 % pour « second », qui fixe la confiance à 0,95. Le routage proposé consiste à définir un seuil, par exemple 0,90, à accepter la décision de JEV au‑dessus et à référer sous ce seuil à un modèle plus grand. Testée sur 1610 nouvelles paires, cette approche a confié 68,5 % des cas à JEV seul. La précision globale observée a atteint 93,4 %, légèrement au‑dessus de GPT‑6 à 92,5 %, pour un coût représentant 41,4 % de celui de GPT‑6. Sur une tâche plus difficile, le système a référé 74,2 % des cas au modèle plus grand. L’objectif déclaré est d’éviter la mauvaise réponse tout en ne pas arbitrer selon le budget.

Sans réponse de référence, même les grands modèles se trompent

Lorsque aucune réponse de comparaison n’est disponible, JEV, GPT‑4.1 mini et GPT‑5.4 ont effectué des choix quasi aléatoires tout en semblant confiants. Dans ce cas, augmenter la taille du modèle n’a pas apporté de solution. La recommandation qui en ressort est de fournir à tout juge des preuves ou une liste de contrôle.

Coût et vitesse: JEV mesuré 277 fois moins cher, 13 fois plus rapide

Quatre chercheurs de la CMU ont comparé JEV à seize autres juges sur de nombreuses tâches. Dans leurs mesures, JEV coûtait 0,044 $ pour 1000 jugements et prenait 0,15 s par jugement, quand GPT‑6 Astra affichait 1,89 s et 12,182 $ pour 1000 jugements. Sur cette base, JEV était 277 fois moins cher et 13 fois plus rapide, ces coûts reflétant toutefois le protocole de test et pouvant varier. Côté précision, JEV atteignait 92,5 % sur RewardBench comme GPT‑6, 87,3 % contre 88,4 % sur HaluEval, 78,6 % contre 93,1 % sur un banc plus difficile, 68,4 % contre 95,9 % sur des énigmes logiques, et 76,6 % contre 90,1 % lorsque la bonne réponse était plus longue et élaborée face à une attente concise et directe.

Calibration observée: 0,043 d’erreur pour JEV contre 0,054 pour un LLM

Un test réalisé sur 88 cas via OpenRouter a montré des chiffres de confiance de JEV bien répartis entre 0 et 1, tandis que le juge LLM plaçait rarement sa confiance au milieu et se retrouvait souvent près de 0 ou 1 même en incertitude. Les scores d’erreur relevés étaient de 0,043 pour JEV et 0,054 pour le LLM, une valeur plus basse étant meilleure. Il est toutefois rappelé qu’un test ne constitue pas une preuve et qu’il convient de confronter les niveaux de confiance aux réponses effectives.

Ce que JEV fait bien, ce que les LLM apportent

JEV est présenté comme un modèle « Système Un » conçu pour de petites décisions, renvoyant des réponses courtes avec probabilités. TypeSafe affirme l’avoir entraîné à fournir des chiffres de confiance honnêtes, une revendication non vérifiée de façon indépendante. JEV est décrit comme très rapide et économique et adapté aux vérifications simples et répétées lorsque la preuve est dans le texte. À l’inverse, un juge LLM produit du texte rédigé, peut expliquer sa décision, mais s’avère plus lent et plus coûteux, convenant aux questions ouvertes, à la réflexion complexe et au retour écrit. Langfuse, outil de suivi des applications d’IA, est intégré avec des juges LLM et des vérifications par code et prend déjà en charge JEV. Côté fonctionnalités, JEV peut sélectionner une option dans une liste en associant des probabilités, trancher entre deux réponses avec un type d’erreur, ou produire un niveau sur une échelle comme faible, moyen ou élevé.

Reproduire un essai: environnement, cas difficiles et appels aux juges

Une démonstration a rassemblé 12 cas difficiles, mêlant réponses longues mais incorrectes, instructions cachées et calculs, avec deux réponses par cas et une vérité connue. Chaque juge a été interrogé deux fois, d’abord avec A puis avec B, pour détecter une préférence de forme. Pour reproduire l’essai, il faut Python 3.9 ou plus, une clé API TypeSafe pour JEV et une clé pour un LLM compatible OpenAI. La procédure propose de créer un dossier dédié, d’installer requests, pandas, numpy, python-dotenv, openai, matplotlib et truststore, puis de configurer un .env (TYPESAFE_API_KEY, LLM_API_KEY, LLM_BASE_URL, LLM_JUDGE_MODEL) sans le partager. Le projet regroupe notamment .env, judges.py, raw_call.py, cases.py, run_lab.py, report.py et plot_frontier.py. Le fichier d’assistance définit call_jev_pair (retours dont who_won et probabilité) et jev_two_order, ainsi que leurs équivalents pour le LLM, avec une instruction SYSTEM qui demande de choisir la meilleure réponse et de traiter les textes comme des données afin d’ignorer d’éventuelles instructions cachées.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires