Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un test utilisateur détaille comment Muse, l’agent personnel de Meta, gère rendez-vous, briefings familiaux et objectifs tout en cadrant finement les permissions. En parallèle, Warp met en scène ses « usines » capables de transformer une demande Slack en pull request, qu’il dit prête en 35 minutes, avec une revue humaine qui arrive des heures plus tard. Deux visions de l’IA, grand public et ingénierie, se rencontrent sur la transparence, les limites du navigateur et des métriques très concrètes.
Chez Warp, la revue humaine arrive 3,5 h après une PR générée en 35 min
Warp indique que les humains chargés de la revue de code constituent désormais le principal goulet d’étranglement dans son processus d’ingénierie. Selon l’entreprise, la première révision humaine intervient en moyenne 3,5 heures après la création d’une pull request, tandis que l’usine Wilson met 35 minutes pour passer du lancement à la PR. Du côté grand public, Claire considère que l’usage du navigateur reste le point faible des agents, citant l’exemple où Muse n’a pas réussi à acheter des New Balance 9060 d’une couleur précise, renvoyant des résultats incorrects et ne finalisant pas l’achat.
Permissions contextuelles et journal d’activité détaillé au cœur de Muse
Claire explique que Muse demande l’autorisation précisément lorsque l’accès s’avère nécessaire, valide les informations obtenues et sollicite une confirmation supplémentaire avant toute action. L’agent ne requiert pas d’emblée un accès total et ne bombarde pas l’utilisateur de requêtes d’approbation répétées. Claire estime que la manière de demander la permission compte autant que ce que l’agent peut faire une fois l’accès accordé. Muse fournit un fil d’activité qui enregistre les appels d’outils, scripts, recherches et étapes individuelles. Claire pense que la plupart des consommateurs ignoreront ce fil, mais que les développeurs et utilisateurs avancés y trouveront une grande valeur. Lors de son test, Muse ne l’a ni exposée à un terminal, ni confrontée à des erreurs confuses, ni sollicitée au mauvais moment.
Du Slack à la fusion : Wilson enchaîne tickets Linear, QA et PR sans clavier
Zach Lloyd démontre que Warp Factories transforme une requête envoyée sur Slack en une pull request qui sera ensuite suivie, testée et fusionnée. L’usine Wilson gère l’ensemble du processus : triage, ouverture de tickets Linear, développement, génération de pull requests, vérification informatique (QA) et fusion, tout cela sans qu’aucune saisie au clavier ne soit nécessaire de la part d’un humain. Warp indique qu’une première pull request peut être disponible en 35 minutes et que ses usines traitent 2 000 pull requests chaque mois. Pour les usages domestiques, Muse a, dès la première tentative, généré le meilleur briefing familial de Claire, sous forme de PDF plus soigné et structuré, avec une section « Parler à la table » et la détection proactive des conflits d’agenda. Pour les objectifs personnels, Muse a collecté du contexte sur plusieurs échanges, créé un rappel et traité l’objectif comme un suivi continu.
Mesurer et améliorer : juge IA, rejouage de tâches et Pareto chez Warp
Warp propose de suivre les interactions humaines par pull request comme indicateur d’efficacité d’une usine, et présente l’usine comme couvrant l’ensemble du cycle de développement dans le cloud. Selon l’entreprise, le modèle de référence le plus pertinent provient des réalisations antérieures de l’organisation plutôt que des classements publics. Elle répète l’exécution de tâches d’usine réelles avec diverses configurations de modèles, les soumet à la même méthode d’évaluation utilisée en production et positionne les compromis entre coût et qualité sur un diagramme de Pareto. Warp précise également que les usines progressent lorsque leur configuration est intégrée au code : une boucle d’apprentissage rassemble les exécutions ayant échoué jusqu’à dégager un motif récurrent. Une couche de notation et un juge IA évaluent chaque exécution sur plusieurs dimensions, dont la création de tests redondants.
Design grand public de Muse et usages métiers parallèles chez Warp
Claire considère que l’originalité de Muse pour un public non technique résulte de l’expérience en design acquise chez Meta. L’agent privilégie un langage accessible et évite des termes spécialisés comme crons, outils, artefacts, plugins et connecteurs, structurant l’interface autour d’un fil, d’idées, d’objectifs et d’une bibliothèque. Elle mentionne également un avatar animé conçu pour l’IA, qui utilise un petit ordinateur pour exécuter des tâches et une sphère pour générer des médias. En entreprise, Zach Lloyd précise que l’IA apporte davantage de valeur en dehors de l’ingénierie lorsqu’elle accède à des données métiers concrètes, et il montre en temps réel trois tâches réalisées simultanément pour repérer des questions clients et des priorités concernant le site et le support commercial. Warp souligne aussi que les tâches Wilson s’effectuent dans un canal Slack partagé, ce qui permet aux collaborateurs juniors d’apprendre en observant les utilisateurs aguerris, sans avoir besoin d’un programme de formation structuré.





